Gemini 2.5 Pro: un modello che pensa prima di rispondere
· 3 min di lettura
Scritto con l'intelligenza artificiale
Il 25 marzo Google ha presentato Gemini 2.5 Pro sperimentale, modello di ragionamento primo su LMArena con finestra di contesto da un milione di token. Cosa sa fare e come cambiano i prompt quando tutti i modelli ragionano.
Martedì 25 marzo Google ha presentato Gemini 2.5 Pro, in versione sperimentale, e lo ha definito il suo modello più intelligente. È il primo della famiglia Gemini 2.5, e porta una dichiarazione d'intenti precisa: d'ora in poi i modelli di Google avranno il ragionamento incorporato. Dopo o1, DeepSeek-R1 e Claude 3.7 Sonnet, il «pensare prima di rispondere» diventa lo standard dei modelli di punta.
Che cosa sa fare Gemini 2.5 Pro?
Gemini 2.5 Pro è un modello di ragionamento: prima di rispondere elabora il problema, valuta le alternative e solo dopo produce il risultato. Secondo Koray Kavukcuoglu, CTO di Google DeepMind, la qualità nasce dalla combinazione di un modello di base molto migliorato con un addestramento successivo più raffinato.
I numeri dichiarati da Google:
- è primo nella classifica LMArena, basata sulle preferenze delle persone, con un margine significativo;
- ottiene il 18,8% su Humanity's Last Exam, un test costruito per mettere in difficoltà i modelli, senza usare strumenti esterni;
- raggiunge il 63,8% su SWE-bench Verified, il test di programmazione su problemi reali, dove secondo TechCrunch resta dietro a Claude 3.7 Sonnet (70,3%);
- guida diversi test di matematica e scienze, come GPQA e AIME 2025.
È multimodale in modo nativo: lavora su testo, audio, immagini, video e interi archivi di codice.
Un milione di token: che cosa significa?
La finestra di contesto di Gemini 2.5 Pro è di un milione di token, e Google annuncia che presto arriverà a due milioni. TechCrunch lo traduce in circa 750.000 parole in inglese: diversi libri, un intero archivio di contratti, ore di trascrizioni di riunioni.
Per chi progetta sistemi con l'AI è una possibilità enorme, ma non elimina il lavoro di progettazione: lo sposta. Più materiale si mette nel contesto, più conta dire con precisione che cosa cercare e come usarlo. Caricare cento documenti e chiedere «riassumi» produce un riassunto generico. Funziona molto meglio un prompt che indica il ruolo dei materiali:
Ti allego i verbali delle riunioni commerciali degli ultimi sei mesi. Individua le obiezioni dei clienti che si ripetono in almeno tre riunioni diverse. Per ciascuna indica la data dei verbali in cui compare, cita la frase esatta e proponi una risposta che il team potrebbe usare. Non includere obiezioni citate una sola volta.
Chiedere di citare la fonte di ogni affermazione è il modo più semplice per controllare il risultato e ridurre il rischio di allucinazioni, soprattutto quando i documenti sono troppi per rileggerli tutti.
Dove si può provare?
Gemini 2.5 Pro sperimentale è già disponibile in Google AI Studio, l'ambiente gratuito per sviluppatori, e nell'app Gemini per gli abbonati a Gemini Advanced, da computer e da smartphone. L'arrivo su Vertex AI, la piattaforma per le aziende, è previsto nelle prossime settimane, e i prezzi dell'API non sono ancora stati comunicati.
Trattandosi di una versione sperimentale, conviene usarla per prove e confronti, non per processi critici: il comportamento può cambiare prima del rilascio definitivo.
Che cosa cambia per chi lavora con i prompt?
In tre mesi i modelli di ragionamento sono passati da novità a regola. Tre indicazioni pratiche.
Meno istruzioni sul come, più chiarezza sul cosa. I modelli che ragionano da soli rendono meno utile la richiesta di ragionare passo passo. Servono invece obiettivo, vincoli, criteri di qualità e formato della risposta.
Prompt portabili. Con almeno quattro modelli di ragionamento di alto livello sul mercato, un sistema di prompt legato a un solo fornitore è fragile. Conviene scrivere istruzioni chiare e strutturate, che funzionino ovunque, e tenere un piccolo insieme di casi di prova da far girare su ogni modello nuovo.
Il confronto come metodo. Prima di scegliere, si prende lo stesso compito reale, lo si affida a due o tre modelli e si confrontano i risultati con criteri decisi in anticipo. Le classifiche dicono quale modello è più bravo in media; solo una prova sui propri casi dice quale è più adatto al proprio lavoro.
Fonti
- Google, Gemini 2.5: Our newest Gemini model with thinking, 25 marzo 2025
- TechCrunch, Google unveils a next-gen family of AI reasoning models, 25 marzo 2025