Gemini 2.0 e l'era degli agenti
· 4 min di lettura
Scritto con l'intelligenza artificiale
Google presenta Gemini 2.0 Flash, Deep Research in Gemini Advanced e i prototipi Astra e Mariner. Cosa c'è di concreto e quali regole per gli agenti conviene adottare anche nei nostri progetti.
Ieri, 11 dicembre, Google ha presentato Gemini 2.0, e lo ha fatto con una parola precisa: è un modello pensato per «l'era degli agenti». Sundar Pichai spiega così il termine: modelli che capiscono di più del mondo intorno a noi, ragionano su più passaggi in anticipo e agiscono per nostro conto, «con la nostra supervisione».
Dopo il computer use di Claude a ottobre e gli agenti di Copilot Studio, anche Google mette gli agenti al centro. Vediamo cosa c'è di concreto.
Che cosa arriva oggi?
Il primo modello della famiglia è Gemini 2.0 Flash, in versione sperimentale. Secondo Google supera Gemini 1.5 Pro nei test principali andando al doppio della velocità. Oltre a leggere testo, immagini, video e audio, può generare in modo nativo immagini e voce, e sa usare da solo strumenti come la Ricerca Google e l'esecuzione di codice.
Gli sviluppatori lo trovano già in Google AI Studio e Vertex AI; la disponibilità generale è prevista a gennaio. Chi usa Gemini può già provarlo sul web, in una versione ottimizzata per la chat; Google avverte che, essendo sperimentale, potrebbe non funzionare sempre come previsto.
Deep Research: la ricerca che si pianifica
La novità più utile da subito, per chi ha Gemini Advanced, si chiama Deep Research (per ora basata su Gemini 1.5 Pro, non sul nuovo modello). Si pone una domanda di ricerca e Gemini non risponde subito: prepara un piano di ricerca in più passaggi, che possiamo modificare o approvare. Poi consulta il web per qualche minuto e consegna un rapporto con i link alle fonti, esportabile in Google Docs.
Per ora funziona solo in inglese, sul computer e sul web da mobile. Ma l'idea è importante: il piano diventa visibile e modificabile. È la stessa logica del ragionamento passo passo, solo che ora i passi li vediamo prima che vengano eseguiti, e possiamo correggerli.
Per chi progetta prompt, il lavoro si sposta sul piano. Un esempio di richiesta ben impostata:
Analizza i principali fornitori europei di software per la gestione delle note spese nelle PMI. Mi interessano prezzi pubblici, integrazioni con i gestionali e conformità al GDPR. Escludi comunicati stampa e articoli sponsorizzati. Nel rapporto separa i fatti verificati dalle stime.
E poi, quando arriva il piano, leggerlo davvero: togliere i passaggi inutili, aggiungere quelli mancanti. Un piano sbagliato produce un rapporto ben scritto e fuori fuoco.
Astra e Mariner: gli agenti in prova
Google ha mostrato anche due prototipi di agente AI, per ora riservati a gruppi di tester:
- Project Astra, l'assistente universale che vede attraverso la fotocamera del telefono: ora conversa in più lingue, usa Ricerca, Lens e Maps e ricorda fino a 10 minuti di conversazione nella stessa sessione.
- Project Mariner, un'estensione di Chrome che legge lo schermo del browser e compie azioni: scrive, scorre, clicca. Sul test WebVoyager, che misura compiti reali sul web, ottiene l'83,5%.
Mariner è interessante soprattutto per i limiti che Google gli ha dato. Agisce solo nella scheda attiva, chiede una conferma finale prima di azioni delicate come un acquisto e, secondo la prova di TechCrunch, non inserisce numeri di carta di credito né accetta cookie o condizioni d'uso. È anche lento: alcuni secondi tra un movimento del cursore e l'altro. Il direttore tecnico di Google DeepMind lo giustifica così: dato che il modello agisce per conto dell'utente, è importante procedere un passo alla volta.
Cosa impariamo da questi limiti
Google dichiara di tenere le persone dentro il processo, secondo la logica dello human in the loop, e cita tra i rischi le istruzioni malevole nascoste nei contenuti esterni e il phishing. Sono gli stessi rischi che Anthropic aveva indicato per Claude. Il settore sta convergendo su alcune regole comuni, e conviene adottarle anche nei nostri progetti:
- l'agente agisce in uno spazio delimitato (una scheda, un ambiente di prova, un elenco di strumenti);
- le azioni irreversibili richiedono una conferma umana;
- il piano si vede prima dell'esecuzione, così si corregge quando costa poco.
Cosa cambia per chi lavora con l'AI
Il 2024 si chiude con tutti i grandi attori impegnati sugli agenti. Per chi lavora con i prompt il cambio è netto: non si scrive più solo una richiesta, si scrive un incarico. Obiettivo, perimetro, fonti ammesse, criteri di qualità, punti in cui fermarsi.
È il lavoro del Prompt Architect: progettare il sistema in cui l'AI agisce, non soltanto la frase con cui le parliamo.
Fonti
- Google, Introducing Gemini 2.0: our new AI model for the agentic era, 11 dicembre 2024
- Google, Try Deep Research and our new experimental model in Gemini, your AI assistant, 11 dicembre 2024
- TechCrunch, Google unveils Project Mariner: AI agents to use the web for you, 11 dicembre 2024