Gemini: Google presenta il suo modello multimodale
· 4 min di lettura
Scritto con l'intelligenza artificiale
Il 6 dicembre Google ha presentato Gemini 1.0 in tre taglie, Ultra, Pro e Nano, addestrato fin dall'inizio su testo, immagini, audio e video. Gemini Pro è in Bard, ma solo in inglese. Come cambiano i prompt con i modelli multimodali.
Ieri, 6 dicembre, Google ha presentato Gemini, il modello che la società definisce il più grande e capace mai costruito. È la prima vera risposta a GPT-4 da parte di Google DeepMind, e porta con sé una parola che sentiremo spesso nei prossimi mesi: multimodale.
Che cosa ha annunciato Google
Gemini 1.0 arriva in tre taglie, pensate per usi diversi:
- Gemini Ultra, il modello più grande e capace, per i compiti più complessi;
- Gemini Pro, il modello per la maggior parte delle attività;
- Gemini Nano, il più efficiente, che gira direttamente sui dispositivi.
Secondo Google, Gemini Ultra supera i migliori risultati precedenti in 30 dei 32 test accademici più usati per valutare i modelli linguistici. Con un punteggio del 90,0% nel test MMLU, che copre 57 materie come matematica, fisica, storia, diritto, medicina ed etica, sarebbe il primo modello a superare gli esperti umani. Sono risultati dichiarati dall'azienda e andranno verificati sul campo, ma il segnale è chiaro: la corsa è di nuovo aperta.
Dove si può provare
Gemini Pro è già dentro Bard, in una versione messa a punto per ragionamento, pianificazione e comprensione: Google lo definisce il più grande aggiornamento di Bard dalla nascita. C'è però un limite importante per noi: la novità è disponibile in inglese, in oltre 170 paesi e territori. Chi usa Bard in italiano, quindi, per ora non lavora con Gemini.
Gemini Nano arriva sul Pixel 8 Pro, il primo smartphone a usarlo. Dal 13 dicembre gli sviluppatori e le aziende potranno usare Gemini Pro tramite API, con Google AI Studio e Google Cloud Vertex AI. Gemini Ultra, invece, arriverà all'inizio del prossimo anno in Bard Advanced, dopo ulteriori controlli di sicurezza.
Che cosa vuol dire «nativamente multimodale»
Qui sta la novità più interessante. Finora, spiega Google, i modelli capaci di gestire testo e immagini nascevano spesso unendo componenti addestrati separatamente per ciascun tipo di dato. Gemini è stato invece addestrato fin dall'inizio su tipi di informazione diversi: testo, codice, audio, immagini e video. È quello che chiamiamo un modello multimodale in senso pieno.
Google sottolinea anche che nei test sulle immagini Gemini Ultra ha superato i modelli precedenti senza l'aiuto di sistemi OCR, cioè senza dover prima trasformare in testo ciò che è scritto in un'immagine.
Che cosa cambia per chi scrive prompt
Quando il modello vede, ascolta e legge, anche il prompt cambia natura. Non è più solo una frase: è una combinazione di testo, immagini, documenti, forse audio. E vanno progettati tutti insieme.
Tre principi da provare già oggi con gli assistenti che accettano immagini, osservando dove il modello sbaglia:
- Dite al modello dove guardare. Una foto contiene molte informazioni: indicate quale parte vi interessa e perché.
- Prima la descrizione, poi la conclusione. Chiedere di descrivere ciò che si vede prima di trarre conclusioni rende visibili gli errori di lettura, con la stessa logica del ragionamento passo passo.
- Chiedete di separare ciò che si vede da ciò che si deduce. È il modo più semplice per accorgersi quando il modello sta indovinando.
Un esempio, con la foto di una lavagna scattata alla fine di una riunione:
Nell'immagine c'è la lavagna della nostra riunione di progetto. Prima trascrivi fedelmente tutto il testo leggibile, mantenendo l'ordine e i raggruppamenti. Segna con [illeggibile] le parti che non riesci a leggere, senza tentare di indovinarle. Poi, separatamente, proponi un elenco di azioni con responsabile, se il nome compare sulla lavagna.
Il consiglio operativo
Non serve aspettare Gemini Ultra per prepararsi. Fate l'inventario dei materiali non testuali che passano ogni giorno per le vostre mani: foto di documenti, schemi, grafici, registrazioni di riunioni, screenshot. Sono i primi candidati per i flussi di lavoro multimodali. Per ciascuno annotate che cosa vorreste ottenere e quali errori sarebbero inaccettabili: sarà la base dei vostri prompt quando questi modelli saranno disponibili anche in italiano.
La competizione tra Google, OpenAI e gli altri fa bene a chi usa l'AI. Ma il vantaggio non andrà a chi sceglie il modello più forte: andrà a chi avrà progettato i propri flussi in modo da poter cambiare modello senza ricominciare da capo.
Fonti
- Google, Introducing Gemini: our largest and most capable AI model, 6 dicembre 2023
- Google, Bard gets its biggest upgrade yet with Gemini, 6 dicembre 2023