Gemini: Google presenta il suo modello multimodale

· 4 min di lettura

Scritto con l'intelligenza artificiale

Il 6 dicembre Google ha presentato Gemini 1.0 in tre taglie, Ultra, Pro e Nano, addestrato fin dall'inizio su testo, immagini, audio e video. Gemini Pro è in Bard, ma solo in inglese. Come cambiano i prompt con i modelli multimodali.

Ieri, 6 dicembre, Google ha presentato Gemini, il modello che la società definisce il più grande e capace mai costruito. È la prima vera risposta a GPT-4 da parte di Google DeepMind, e porta con sé una parola che sentiremo spesso nei prossimi mesi: multimodale.

Che cosa ha annunciato Google

Gemini 1.0 arriva in tre taglie, pensate per usi diversi:

Secondo Google, Gemini Ultra supera i migliori risultati precedenti in 30 dei 32 test accademici più usati per valutare i modelli linguistici. Con un punteggio del 90,0% nel test MMLU, che copre 57 materie come matematica, fisica, storia, diritto, medicina ed etica, sarebbe il primo modello a superare gli esperti umani. Sono risultati dichiarati dall'azienda e andranno verificati sul campo, ma il segnale è chiaro: la corsa è di nuovo aperta.

Dove si può provare

Gemini Pro è già dentro Bard, in una versione messa a punto per ragionamento, pianificazione e comprensione: Google lo definisce il più grande aggiornamento di Bard dalla nascita. C'è però un limite importante per noi: la novità è disponibile in inglese, in oltre 170 paesi e territori. Chi usa Bard in italiano, quindi, per ora non lavora con Gemini.

Gemini Nano arriva sul Pixel 8 Pro, il primo smartphone a usarlo. Dal 13 dicembre gli sviluppatori e le aziende potranno usare Gemini Pro tramite API, con Google AI Studio e Google Cloud Vertex AI. Gemini Ultra, invece, arriverà all'inizio del prossimo anno in Bard Advanced, dopo ulteriori controlli di sicurezza.

Che cosa vuol dire «nativamente multimodale»

Qui sta la novità più interessante. Finora, spiega Google, i modelli capaci di gestire testo e immagini nascevano spesso unendo componenti addestrati separatamente per ciascun tipo di dato. Gemini è stato invece addestrato fin dall'inizio su tipi di informazione diversi: testo, codice, audio, immagini e video. È quello che chiamiamo un modello multimodale in senso pieno.

Google sottolinea anche che nei test sulle immagini Gemini Ultra ha superato i modelli precedenti senza l'aiuto di sistemi OCR, cioè senza dover prima trasformare in testo ciò che è scritto in un'immagine.

Che cosa cambia per chi scrive prompt

Quando il modello vede, ascolta e legge, anche il prompt cambia natura. Non è più solo una frase: è una combinazione di testo, immagini, documenti, forse audio. E vanno progettati tutti insieme.

Tre principi da provare già oggi con gli assistenti che accettano immagini, osservando dove il modello sbaglia:

Un esempio, con la foto di una lavagna scattata alla fine di una riunione:

Nell'immagine c'è la lavagna della nostra riunione di progetto. Prima trascrivi fedelmente tutto il testo leggibile, mantenendo l'ordine e i raggruppamenti. Segna con [illeggibile] le parti che non riesci a leggere, senza tentare di indovinarle. Poi, separatamente, proponi un elenco di azioni con responsabile, se il nome compare sulla lavagna.

Il consiglio operativo

Non serve aspettare Gemini Ultra per prepararsi. Fate l'inventario dei materiali non testuali che passano ogni giorno per le vostre mani: foto di documenti, schemi, grafici, registrazioni di riunioni, screenshot. Sono i primi candidati per i flussi di lavoro multimodali. Per ciascuno annotate che cosa vorreste ottenere e quali errori sarebbero inaccettabili: sarà la base dei vostri prompt quando questi modelli saranno disponibili anche in italiano.

La competizione tra Google, OpenAI e gli altri fa bene a chi usa l'AI. Ma il vantaggio non andrà a chi sceglie il modello più forte: andrà a chi avrà progettato i propri flussi in modo da poter cambiare modello senza ricominciare da capo.

Fonti

#Google Gemini