Modello multimodale
Detto anche: AI multimodale, multimodal model, LMM
Modello di AI capace di ricevere, comprendere e combinare tipi di informazione diversi, come testo, immagini, audio, video e codice, invece del solo testo.
In breve
- Lavora con più tipi di dati: testo, immagini, audio, video, codice.
- Può rispondere a domande su una foto, un grafico o un documento scansionato.
- GPT-4 accetta testo e immagini; Gemini, presentato da Google il 6 dicembre 2023, è stato addestrato fin dall'inizio su più modalità.
- Il prompt diventa una combinazione di testo e altri materiali, da progettare insieme.
Che cos'è un modello multimodale?
I primi modelli linguistici lavoravano solo con il testo: si scriveva una domanda e si riceveva una risposta scritta. Un modello multimodale accetta e combina anche altri tipi di informazione, come immagini, audio, video e codice. Può descrivere una foto, leggere un grafico, interpretare uno schema disegnato a mano. Nel marzo 2023 OpenAI ha presentato GPT-4 come un modello che accetta in ingresso testo e immagini.
Che cosa vuol dire «nativamente multimodale»?
Secondo Google, finora i modelli multimodali nascevano spesso unendo componenti addestrati separatamente per ciascun tipo di dato. Gemini, presentato il 6 dicembre 2023, è stato invece addestrato fin dall'inizio su testo, codice, audio, immagini e video. Google sostiene che questo approccio migliori il ragionamento quando le informazioni arrivano da fonti diverse.
Come cambia il prompt?
Con un modello multimodale il prompt non è più solo una frase: è un insieme di testo e materiali. Conviene dire al modello dove guardare, chiedergli di descrivere ciò che vede prima di trarre conclusioni e di separare ciò che è visibile da ciò che deduce. Per i testi poco leggibili è utile chiedere di segnalarli invece di indovinarli. Anche i materiali vanno scelti con cura: un'immagine nitida e ritagliata sulla parte che interessa vale più di molte parole di spiegazione.
Esempio pratico
Si carica la foto della lavagna di una riunione e si chiede: «Trascrivi fedelmente il testo leggibile, segna con [illeggibile] le parti che non riesci a leggere, poi proponi un elenco di azioni con responsabile solo se il nome compare sulla lavagna».
Differenze con Modello solo testuale
| Aspetto | Modello multimodale | Modello solo testuale |
|---|---|---|
| Ingresso | Testo, immagini, audio, video, codice | Solo testo |
| Esempi di uso | Leggere grafici, foto di documenti, schemi | Scrivere, riassumere, tradurre testi |
| Prompt | Testo più materiali da indicare con precisione | Solo istruzioni scritte |
Domande frequenti
ChatGPT è un modello multimodale?
GPT-4 accetta testo e immagini, e nella versione a pagamento di ChatGPT si possono caricare immagini. Il modello gratuito, GPT-3.5, lavora solo con il testo.
Gemini si può già usare in italiano?
A dicembre 2023 Gemini Pro è dentro Bard solo in inglese. Chi usa Bard in italiano per ora non lavora con Gemini.
Fonti
Vedi anche
- LLM (Large Language Model): Un modello linguistico di grandi dimensioni (in inglese large language model, LLM) è un sistema di intelligenza artificiale addestrato su en...
- Prompt: Il prompt è il testo con cui chiediamo qualcosa a un'intelligenza artificiale generativa: una domanda, un'istruzione, un compito, a volte ac...
- Token: Il token è il pezzo di testo con cui un modello linguistico legge e scrive: può essere una parola intera, una parte di parola, un segno di p...
- Transformer: Il transformer è l'architettura di rete neurale alla base dei modelli linguistici moderni come GPT, Claude e Gemini. Presentata da ricercato...