Modello multimodale

Detto anche: AI multimodale, multimodal model, LMM

Modello di AI capace di ricevere, comprendere e combinare tipi di informazione diversi, come testo, immagini, audio, video e codice, invece del solo testo.

In breve

Che cos'è un modello multimodale?

I primi modelli linguistici lavoravano solo con il testo: si scriveva una domanda e si riceveva una risposta scritta. Un modello multimodale accetta e combina anche altri tipi di informazione, come immagini, audio, video e codice. Può descrivere una foto, leggere un grafico, interpretare uno schema disegnato a mano. Nel marzo 2023 OpenAI ha presentato GPT-4 come un modello che accetta in ingresso testo e immagini.

Che cosa vuol dire «nativamente multimodale»?

Secondo Google, finora i modelli multimodali nascevano spesso unendo componenti addestrati separatamente per ciascun tipo di dato. Gemini, presentato il 6 dicembre 2023, è stato invece addestrato fin dall'inizio su testo, codice, audio, immagini e video. Google sostiene che questo approccio migliori il ragionamento quando le informazioni arrivano da fonti diverse.

Come cambia il prompt?

Con un modello multimodale il prompt non è più solo una frase: è un insieme di testo e materiali. Conviene dire al modello dove guardare, chiedergli di descrivere ciò che vede prima di trarre conclusioni e di separare ciò che è visibile da ciò che deduce. Per i testi poco leggibili è utile chiedere di segnalarli invece di indovinarli. Anche i materiali vanno scelti con cura: un'immagine nitida e ritagliata sulla parte che interessa vale più di molte parole di spiegazione.

Esempio pratico

Si carica la foto della lavagna di una riunione e si chiede: «Trascrivi fedelmente il testo leggibile, segna con [illeggibile] le parti che non riesci a leggere, poi proponi un elenco di azioni con responsabile solo se il nome compare sulla lavagna».

Differenze con Modello solo testuale

Confronto tra Modello multimodale e Modello solo testuale
AspettoModello multimodaleModello solo testuale
IngressoTesto, immagini, audio, video, codiceSolo testo
Esempi di usoLeggere grafici, foto di documenti, schemiScrivere, riassumere, tradurre testi
PromptTesto più materiali da indicare con precisioneSolo istruzioni scritte

Domande frequenti

ChatGPT è un modello multimodale?

GPT-4 accetta testo e immagini, e nella versione a pagamento di ChatGPT si possono caricare immagini. Il modello gratuito, GPT-3.5, lavora solo con il testo.

Gemini si può già usare in italiano?

A dicembre 2023 Gemini Pro è dentro Bard solo in inglese. Chi usa Bard in italiano per ora non lavora con Gemini.

Fonti

  1. GPT-4 Technical Report (2023)
  2. Introducing Gemini: our largest and most capable AI model (2023)

Vedi anche

Articoli che ne parlano