GPT-4o: voce, immagini e testo in un solo modello
· 3 min di lettura
Scritto con l'intelligenza artificiale
OpenAI presenta GPT-4o, un solo modello per testo, immagini e voce, disponibile anche per chi usa ChatGPT gratis. Che cosa si può usare subito, che cosa arriverà, e come cambiano i prompt con le immagini.
Lunedì 13 maggio OpenAI ha presentato GPT-4o, il nuovo modello di punta che alimenta ChatGPT. La «o» sta per «omni»: un solo modello che ragiona su testo, immagini e voce. E per la prima volta un modello di livello GPT-4 arriva anche a chi usa ChatGPT gratis.
Per chi progetta il lavoro con l'AI è una notizia doppia: cambia che cosa si può chiedere al modello, e cambia chi può chiederlo.
Che cosa ha di nuovo GPT-4o?
Finora la modalità vocale di ChatGPT funzionava come una catena di tre modelli: uno trascriveva l'audio in testo, uno (GPT-3.5 o GPT-4) scriveva la risposta, un terzo la trasformava di nuovo in voce. Il risultato richiedeva fino a 5,4 secondi di attesa, e per strada si perdevano tono, pause, emozioni.
GPT-4o è invece un modello multimodale addestrato su testo, immagini e audio insieme: riceve qualunque combinazione di questi formati e può rispondere allo stesso modo. Secondo OpenAI risponde a un input vocale in appena 232 millisecondi, con una media di 320, tempi simili a quelli di una conversazione tra persone. Nelle dimostrazioni lo si poteva interrompere mentre parlava, e il modello coglieva le sfumature della voce.
Altri dati annunciati: prestazioni migliori in una cinquantina di lingue e, per gli sviluppatori, un modello due volte più veloce e a metà prezzo rispetto a GPT-4 Turbo.
Che cosa si può usare da oggi?
Qui serve precisione, perché l'annuncio è più ampio di ciò che è già disponibile.
- Testo e immagini con GPT-4o arrivano a tutti, compresi gli utenti gratuiti, con un limite di messaggi. Superato il limite, ChatGPT torna a GPT-3.5.
- Gli utenti gratuiti ottengono anche funzioni finora riservate agli abbonati: ricerca sul web, analisi di dati e file, la memoria e il GPT Store con i GPT creati da altri.
- Gli abbonati Plus e Team hanno limiti cinque volte più alti.
- La nuova modalità vocale, quella delle dimostrazioni, non c'è ancora: OpenAI la promette in versione alpha per gli abbonati Plus nelle prossime settimane. Nelle API, audio e video saranno aperti prima a un piccolo gruppo di partner.
- Arriva anche un'app per macOS, prima per gli abbonati Plus, che permette di fare domande su ciò che appare sullo schermo.
Prompt con le immagini: come cambiano
La multimodalità non è un dettaglio tecnico: sposta il prompt dal solo testo a una combinazione di materiali. Una foto della lavagna dopo una riunione, lo screenshot di un report, la foto di un menu in un'altra lingua diventano parte della richiesta.
Ma le regole del buon prompt restano. Un'immagine senza istruzioni produce una descrizione generica. Un'immagine con un compito preciso produce lavoro utile:
Ti allego la foto della lavagna della riunione di oggi. Trascrivi i punti in un elenco ordinato, separa le decisioni prese dalle questioni aperte e, per ogni azione, indica il responsabile se è scritto. Se una parola non è leggibile, segnala [illeggibile] invece di indovinare.
L'ultima riga conta più di quanto sembri. Con le immagini il rischio di allucinazione cresce: il modello «legge» anche ciò che non è nitido, e lo fa con sicurezza.
Che cosa significa per un'azienda?
Il fatto che GPT-4o sia gratuito cambia il quadro. Fino a ieri c'era una distanza netta tra chi pagava GPT-4 e chi usava GPT-3.5: risultati diversi, aspettative diverse. Da oggi molti colleghi avranno sul telefono lo stesso modello, anche senza un abbonamento aziendale.
È un'ottima notizia per la diffusione, e un problema per il controllo. Se tutti possono caricare foto di documenti e fogli di calcolo, serve chiarire che cosa si può condividere con uno strumento personale e che cosa no.
Il consiglio operativo è uno: progettare prompt condivisi, non solo personali. Una piccola raccolta di istruzioni testate (per i verbali, per l'analisi di un grafico, per la revisione di un testo) fa sì che lo stesso modello dia risultati coerenti tra le persone. Il modello è per tutti; il metodo va costruito.
Fonti
- TechCrunch, OpenAI debuts GPT-4o 'omni' model now powering ChatGPT, 13 maggio 2024
- Punto Informatico, OpenAI annuncia GPT-4o e una nuova app per macOS (update), 14 maggio 2024