o1, il modello che ragiona prima di rispondere: cambia il modo di scrivere i prompt?

· 3 min di lettura

Scritto con l'intelligenza artificiale

OpenAI ha presentato o1-preview e o1-mini, modelli che ragionano prima di rispondere. E consiglia prompt semplici, senza chiedere di ragionare passo passo. Che cosa cambia davvero per chi progetta i prompt.

Ieri OpenAI ha presentato o1, una nuova famiglia di modelli (nome in codice Strawberry) che prima di rispondere «pensa»: produce una catena di ragionamento interna e solo dopo scrive la risposta. Le versioni sono due, o1-preview e o1-mini, disponibili in ChatGPT per gli abbonati Plus e Team. E con loro arriva un consiglio che suona strano a chi ha imparato il prompt engineering negli ultimi due anni: non chiedete al modello di ragionare passo passo.

Che cos'è o1?

È il primo modello di ragionamento di OpenAI: impiega più tempo prima di rispondere e lo usa per scomporre il problema. I risultati dichiarati sono notevoli: secondo TechCrunch, in un esame di qualificazione alle Olimpiadi internazionali di matematica o1 ha risolto l'83% dei problemi, contro il 13% di GPT-4o.

I limiti, per ora, sono altrettanto evidenti. In ChatGPT si possono inviare 30 messaggi a settimana a o1-preview e 50 a o1-mini. Non naviga sul web e non analizza file. Via API costa 15 dollari per milione di token in ingresso e 60 in uscita, e le risposte possono richiedere ben più di dieci secondi. TechCrunch riferisce anche che o1 tende ad avere più allucinazioni di GPT-4o.

C'è poi un dettaglio tecnico che conta. Il ragionamento avviene in «token di ragionamento» che non si vedono nella risposta dell'API ma si pagano come token in uscita: OpenAI suggerisce di riservarne circa 25.000. Nell'API, per ora, mancano il system prompt, lo streaming, gli strumenti e le immagini.

Il consiglio di OpenAI: prompt più semplici

Nella documentazione per gli sviluppatori OpenAI dà quattro indicazioni per scrivere prompt per o1:

Il secondo punto è il più interessante. Dal 2022, quando un gruppo di ricercatori ha mostrato che bastava aggiungere «pensiamo passo dopo passo» per migliorare i risultati sui problemi logici, la frase è diventata un riflesso. Con o1 quel lavoro è stato spostato dentro il modello.

Allora il prompt engineering è finito?

No. Cambia il punto in cui si mette l'impegno: meno istruzioni su come pensare, più precisione su che cosa ottenere. Obiettivo, vincoli, criteri di successo e solo il contesto che serve. Un esempio. Con GPT-4o si scriveva spesso:

Sei un analista acquisti. Ragiona passo passo: prima calcola il costo di ogni offerta, poi aggiungi le penali, poi applica gli sconti, infine confronta i totali.

Con o1 è meglio:

Ho tre offerte di fornitura (tabella tra ###). Obiettivo: scegliere quella con il costo totale più basso su tre anni, considerando penali e sconti per volume. Vincolo: consegna entro 30 giorni. Restituisci la scelta, il calcolo in sintesi e i due rischi principali.

Il secondo prompt è più corto, ma non più povero: è più chiaro sul risultato.

Quando usarlo (e quando no)

o1 dà il meglio sui problemi a più passaggi: matematica, codice, analisi con molti vincoli, pianificazione. Per una mail, un riassunto o un post resta più sensato un modello veloce: costa meno e risponde subito.

Per chi progetta sistemi la conseguenza è chiara: la scelta del modello diventa parte del progetto. In una catena di lavoro o1 può fare il passaggio di analisi o di pianificazione, mentre un modello più rapido si occupa della stesura. E poiché il ragionamento resta nascosto, conviene chiedere nella risposta finale le ipotesi su cui si basa la conclusione: è l'unico modo per controllarle.

Fonti

#OpenAI ChatGPT