o1, il modello che ragiona prima di rispondere: cambia il modo di scrivere i prompt?
· 3 min di lettura
Scritto con l'intelligenza artificiale
OpenAI ha presentato o1-preview e o1-mini, modelli che ragionano prima di rispondere. E consiglia prompt semplici, senza chiedere di ragionare passo passo. Che cosa cambia davvero per chi progetta i prompt.
Ieri OpenAI ha presentato o1, una nuova famiglia di modelli (nome in codice Strawberry) che prima di rispondere «pensa»: produce una catena di ragionamento interna e solo dopo scrive la risposta. Le versioni sono due, o1-preview e o1-mini, disponibili in ChatGPT per gli abbonati Plus e Team. E con loro arriva un consiglio che suona strano a chi ha imparato il prompt engineering negli ultimi due anni: non chiedete al modello di ragionare passo passo.
Che cos'è o1?
È il primo modello di ragionamento di OpenAI: impiega più tempo prima di rispondere e lo usa per scomporre il problema. I risultati dichiarati sono notevoli: secondo TechCrunch, in un esame di qualificazione alle Olimpiadi internazionali di matematica o1 ha risolto l'83% dei problemi, contro il 13% di GPT-4o.
I limiti, per ora, sono altrettanto evidenti. In ChatGPT si possono inviare 30 messaggi a settimana a o1-preview e 50 a o1-mini. Non naviga sul web e non analizza file. Via API costa 15 dollari per milione di token in ingresso e 60 in uscita, e le risposte possono richiedere ben più di dieci secondi. TechCrunch riferisce anche che o1 tende ad avere più allucinazioni di GPT-4o.
C'è poi un dettaglio tecnico che conta. Il ragionamento avviene in «token di ragionamento» che non si vedono nella risposta dell'API ma si pagano come token in uscita: OpenAI suggerisce di riservarne circa 25.000. Nell'API, per ora, mancano il system prompt, lo streaming, gli strumenti e le immagini.
Il consiglio di OpenAI: prompt più semplici
Nella documentazione per gli sviluppatori OpenAI dà quattro indicazioni per scrivere prompt per o1:
- Prompt semplici e diretti. Il modello lavora meglio con istruzioni chiare, senza bisogno di guida dettagliata.
- Niente catena di ragionamento nel prompt. Il ragionamento passo passo è già dentro il modello: imporre il proprio può peggiorare il risultato.
- Delimitatori. Separare le parti del prompt con segni come ###, tag XML o titoli di sezione.
- Poco contesto aggiuntivo. In una RAG conviene includere solo le informazioni più rilevanti, per evitare che il modello complichi troppo la risposta.
Il secondo punto è il più interessante. Dal 2022, quando un gruppo di ricercatori ha mostrato che bastava aggiungere «pensiamo passo dopo passo» per migliorare i risultati sui problemi logici, la frase è diventata un riflesso. Con o1 quel lavoro è stato spostato dentro il modello.
Allora il prompt engineering è finito?
No. Cambia il punto in cui si mette l'impegno: meno istruzioni su come pensare, più precisione su che cosa ottenere. Obiettivo, vincoli, criteri di successo e solo il contesto che serve. Un esempio. Con GPT-4o si scriveva spesso:
Sei un analista acquisti. Ragiona passo passo: prima calcola il costo di ogni offerta, poi aggiungi le penali, poi applica gli sconti, infine confronta i totali.
Con o1 è meglio:
Ho tre offerte di fornitura (tabella tra ###). Obiettivo: scegliere quella con il costo totale più basso su tre anni, considerando penali e sconti per volume. Vincolo: consegna entro 30 giorni. Restituisci la scelta, il calcolo in sintesi e i due rischi principali.
Il secondo prompt è più corto, ma non più povero: è più chiaro sul risultato.
Quando usarlo (e quando no)
o1 dà il meglio sui problemi a più passaggi: matematica, codice, analisi con molti vincoli, pianificazione. Per una mail, un riassunto o un post resta più sensato un modello veloce: costa meno e risponde subito.
Per chi progetta sistemi la conseguenza è chiara: la scelta del modello diventa parte del progetto. In una catena di lavoro o1 può fare il passaggio di analisi o di pianificazione, mentre un modello più rapido si occupa della stesura. E poiché il ragionamento resta nascosto, conviene chiedere nella risposta finale le ipotesi su cui si basa la conclusione: è l'unico modo per controllarle.
Fonti
- Kojima e altri, Large Language Models are Zero-Shot Reasoners, 24 maggio 2022
- TechCrunch, OpenAI unveils o1, a model that can fact-check itself, 12 settembre 2024
- Simon Willison, Notes on OpenAI's new o1 chain-of-thought models, 12 settembre 2024
- Vellum, OpenAI o1: Prompting Tips, Limitations, and Capabilities, 13 settembre 2024