Claude 3: Haiku, Sonnet e Opus, come scegliere il modello giusto
· 4 min di lettura
Scritto con l'intelligenza artificiale
Il 4 marzo Anthropic ha presentato Claude 3: Haiku, Sonnet e Opus, con contesto da 200.000 token. Opus e Sonnet sono già disponibili, Haiku arriva a breve. Come scegliere il modello per ogni compito.
Il 4 marzo Anthropic ha presentato Claude 3, una famiglia di tre modelli invece di uno solo: Haiku, Sonnet e Opus, in ordine crescente di capacità. È un cambio di approccio che riguarda direttamente chi progetta con l'AI. La domanda non è più soltanto «quale assistente uso», ma quale modello per quale compito.
Tre modelli, tre compromessi
Anthropic descrive la famiglia come una scelta tra intelligenza, velocità e costo. I prezzi via API sono indicati per milione di token, in ingresso e in uscita:
- Claude 3 Opus: il più intelligente, per compiti molto complessi come analisi strategiche, ricerca e automazioni articolate. Costa 15 dollari in ingresso e 75 in uscita.
- Claude 3 Sonnet: l'equilibrio tra intelligenza e velocità, pensato per i carichi di lavoro aziendali su larga scala, come la ricerca su grandi basi di conoscenza. Costa 3 dollari in ingresso e 15 in uscita ed è, per la maggior parte dei compiti, due volte più veloce di Claude 2 e 2.1.
- Claude 3 Haiku: il più rapido e compatto, per assistenza clienti in tempo reale, moderazione dei contenuti ed estrazione di dati. Costa 0,25 dollari in ingresso e 1,25 in uscita. Secondo Anthropic legge un articolo scientifico di circa 10.000 token, con grafici, in meno di tre secondi.
Una precisazione importante: oggi sono disponibili Opus e Sonnet, tramite API e su claude.ai. Haiku arriverà a breve. Sonnet alimenta la versione gratuita di claude.ai, mentre Opus è riservato agli abbonati Claude Pro. Sonnet si trova anche su Amazon Bedrock. Per chi lavora dall'Italia la strada è l'API, ora disponibile in 159 paesi: l'app claude.ai, per il momento, non è aperta ufficialmente da noi.
Le novità che contano per chi scrive prompt
Al di là dei punteggi nei test, alcune novità cambiano il modo di lavorare:
- finestra di contesto da 200.000 token per tutti e tre i modelli, con la possibilità di superare il milione per clienti selezionati. In un test di recupero su testi molto lunghi Opus ha superato il 99% di accuratezza. La finestra di contesto diventa abbastanza ampia da contenere interi manuali o contratti;
- visione: i modelli leggono foto, grafici, diagrammi tecnici, PDF e slide;
- meno rifiuti inutili: le versioni precedenti tendevano a rifiutare richieste innocue, Claude 3 lo fa molto meno spesso;
- più accuratezza: su domande fattuali difficili Opus raddoppia le risposte corrette rispetto a Claude 2.1 e riduce quelle sbagliate. Le allucinazioni non spariscono, ma calano;
- istruzioni complesse e formati strutturati: secondo Anthropic i modelli seguono meglio istruzioni in più passaggi, linee guida sul tono di voce e output in JSON.
Come si sceglie il modello giusto?
La regola pratica è partire dal compito, non dal modello. Tre domande aiutano:
- Quanto è difficile il ragionamento? Analisi con molti vincoli, strategia, codice complesso: Opus. Sintesi, classificazioni, estrazioni: Sonnet, e presto Haiku.
- Quanto deve essere veloce la risposta? Una chat con i clienti o un'automazione su migliaia di documenti chiede rapidità e costi bassi.
- Quanto costa un errore? Se l'output finisce davanti a un cliente senza controllo, conviene il modello più accurato o un passaggio di revisione.
Spesso la soluzione migliore è combinarli. Un modello veloce smista e prepara, un modello più potente interviene solo dove serve. È un'architettura, non un singolo prompt.
Un esempio di prompt di smistamento, da affidare a un modello rapido:
Leggi la richiesta qui sotto e classificala in una sola parola: «semplice» se si risolve con una risposta standard o un'informazione presente nel documento allegato, «complessa» se richiede un'analisi, un confronto tra più documenti o una decisione. Rispondi solo con la parola.
Le richieste «semplici» restano al modello economico, quelle «complesse» passano a Opus. Con 200.000 token di contesto, entrambi possono lavorare sugli stessi documenti senza ricorrere subito a un sistema RAG.
Il consiglio operativo
Prima di scegliere, conviene preparare un piccolo banco di prova: dieci richieste reali, con la risposta ideale scritta da una persona esperta. Si eseguono su Sonnet e su Opus con lo stesso system prompt e si confrontano qualità, tempi e costi. Quando arriverà Haiku si aggiunge al confronto.
Con tre modelli della stessa famiglia, che condividono lo stesso stile di istruzioni, spostare un prompt da uno all'altro è più facile che mai. Il vantaggio va a chi ha prompt chiari, testati e documentati: potrà scegliere il modello giusto compito per compito, invece di pagare sempre il più costoso.
Fonti
- Anthropic, Introducing the next generation of Claude, 4 marzo 2024
- TechCrunch, Anthropic claims its new AI chatbot models beat OpenAI’s GPT-4, 4 marzo 2024