Claude 3.7 Sonnet e Claude Code: il ragionamento si regola
· 4 min di lettura
Scritto con l'intelligenza artificiale
Il 24 febbraio Anthropic ha lanciato Claude 3.7 Sonnet, modello ibrido con pensiero esteso regolabile fino a 128.000 token, e Claude Code in anteprima. Il tempo di ragionamento diventa un parametro di progetto.
Lunedì 24 febbraio Anthropic ha presentato Claude 3.7 Sonnet e, insieme, un nuovo strumento per sviluppatori: Claude Code. La novità principale non è un punteggio più alto nei test, ma un'idea diversa di modello: lo stesso Claude può rispondere subito oppure fermarsi a pensare, e siamo noi a decidere quanto.
Un modello, due modi di lavorare
Finora chi voleva un modello di ragionamento doveva scegliere un modello apposito, come o1 di OpenAI o DeepSeek-R1, separato da quello usato per le risposte rapide. Anthropic definisce Claude 3.7 Sonnet un modello di ragionamento ibrido: in modalità standard risponde come i modelli a cui siamo abituati, in modalità di pensiero esteso (extended thinking) riflette passo dopo passo prima di rispondere, e il suo ragionamento è visibile.
Alcuni dettagli pratici:
- il pensiero esteso è disponibile per chi ha un piano a pagamento (Pro, Team, Enterprise) e via API, mentre il piano gratuito usa solo la modalità standard;
- via API si può fissare un budget di pensiero, fino a 128.000 token, per decidere quanto a lungo il modello può ragionare;
- il prezzo resta quello di Claude 3.5 Sonnet: 3 dollari per milione di token in ingresso e 15 in uscita, token di ragionamento compresi;
- secondo Anthropic il modello rifiuta richieste innocue il 45% in meno rispetto al predecessore.
Sul test di programmazione SWE-bench Verified, basato su problemi reali di software, Anthropic dichiara risultati da primato: fino al 70,3% con un'impalcatura di prova personalizzata.
Il ragionamento diventa un parametro di progetto
Per chi progetta sistemi con l'AI questa è la novità più interessante. Il tempo di riflessione non è più una caratteristica fissa del modello scelto: è una manopola da regolare compito per compito.
Una regola pratica per decidere:
- modalità standard per riformulare testi, estrarre dati da un documento, scrivere una mail, classificare richieste;
- pensiero esteso per analisi con molti vincoli, problemi matematici o logici, revisione di codice, decisioni con più criteri da bilanciare.
In un flusso di lavoro composto da più passaggi, quindi, non tutto deve «pensare». Il passaggio di analisi può usare un budget alto, quello di formattazione nessun ragionamento. È una scelta che pesa su qualità, tempi e costi, ed è esattamente il tipo di decisione che spetta a chi disegna il sistema.
Come cambiano i prompt?
Con il pensiero esteso attivo, non serve più chiedere al modello di ragionare passo passo: lo fa già. Conviene invece descrivere bene il problema, i criteri e la forma della risposta:
Analizza questi tre preventivi per il rinnovo del sito aziendale. Criteri, in ordine di importanza: costi di manutenzione nei tre anni, tempi di consegna, esperienza nel nostro settore. Nella risposta finale voglio una tabella di confronto e una raccomandazione di massimo cinque righe. Se un criterio non è valutabile con i dati forniti, dillo esplicitamente.
C'è poi un vantaggio meno evidente. Leggere il ragionamento di Claude aiuta a capire dove il prompt è ambiguo: se il modello spende metà del suo pensiero a chiedersi che cosa intendevamo con «costi», la correzione da fare al prompt è chiara.
Anthropic stessa invita però alla prudenza: in un approfondimento sul pensiero visibile ricorda che i passaggi mostrati non sempre corrispondono fedelmente a ciò che determina la risposta. Il ragionamento visibile è uno strumento di diagnosi, non una prova di correttezza.
Claude Code: l'AI nel terminale
La seconda novità è Claude Code, disponibile in anteprima di ricerca per un numero limitato di utenti. È un agente AI che lavora dalla riga di comando: legge e cerca nel codice, modifica i file, scrive ed esegue i test, e può fare commit e push su GitHub. Anthropic racconta che nei test interni ha completato in un solo passaggio compiti che avrebbero richiesto più di 45 minuti di lavoro manuale. Contestualmente l'integrazione con GitHub è arrivata su tutti i piani di Claude.
Per chi non scrive codice è un segnale da tenere d'occhio: gli assistenti stanno passando dal suggerire all'eseguire. E più un agente agisce, più contano istruzioni chiare, permessi ben definiti e controlli umani nei punti giusti.
Fonti
- Anthropic, Claude 3.7 Sonnet and Claude Code, 24 febbraio 2025
- Anthropic, Claude's extended thinking, 24 febbraio 2025
- TechCrunch, Anthropic launches a new AI model that 'thinks' as long as you want, 24 febbraio 2025