Claude 3.7 Sonnet e Claude Code: il ragionamento si regola

· 4 min di lettura

Scritto con l'intelligenza artificiale

Il 24 febbraio Anthropic ha lanciato Claude 3.7 Sonnet, modello ibrido con pensiero esteso regolabile fino a 128.000 token, e Claude Code in anteprima. Il tempo di ragionamento diventa un parametro di progetto.

Lunedì 24 febbraio Anthropic ha presentato Claude 3.7 Sonnet e, insieme, un nuovo strumento per sviluppatori: Claude Code. La novità principale non è un punteggio più alto nei test, ma un'idea diversa di modello: lo stesso Claude può rispondere subito oppure fermarsi a pensare, e siamo noi a decidere quanto.

Un modello, due modi di lavorare

Finora chi voleva un modello di ragionamento doveva scegliere un modello apposito, come o1 di OpenAI o DeepSeek-R1, separato da quello usato per le risposte rapide. Anthropic definisce Claude 3.7 Sonnet un modello di ragionamento ibrido: in modalità standard risponde come i modelli a cui siamo abituati, in modalità di pensiero esteso (extended thinking) riflette passo dopo passo prima di rispondere, e il suo ragionamento è visibile.

Alcuni dettagli pratici:

Sul test di programmazione SWE-bench Verified, basato su problemi reali di software, Anthropic dichiara risultati da primato: fino al 70,3% con un'impalcatura di prova personalizzata.

Il ragionamento diventa un parametro di progetto

Per chi progetta sistemi con l'AI questa è la novità più interessante. Il tempo di riflessione non è più una caratteristica fissa del modello scelto: è una manopola da regolare compito per compito.

Una regola pratica per decidere:

In un flusso di lavoro composto da più passaggi, quindi, non tutto deve «pensare». Il passaggio di analisi può usare un budget alto, quello di formattazione nessun ragionamento. È una scelta che pesa su qualità, tempi e costi, ed è esattamente il tipo di decisione che spetta a chi disegna il sistema.

Come cambiano i prompt?

Con il pensiero esteso attivo, non serve più chiedere al modello di ragionare passo passo: lo fa già. Conviene invece descrivere bene il problema, i criteri e la forma della risposta:

Analizza questi tre preventivi per il rinnovo del sito aziendale. Criteri, in ordine di importanza: costi di manutenzione nei tre anni, tempi di consegna, esperienza nel nostro settore. Nella risposta finale voglio una tabella di confronto e una raccomandazione di massimo cinque righe. Se un criterio non è valutabile con i dati forniti, dillo esplicitamente.

C'è poi un vantaggio meno evidente. Leggere il ragionamento di Claude aiuta a capire dove il prompt è ambiguo: se il modello spende metà del suo pensiero a chiedersi che cosa intendevamo con «costi», la correzione da fare al prompt è chiara.

Anthropic stessa invita però alla prudenza: in un approfondimento sul pensiero visibile ricorda che i passaggi mostrati non sempre corrispondono fedelmente a ciò che determina la risposta. Il ragionamento visibile è uno strumento di diagnosi, non una prova di correttezza.

Claude Code: l'AI nel terminale

La seconda novità è Claude Code, disponibile in anteprima di ricerca per un numero limitato di utenti. È un agente AI che lavora dalla riga di comando: legge e cerca nel codice, modifica i file, scrive ed esegue i test, e può fare commit e push su GitHub. Anthropic racconta che nei test interni ha completato in un solo passaggio compiti che avrebbero richiesto più di 45 minuti di lavoro manuale. Contestualmente l'integrazione con GitHub è arrivata su tutti i piani di Claude.

Per chi non scrive codice è un segnale da tenere d'occhio: gli assistenti stanno passando dal suggerire all'eseguire. E più un agente agisce, più contano istruzioni chiare, permessi ben definiti e controlli umani nei punti giusti.

Fonti

#Anthropic Claude