Claude usa il computer: l'AI che clicca e scrive al posto nostro
· 4 min di lettura
Scritto con l'intelligenza artificiale
Anthropic apre in beta pubblica computer use: Claude 3.5 Sonnet guarda lo schermo, muove il cursore e scrive. Come funziona, quanto è affidabile e come si progetta un prompt per un agente che agisce.
Ieri, 22 ottobre, Anthropic ha presentato una versione aggiornata di Claude 3.5 Sonnet, ha annunciato Claude 3.5 Haiku e, soprattutto, ha aperto in beta pubblica una funzione chiamata computer use. Per la prima volta un modello di frontiera disponibile a tutti gli sviluppatori può guardare uno schermo, muovere il cursore, cliccare e scrivere come farebbe una persona.
Non è ancora un prodotto per tutti: si usa tramite API. Ma il segnale è chiaro, e chi progetta flussi di lavoro con l'AI farebbe bene a capirlo subito.
Che cosa fa, in concreto?
Fino a ieri un agente AI poteva agire solo attraverso strumenti costruiti apposta: una funzione per leggere il calendario, una per mandare una mail, una per interrogare un database. Con computer use Anthropic sceglie un'altra strada: invece di creare uno strumento per ogni programma, insegna a Claude competenze generali per usare un computer.
Il meccanismo è semplice da descrivere. Claude riceve delle schermate, capisce cosa c'è sullo schermo e calcola di quanti pixel deve spostare il cursore per cliccare nel punto giusto. Poi scrive, clicca, scorre, prende una nuova schermata e decide il passo successivo. Anthropic racconta che insegnare al modello a contare i pixel con precisione è stato uno dei passaggi decisivi.
La funzione è disponibile sull'API di Anthropic, su Amazon Bedrock e su Vertex AI di Google Cloud. Tra le aziende che la stanno provando ci sono Asana, Canva, DoorDash, Replit e The Browser Company, con compiti che richiedono decine e a volte centinaia di passaggi.
Quanto funziona davvero?
Anthropic stessa è prudente: definisce la funzione «sperimentale», a volte macchinosa e soggetta a errori. Sul test OSWorld, che misura la capacità di usare un computer, Claude 3.5 Sonnet ottiene il 14,9% nella categoria con sole schermate, contro il 7,8% del miglior sistema concorrente. Le persone si fermano intorno al 70-75%. Il salto è netto, la distanza dall'essere umano anche.
Azioni che per noi sono banali, come scorrere, trascinare o zoomare, per Claude sono ancora difficili, e lavorando per schermate può perdersi una notifica che compare e scompare in fretta. Durante le prove, racconta Anthropic, il modello ha interrotto per sbaglio una registrazione dello schermo e in un altro caso ha lasciato a metà un compito di programmazione per sfogliare foto del parco di Yellowstone.
Il resto dell'annuncio è più tradizionale ma conta. Il nuovo Claude 3.5 Sonnet sale dal 33,4% al 49,0% su SWE-bench Verified, un test sulla correzione di codice reale, allo stesso prezzo e con la stessa velocità del predecessore. Claude 3.5 Haiku arriverà entro fine mese, inizialmente solo testo, e secondo Anthropic supera su molti test anche Claude 3 Opus.
Il rischio nuovo: istruzioni nascoste nello schermo
Un modello che legge lo schermo legge anche tutto quello che c'è sopra: pagine web, email, documenti di altri. Anthropic indica come rischio principale la prompt injection: un'istruzione malevola nascosta in una pagina può prevalere su quella dell'utente. Per questo consiglia di partire da compiti a basso rischio e ha sviluppato classificatori per riconoscere gli usi impropri.
Per chi lavora con i prompt questo cambia la prospettiva. Finora il contesto era quello che scrivevamo noi. Con un agente che naviga, il contesto lo scrive anche il mondo esterno.
Cosa cambia per chi progetta
Il prompt per un agente che usa il computer non è una domanda: è una procedura operativa. Deve dire che cosa fare, ma anche dove fermarsi. Un esempio di impostazione:
Apri il foglio «Iscrizioni ottobre» nel browser già aperto. Per ogni riga senza email, cerca il nome nel gestionale e copia l'indirizzo. Non modificare altre colonne. Se trovi due persone con lo stesso nome, non scegliere: segna la riga in giallo e passa alla successiva. Alla fine elenca le righe che hai lasciato in sospeso.
Tre consigli operativi, validi da subito:
- Ambiente separato: far lavorare l'agente in una macchina virtuale o su un computer dedicato, con il minimo di accessi e nessuna password salvata.
- Punti di controllo umani: per ogni azione irreversibile (inviare, pagare, cancellare) prevedere la conferma di una persona, secondo la logica dello human in the loop.
- Compiti piccoli e verificabili: meglio dieci passaggi brevi con un esito controllabile che un unico «fai tu».
È il lavoro del Prompt Architect portato su un piano nuovo. Non basta più progettare cosa l'AI deve dire: bisogna progettare cosa può fare, con quali permessi e con quali freni.
Fonti
- Anthropic, Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku, 22 ottobre 2024
- Anthropic, Developing a computer use model, 22 ottobre 2024