AI Index 2024 di Stanford: i numeri dell'anno dell'AI generativa
· 4 min di lettura
Scritto con l'intelligenza artificiale
L'AI Index 2024 di Stanford racconta il 2023: 149 modelli di base, investimenti nell'AI generativa quasi nove volte più alti, test di riferimento ormai saturi. Che cosa significa per chi progetta con l'AI, a un mese dal voto sull'AI Act.
Ogni primavera lo Stanford Institute for Human-Centered Artificial Intelligence pubblica l'AI Index, il rapporto che prova a misurare lo stato dell'intelligenza artificiale con dati e non con slogan. L'edizione 2024, uscita il 15 aprile, racconta il 2023: l'anno in cui l'AI generativa è passata dai laboratori alle scrivanie. E arriva un mese dopo il voto con cui, il 13 marzo, il Parlamento europeo ha approvato l'AI Act.
Abbiamo letto i numeri principali con una domanda in testa: che cosa significano per chi, ogni giorno, progetta il lavoro con l'AI?
Quanti modelli, e di chi?
Nel 2023 sono stati rilasciati 149 modelli di base (i grandi modelli generalisti su cui si costruiscono i prodotti), più del doppio dell'anno precedente. Il 65,7% è open source, contro il 44,4% del 2022. Eppure i modelli chiusi restano davanti: su dieci test di riferimento il vantaggio mediano è del 24,2%.
L'industria domina: il 72% dei nuovi modelli di base viene dalle aziende, non dalle università. Il motivo è economico. Secondo le stime del rapporto, l'addestramento di Gemini Ultra di Google è costato circa 191 milioni di dollari in potenza di calcolo, quello di GPT-4 circa 78 milioni. Il Transformer originale del 2017, l'architettura alla base di quasi tutti gli LLM di oggi, costò circa 900 dollari.
Le aziende stanno davvero usando l'AI?
Sì, e sempre di più. Gli investimenti privati nell'AI generativa sono arrivati a 25,2 miliardi di dollari, quasi nove volte il 2022. Il 55% delle organizzazioni dichiara di usare l'AI in almeno una funzione, contro il 50% del 2022 e il 20% del 2017. In un'indagine di McKinsey ripresa dal rapporto, il 42% delle aziende ha visto calare i costi e il 59% crescere i ricavi.
Il dato più interessante per chi lavora con i prompt riguarda la produttività. Diversi studi del 2023 (su programmatori, consulenti, operatori di call center, studenti di legge) mostrano che con l'AI i compiti si chiudono prima e meglio. E che il guadagno è maggiore per chi parte con meno esperienza.
I test non bastano più
Il rapporto segnala che l'AI ha raggiunto o superato le prestazioni umane in molti test di riferimento, dalla comprensione del testo al ragionamento visivo. I ricercatori sono costretti a inventarne di nuovi e più difficili, perché i vecchi si saturano in fretta.
C'è però un'altra faccia. Sull'AI responsabile (veridicità, linguaggio tossico, pregiudizi) i produttori usano test diversi tra loro, e confrontare i modelli diventa difficile. Il benchmark pubblico, insomma, dice poco su come un modello si comporterà con i vostri documenti, il vostro settore, i vostri clienti.
Qui sta la lezione per il Prompt Architect: la valutazione va costruita in casa. Prima di scegliere un modello o di cambiare un prompt in produzione, serve un piccolo insieme di casi reali con la risposta attesa. Per esempio:
Ecco 20 richieste tipiche dei nostri clienti con la risposta corretta. Confronta la risposta generata con quella attesa e assegna un voto da 1 a 5 su correttezza, completezza e tono. Segnala ogni affermazione che non trovi nel materiale fornito.
Ogni cambiamento al sistema si misura su quei 20 casi. È noioso, ed è esattamente ciò che distingue un progetto da un esperimento.
E le regole?
Il rapporto conta 33 paesi che tra il 2016 e il 2023 hanno approvato almeno una legge sull'AI, 148 in tutto, con una tendenza crescente verso norme restrittive. L'opinione pubblica va nella stessa direzione: più della metà degli intervistati dice che i prodotti di AI lo rendono nervoso, contro il 39% dell'anno prima.
In Europa la risposta è l'AI Act. Il regolamento classifica i sistemi in quattro livelli di rischio (minimo, limitato, alto, inaccettabile) e vieta alcuni usi, come il punteggio sociale e il riconoscimento delle emozioni sul posto di lavoro o a scuola. Entrerà in vigore a scaglioni: i divieti entro sei mesi, le regole sui modelli generativi dopo un anno, il resto dopo due.
Che cosa ci portiamo a casa
Tre indicazioni pratiche, utili già oggi:
- Non scegliete il modello dalla classifica. Scegliete quello che funziona meglio sui vostri casi, misurati.
- Documentate i prompt e i flussi. L'AI Act riguarda anche chi usa i sistemi, non solo chi li produce: sapere quali strumenti usate e come, con prompt scritti, versionati e testati, è già metà del lavoro.
- Investite su chi parte da meno. Se l'AI aiuta soprattutto i meno esperti, il valore sta nel dare loro prompt progettati bene, non nel lasciarli improvvisare.
L'AI Index conferma ciò che molti vedono in ufficio: la tecnologia corre più veloce dei metodi per usarla. Il compito di chi progetta è colmare questa distanza.
Fonti
- Stanford HAI, AI Index: State of AI in 13 Charts, 15 aprile 2024
- IEEE Spectrum, 15 Graphs That Explain the State of AI in 2024, 15 aprile 2024
- Wired Italia, AI Act, approvato dal Parlamento europeo, 13 marzo 2024