Transformer
Detto anche: trasformatore, architettura transformer, meccanismo di attenzione
Il transformer è l'architettura di rete neurale alla base dei modelli linguistici moderni come GPT, Claude e Gemini. Presentata da ricercatori di Google nel 2017, usa un meccanismo detto «attenzione» per mettere in relazione tra loro tutte le parti di un testo.
In breve
- Architettura alla base di GPT, Claude e Gemini.
- Presentata da Google nel 2017 in «Attention Is All You Need».
- L'attenzione collega ogni token a tutti gli altri.
- Elabora il testo in parallelo: ha permesso modelli enormi.
- La «T» di GPT sta per transformer.
Che cos'è l'attenzione?
È il meccanismo con cui il modello, per interpretare ogni token, valuta quanto contano tutti gli altri token del testo. Nella frase «Il gatto non è salito sull'albero perché era troppo stanco», l'attenzione permette di collegare «stanco» a «gatto» e non ad «albero».
Perché è stato una svolta?
I modelli precedenti leggevano il testo una parola alla volta, in sequenza, ed erano lenti da addestrare e deboli sui testi lunghi. Il transformer elabora tutto il testo in parallelo: così è stato possibile addestrare modelli molto più grandi su quantità enormi di dati, aprendo la strada a BERT, GPT e agli attuali LLM.
Da dove viene il nome GPT?
GPT significa Generative Pre-trained Transformer: un transformer pre-addestrato per generare testo. La «T» indica proprio questa architettura.
Riguarda solo il testo?
No: con lo stesso principio si costruiscono modelli per immagini, audio e video, e i modelli multimodali che li combinano.
Esempio pratico
Traducendo «The bank of the river was flooded», il transformer usa l'attenzione per collegare «bank» a «river» e capire che si tratta della riva del fiume, non di una banca, prima di produrre «La riva del fiume era allagata».
Differenze con Reti ricorrenti (RNN)
| Aspetto | Transformer | Reti ricorrenti (RNN) |
|---|---|---|
| Come legge il testo | Tutto insieme, in parallelo | Una parola dopo l'altra |
| Testi lunghi | Collega bene parti lontane | Tende a perdere il filo |
| Addestramento | Veloce su hardware moderno | Lento |
Domande frequenti
Per scrivere prompt serve conoscere il transformer?
Non nei dettagli, ma sapere che il modello lavora sui token e mette in relazione tutto il contesto aiuta a capire perché l'ordine, la chiarezza e la posizione delle istruzioni contano.
Fonti
Vedi anche
- Finestra di contesto: La finestra di contesto è la quantità massima di testo, misurata in token, che un modello linguistico può considerare in una volta: prompt, ...
- LLM (Large Language Model): Un modello linguistico di grandi dimensioni (in inglese large language model, LLM) è un sistema di intelligenza artificiale addestrato su en...
- NLP (Natural Language Processing): L'NLP (Natural Language Processing, in italiano elaborazione del linguaggio naturale) è il settore dell'intelligenza artificiale che insegna...
- Token: Il token è il pezzo di testo con cui un modello linguistico legge e scrive: può essere una parola intera, una parte di parola, un segno di p...