Transformer

Detto anche: trasformatore, architettura transformer, meccanismo di attenzione

Il transformer è l'architettura di rete neurale alla base dei modelli linguistici moderni come GPT, Claude e Gemini. Presentata da ricercatori di Google nel 2017, usa un meccanismo detto «attenzione» per mettere in relazione tra loro tutte le parti di un testo.

In breve

Che cos'è l'attenzione?

È il meccanismo con cui il modello, per interpretare ogni token, valuta quanto contano tutti gli altri token del testo. Nella frase «Il gatto non è salito sull'albero perché era troppo stanco», l'attenzione permette di collegare «stanco» a «gatto» e non ad «albero».

Perché è stato una svolta?

I modelli precedenti leggevano il testo una parola alla volta, in sequenza, ed erano lenti da addestrare e deboli sui testi lunghi. Il transformer elabora tutto il testo in parallelo: così è stato possibile addestrare modelli molto più grandi su quantità enormi di dati, aprendo la strada a BERT, GPT e agli attuali LLM.

Da dove viene il nome GPT?

GPT significa Generative Pre-trained Transformer: un transformer pre-addestrato per generare testo. La «T» indica proprio questa architettura.

Riguarda solo il testo?

No: con lo stesso principio si costruiscono modelli per immagini, audio e video, e i modelli multimodali che li combinano.

Esempio pratico

Traducendo «The bank of the river was flooded», il transformer usa l'attenzione per collegare «bank» a «river» e capire che si tratta della riva del fiume, non di una banca, prima di produrre «La riva del fiume era allagata».

Differenze con Reti ricorrenti (RNN)

Confronto tra Transformer e Reti ricorrenti (RNN)
AspettoTransformerReti ricorrenti (RNN)
Come legge il testoTutto insieme, in paralleloUna parola dopo l'altra
Testi lunghiCollega bene parti lontaneTende a perdere il filo
AddestramentoVeloce su hardware modernoLento

Domande frequenti

Per scrivere prompt serve conoscere il transformer?

Non nei dettagli, ma sapere che il modello lavora sui token e mette in relazione tutto il contesto aiuta a capire perché l'ordine, la chiarezza e la posizione delle istruzioni contano.

Fonti

  1. Vaswani e altri, «Attention Is All You Need» (2017)
  2. Google Research, «Transformer: A Novel Neural Network Architecture for Language Understanding» (2017)
  3. Trasformatore (informatica), Wikipedia (2026)
  4. Jay Alammar, «The Illustrated Transformer» (2018)

Vedi anche