Distillazione
Detto anche: distillazione della conoscenza, knowledge distillation, modello distillato
La distillazione è la tecnica con cui un modello di intelligenza artificiale grande e potente (il «maestro») insegna a un modello più piccolo (lo «studente») a imitarne le risposte. Il risultato è un modello più leggero, veloce ed economico che conserva gran parte delle capacità dell'originale.
In breve
- Un modello grande (maestro) insegna a uno piccolo (studente).
- Lo studente impara a imitare le risposte e le probabilità del maestro.
- Il risultato è più leggero, veloce ed economico.
- Formalizzata nel 2015 da Hinton, Vinyals e Dean.
- Molti modelli piccoli di oggi sono distillati da modelli grandi.
Come funziona la distillazione?
Si fanno elaborare al modello maestro moltissimi esempi e si registrano le sue risposte, comprese le probabilità che assegna a ogni possibile risposta. Il modello studente viene poi addestrato a riprodurre quelle risposte: impara non solo la risposta giusta ma anche «quanto» il maestro era sicuro delle alternative, un'informazione che i soli dati di partenza non contengono.
Da dove viene?
L'idea è stata formalizzata nel 2015 da Geoffrey Hinton, Oriol Vinyals e Jeff Dean, che usarono proprio una temperatura più alta per rendere più informative le probabilità del maestro. Nel 2019 DistilBERT ha mostrato un modello linguistico più piccolo del 40% e più veloce del 60% che manteneva il 97% delle capacità di comprensione dell'originale.
Perché se ne parla tanto con gli LLM?
Perché molti modelli piccoli e veloci, quelli che girano anche su un computer o su un telefono, nascono distillando modelli più grandi. Nel 2025, per esempio, DeepSeek ha pubblicato versioni ridotte del suo modello di ragionamento R1, ottenute distillandolo in modelli più piccoli.
Cosa cambia per chi scrive prompt?
I modelli distillati sono ottimi per compiti chiari e ripetitivi, ma hanno meno conoscenze e meno flessibilità del maestro: con loro servono prompt ancora più precisi, esempi ben scelti e compiti scomposti in passaggi semplici.
Esempio pratico
Un'azienda usa un grande modello per classificare le richieste dei clienti, ma il costo cresce con i volumi. Raccoglie migliaia di classificazioni fatte dal modello grande e le usa per addestrare un modello piccolo, che poi svolge lo stesso compito sui propri server, più in fretta e a costo molto minore.
Differenze con Affinamento (fine-tuning)
| Aspetto | Distillazione | Affinamento (fine-tuning) |
|---|---|---|
| Da chi impara | Da un altro modello (il maestro) | Da dati preparati da persone |
| Obiettivo tipico | Un modello più piccolo ed economico | Un modello più adatto a un compito |
| Dimensione del risultato | Più piccola dell'originale | Uguale all'originale |
Domande frequenti
Un modello distillato è peggiore?
In generale ha meno capacità del maestro, ma per i compiti su cui è stato distillato può avvicinarsi molto, con costi e tempi di risposta molto inferiori.
Si può distillare qualsiasi modello?
Tecnicamente sì, ma le condizioni d'uso di molti fornitori vietano di usare le risposte dei loro modelli per addestrare modelli concorrenti: va sempre verificato.
Fonti
- Hinton, Vinyals e Dean, «Distilling the Knowledge in a Neural Network» (2015)
- Sanh e altri, «DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter» (2019)
- DeepSeek-AI, «DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning» (2025)
- Knowledge distillation, Wikipedia (inglese) (2026)
Vedi anche
- LLM (Large Language Model): Un modello linguistico di grandi dimensioni (in inglese large language model, LLM) è un sistema di intelligenza artificiale addestrato su en...
- Temperatura: La temperatura è un parametro che regola quanto sono variabili le risposte di un modello linguistico: valori bassi danno risposte più preved...
- Token: Il token è il pezzo di testo con cui un modello linguistico legge e scrive: può essere una parola intera, una parte di parola, un segno di p...