Distillazione

Detto anche: distillazione della conoscenza, knowledge distillation, modello distillato

La distillazione è la tecnica con cui un modello di intelligenza artificiale grande e potente (il «maestro») insegna a un modello più piccolo (lo «studente») a imitarne le risposte. Il risultato è un modello più leggero, veloce ed economico che conserva gran parte delle capacità dell'originale.

In breve

Come funziona la distillazione?

Si fanno elaborare al modello maestro moltissimi esempi e si registrano le sue risposte, comprese le probabilità che assegna a ogni possibile risposta. Il modello studente viene poi addestrato a riprodurre quelle risposte: impara non solo la risposta giusta ma anche «quanto» il maestro era sicuro delle alternative, un'informazione che i soli dati di partenza non contengono.

Da dove viene?

L'idea è stata formalizzata nel 2015 da Geoffrey Hinton, Oriol Vinyals e Jeff Dean, che usarono proprio una temperatura più alta per rendere più informative le probabilità del maestro. Nel 2019 DistilBERT ha mostrato un modello linguistico più piccolo del 40% e più veloce del 60% che manteneva il 97% delle capacità di comprensione dell'originale.

Perché se ne parla tanto con gli LLM?

Perché molti modelli piccoli e veloci, quelli che girano anche su un computer o su un telefono, nascono distillando modelli più grandi. Nel 2025, per esempio, DeepSeek ha pubblicato versioni ridotte del suo modello di ragionamento R1, ottenute distillandolo in modelli più piccoli.

Cosa cambia per chi scrive prompt?

I modelli distillati sono ottimi per compiti chiari e ripetitivi, ma hanno meno conoscenze e meno flessibilità del maestro: con loro servono prompt ancora più precisi, esempi ben scelti e compiti scomposti in passaggi semplici.

Esempio pratico

Un'azienda usa un grande modello per classificare le richieste dei clienti, ma il costo cresce con i volumi. Raccoglie migliaia di classificazioni fatte dal modello grande e le usa per addestrare un modello piccolo, che poi svolge lo stesso compito sui propri server, più in fretta e a costo molto minore.

Differenze con Affinamento (fine-tuning)

Confronto tra Distillazione e Affinamento (fine-tuning)
AspettoDistillazioneAffinamento (fine-tuning)
Da chi imparaDa un altro modello (il maestro)Da dati preparati da persone
Obiettivo tipicoUn modello più piccolo ed economicoUn modello più adatto a un compito
Dimensione del risultatoPiù piccola dell'originaleUguale all'originale

Domande frequenti

Un modello distillato è peggiore?

In generale ha meno capacità del maestro, ma per i compiti su cui è stato distillato può avvicinarsi molto, con costi e tempi di risposta molto inferiori.

Si può distillare qualsiasi modello?

Tecnicamente sì, ma le condizioni d'uso di molti fornitori vietano di usare le risposte dei loro modelli per addestrare modelli concorrenti: va sempre verificato.

Fonti

  1. Hinton, Vinyals e Dean, «Distilling the Knowledge in a Neural Network» (2015)
  2. Sanh e altri, «DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter» (2019)
  3. DeepSeek-AI, «DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning» (2025)
  4. Knowledge distillation, Wikipedia (inglese) (2026)

Vedi anche