La distillazione travasa le capacità di un modello grande (teacher) in uno piccolo (student): lo student non impara dai dati grezzi ma dall'output del teacher – le sue risposte, o addirittura le sue distribuzioni di probabilità, che contengono più informazione della sola risposta giusta ("quasi certamente A, ma B era plausibile").
È il motivo per cui i modelli piccoli moderni sono così sorprendenti: molti sono distillati da giganti, ereditando una frazione notevole della qualità a una frazione minima del costo di inferenza. La variante più comune oggi: generare dati sintetici col modello grande e farci fine-tuning del piccolo.
Nota legale non banale: distillare dall'API di un concorrente viola in genere i termini d'uso – la pratica esiste comunque, ma è terreno conteso. Per uso interno (grande → piccolo tuoi) è invece la strada maestra per abbattere i costi.