Lo speculative decoding accelera la generazione con un trucco elegante: un modello piccolo e veloce (draft) propone i prossimi 4-8 token, e il modello grande li verifica tutti in un colpo solo – accettando quelli su cui concorda e correggendo il primo che sbaglia. Siccome verificare in parallelo costa quanto generare un token, e il piccolo indovina spesso (le parti facili del testo sono... facili), il risultato sono 2-3× di velocità con output matematicamente identico a quello del modello grande da solo.
Niente pasti gratis, ma quasi: serve tenere in memoria due modelli, e il guadagno dipende da quanto il draft "somiglia" al grande (spesso è una versione distillata dello stesso). Lo trovi già acceso in molti runtime e API senza che tu debba fare nulla – è uno dei motivi per cui l'inferenza continua a diventare più economica a parità di qualità.