F FabGPT-FAQ

Cos'è lo speculative decoding?

AI e LLM 2 min lettura Runbook verificato

Lo speculative decoding accelera la generazione con un trucco elegante: un modello piccolo e veloce (draft) propone i prossimi 4-8 token, e il modello grande li verifica tutti in un colpo solo – accettando quelli su cui concorda e correggendo il primo che sbaglia. Siccome verificare in parallelo costa quanto generare un token, e il piccolo indovina spesso (le parti facili del testo sono... facili), il risultato sono 2-3× di velocità con output matematicamente identico a quello del modello grande da solo.

Niente pasti gratis, ma quasi: serve tenere in memoria due modelli, e il guadagno dipende da quanto il draft "somiglia" al grande (spesso è una versione distillata dello stesso). Lo trovi già acceso in molti runtime e API senza che tu debba fare nulla – è uno dei motivi per cui l'inferenza continua a diventare più economica a parità di qualità.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.