L'inferenza è il modello al lavoro: dato il tuo prompt, generare la risposta. Si contrappone all'addestramento (che si paga una volta) perché si paga a ogni richiesta – ed è il motivo per cui le API fatturano a token.
Perché costa: generare è sequenziale – un token alla volta, ciascuno richiede un passaggio nell'intero modello – e tiene occupata memoria costosa (i pesi più la KV cache che cresce col contesto). Le leve per abbatterlo esistono a ogni strato: quantizzazione, prompt caching, batch API, speculative decoding, modelli piccoli dove bastano (routing a livelli, l'idea di Silence) e contesto più magro (l0-compressor per gli agenti). O l'inferenza a casa tua: costo marginale zero, elettricità esclusa.