F FabGPT-FAQ

Cos'è l'inferenza (e perché costa)?

AI e LLM 1 min lettura Runbook verificato

L'inferenza è il modello al lavoro: dato il tuo prompt, generare la risposta. Si contrappone all'addestramento (che si paga una volta) perché si paga a ogni richiesta – ed è il motivo per cui le API fatturano a token.

Perché costa: generare è sequenziale – un token alla volta, ciascuno richiede un passaggio nell'intero modello – e tiene occupata memoria costosa (i pesi più la KV cache che cresce col contesto). Le leve per abbatterlo esistono a ogni strato: quantizzazione, prompt caching, batch API, speculative decoding, modelli piccoli dove bastano (routing a livelli, l'idea di Silence) e contesto più magro (l0-compressor per gli agenti). O l'inferenza a casa tua: costo marginale zero, elettricità esclusa.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.