F FabGPT-FAQ

Cos'è la KV cache (e perché il contesto lungo costa)?

AI e LLM 1 min lettura Runbook verificato

Dentro un transformer, ogni nuovo token "guarda" tutti i precedenti (il meccanismo di attention). Per non ricalcolare tutto a ogni passo, i valori intermedi dei token già visti si tengono in memoria: è la KV cache (key-value). Senza, la generazione sarebbe insostenibile; con, il costo si sposta sulla memoria: la cache cresce linearmente con la lunghezza del contesto, e su contesti molto lunghi divora più VRAM dei pesi stessi.

È la ragione fisica per cui il contesto lungo costa e le API fatturano di più i prompt chilometrici. Le mitigazioni che incontrerai nei runtime: attention ottimizzata (FlashAttention), condivisione delle teste (GQA/MQA), quantizzazione della cache stessa, e il prompt caching lato API, che riusa la cache dei prefissi ripetuti invece di ricostruirla. Morale operativa: contesto magro non è tirchieria, è ingegneria – l0-compressor esiste per questo.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.