F FabGPT-FAQ

Quanta RAM o VRAM serve per un LLM (7B, 13B, 70B)?

AI e LLM 2 min lettura Runbook verificato

La regola spannometrica per i modelli quantizzati in Q4: ~0,6 GB per miliardo di parametri, più 1-3 GB per il contesto (la KV cache cresce col contesto: contesti lunghi = gigabyte in più):

  • 7-9B → 5-7 GB: gira su laptop con 16 GB di RAM o GPU da 8 GB
  • 13-14B → 9-11 GB: GPU da 12-16 GB o Mac da 16-24 GB
  • 30-34B → 20-24 GB: RTX 3090/4090 (24 GB) o Mac da 32 GB e su
  • 70B → 40-48 GB: doppia GPU, oppure Mac Studio/MacBook con 64+ GB di memoria unificata

Note che salvano acquisti: la memoria unificata Apple conta tutta come "VRAM" (il confronto con NVIDIA); un modello che entra per un pelo lascia spazio zero al contesto; e un MoE occupa per i parametri totali, non per gli attivi. In caso di dubbio: meglio un modello più piccolo che respira di uno grande che soffoca.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.