La regola spannometrica per i modelli quantizzati in Q4: ~0,6 GB per miliardo di parametri, più 1-3 GB per il contesto (la KV cache cresce col contesto: contesti lunghi = gigabyte in più):
- 7-9B → 5-7 GB: gira su laptop con 16 GB di RAM o GPU da 8 GB
- 13-14B → 9-11 GB: GPU da 12-16 GB o Mac da 16-24 GB
- 30-34B → 20-24 GB: RTX 3090/4090 (24 GB) o Mac da 32 GB e su
- 70B → 40-48 GB: doppia GPU, oppure Mac Studio/MacBook con 64+ GB di memoria unificata
Note che salvano acquisti: la memoria unificata Apple conta tutta come "VRAM" (il confronto con NVIDIA); un modello che entra per un pelo lascia spazio zero al contesto; e un MoE occupa per i parametri totali, non per gli attivi. In caso di dubbio: meglio un modello più piccolo che respira di uno grande che soffoca.