I parametri sono i pesi della rete neurale – i numeri regolati durante l'addestramento che codificano tutto ciò che il modello "sa". 7B = 7 miliardi, 70B = 70 miliardi. In prima approssimazione: più parametri, più capacità – e più memoria e costo.
Ma la scala non è tutto, e la storia recente lo dimostra: la qualità dei dati e le tecniche di addestramento contano quanto la stazza – i migliori modelli piccoli di oggi battono i giganti di due anni fa – e la distillazione travasa capacità dai grandi ai piccoli. In più il numero dichiarato può ingannare: nei modelli MoE i parametri totali e quelli attivi per token sono cose diverse. Regola pratica: per un compito ristretto, il modello più piccolo che lo risolve è quello giusto – come sceglierlo.