Un eval è un test ripetibile per misurare un modello: domande con risposte attese, una metrica, un punteggio. I benchmark pubblici (MMLU, HumanEval, le arene di preferenze) sono eval standardizzati su cui si costruiscono le classifiche – utilissimi per orientarsi, pericolosi se creduti alla lettera.
Perché "mentono": la contaminazione (il test finito nei dati di addestramento), la saturazione (quando tutti fanno 90%, il benchmark non distingue più), l'ottimizzazione mirata (Goodhart: la misura diventa l'obiettivo e smette di misurare), e la distanza dal tuo caso: un modello forte in matematica olimpionica può essere mediocre sul tuo estrattore di fatture in italiano.
La conseguenza pratica è una sola: le leaderboard per la rosa dei candidati, i tuoi eval per la scelta – venti casi reali del tuo dominio battono qualsiasi classifica (come costruirli). Nel piccolo è l'approccio di llm-benchmarks: compiti semplici, misurabili, senza gloria.