Il kit minimo, in ordine di solidità:
- golden set: 20-100 input reali con risposte attese o criteri scritti. È l'investimento fondante – senza, ogni cambio di prompt o modello è un salto nel buio
- metriche esatte dove si può: se l'output è strutturato (JSON, classi, numeri), confronta col codice – gratis, oggettivo, perfetto per la CI
- LLM-as-a-judge per il resto: un modello valuta le risposte contro una rubrica esplicita (correttezza, fedeltà alle fonti, tono). Funziona, con i suoi bias noti – preferisce risposte lunghe, la prima posizione, lo stile suo: rubrica stretta, posizioni mescolate, e una taratura contro giudizi umani su un campione
- umani sui casi che contano e per calibrare il giudice
La trappola da evitare: valutare a sensazione sull'ultimo esempio provato. La memoria aneddotica è il peggior benchmark che esista – i numeri battono le impressioni.