Un golden dataset è la batteria di riferimento curata a mano: domande reali con la risposta attesa e, per il RAG, i passaggi che il retrieval deve trovare. Si misura in due punti separati: il retrieval (recall@k: i documenti giusti sono nei primi k?) e la generazione (LLM-as-judge con rubrica, o exact match dove si può).
Il valore vero è la non-regressione: la batteria gira in CI a ogni modifica di chunking, embedding o prompt, e ti dice cosa hai rotto prima che lo scopra un utente. Vale identico per i workflow agentici: input scriptati, tool attesi, esito verificabile.
I dataset sintetici (domande generate da un LLM sui tuoi documenti) scalano la copertura, ma valida a mano un campione: il generatore fa le domande che il sistema sa già trovare – questo sito, per dire, si tiene onesto con una batteria di test curati uno a uno.