F FabGPT-FAQ

Come si testano pipeline RAG e agenti con i golden dataset?

AI e LLM 2 min lettura Runbook verificato

Un golden dataset è la batteria di riferimento curata a mano: domande reali con la risposta attesa e, per il RAG, i passaggi che il retrieval deve trovare. Si misura in due punti separati: il retrieval (recall@k: i documenti giusti sono nei primi k?) e la generazione (LLM-as-judge con rubrica, o exact match dove si può).

Il valore vero è la non-regressione: la batteria gira in CI a ogni modifica di chunking, embedding o prompt, e ti dice cosa hai rotto prima che lo scopra un utente. Vale identico per i workflow agentici: input scriptati, tool attesi, esito verificabile.

I dataset sintetici (domande generate da un LLM sui tuoi documenti) scalano la copertura, ma valida a mano un campione: il generatore fa le domande che il sistema sa già trovare – questo sito, per dire, si tiene onesto con una batteria di test curati uno a uno.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.