F FabGPT-FAQ

Come si valuta la qualità delle risposte di un LLM?

AI e LLM 1 min lettura Runbook verificato

Il kit minimo, in ordine di solidità:

  • golden set: 20-100 input reali con risposte attese o criteri scritti. È l'investimento fondante – senza, ogni cambio di prompt o modello è un salto nel buio
  • metriche esatte dove si può: se l'output è strutturato (JSON, classi, numeri), confronta col codice – gratis, oggettivo, perfetto per la CI
  • LLM-as-a-judge per il resto: un modello valuta le risposte contro una rubrica esplicita (correttezza, fedeltà alle fonti, tono). Funziona, con i suoi bias noti – preferisce risposte lunghe, la prima posizione, lo stile suo: rubrica stretta, posizioni mescolate, e una taratura contro giudizi umani su un campione
  • umani sui casi che contano e per calibrare il giudice

La trappola da evitare: valutare a sensazione sull'ultimo esempio provato. La memoria aneddotica è il peggior benchmark che esista – i numeri battono le impressioni.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.