Il paradigma LLM-as-a-Judge impiega un modello linguistico avanzato (es. Claude Sonnet 5 o GPT-5) per giudicare e assegnare punteggi alle risposte generate da altri modelli più piccoli o pipeline agentiche.
I bias sistematici del giudice e come mitigarli:
- Position Bias: il giudice tende a preferire la prima opzione presentata. Mitigazione: eseguire il confronto due volte invertendo l'ordine dei candidati (swap evaluation) e fare la media.
- Verbosity Bias: tendenza a premiare risposte lunghe anche se prolisse. Mitigazione: imporre rubriche di valutazione con vincoli rigidi sulla sintesi e penalità per informazioni ridondanti.
- Self-Enhancement Bias: i modelli tendono a preferire risposte generate dalla loro stessa famiglia. Mitigazione: usare giudici di vendor differenti o ensemble di più modelli.