F FabGPT-FAQ

Cos'è la contaminazione dei benchmark?

AI e LLM 2 min lettura Runbook verificato

La contaminazione avviene quando le domande (e magari le risposte) di un benchmark finiscono nei dati di addestramento: il modello non risolve il test, lo ricorda. Con modelli addestrati su copie di mezzo internet è quasi inevitabile – i benchmark pubblici vivono su internet – e i punteggi ne escono gonfiati in modo invisibile.

Gli indizi: punteggi che crollano sulla versione riformulata dello stesso problema, differenze sospette tra la versione pubblica e una privata del test, modelli che completano a memoria le domande a metà. Le contromisure: benchmark con set privati, test generati proceduralmente, versioni datate dopo il cutoff del modello, e le arene di preferenze umane (più difficili da memorizzare, con altri bias però).

Morale per chi sceglie modelli: è un motivo in più per non fidarsi del numero in classifica e misurare sul proprio dominio, con dati che il modello non può aver visto: i tuoi.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.