LM-Evaluation-Harness (di EleutherAI) è il framework di riferimento per valutare i Large Language Model in modo riproducibile su decine di benchmark standardizzati (MMLU, GSM8k, HellaSwag, ARC). Il tool calcola: 1) Zero-shot e Few-shot Accuracy: capacità di rispondere correttamente a test a risposta multipla o generazione vincolata; 2) Perplexity e Log-Likelihood: misura di quanto il modello trovi 'sorprendente' o probabile un testo di riferimento ben formato; 3) Calibrazione: allineamento tra la probabilità assegnata alle risposte e l'effettiva correttezza. Questo permette di confrontare oggettivamente checkpoint, quantizzazioni GGUF e modelli open-weights.
In che modo strumenti come LM-Evaluation-Harness standardizzano la misurazione di accuratezza, calibrazione e perplexity su modelli aperti?
Hai una domanda specifica su questo tema?
Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.