F FabGPT-FAQ

Cos'è RLHF (e l'alternativa DPO)?

AI e LLM 2 min lettura Runbook verificato

RLHF (Reinforcement Learning from Human Feedback) è la tecnica che ha trasformato i modelli da completatori di testo ad assistenti: si mostrano a persone coppie di risposte ("quale preferisci?"), con quei giudizi si addestra un reward model che impara a prevedere le preferenze umane, e con il reinforcement learning si spinge l'LLM a produrre risposte che quel giudice premia.

È potente e delicato: il modello impara a piacere, che non è esattamente essere corretto – da qui la piaggeria ("ottima domanda!") e le risposte prudenti fino alla mutilazione. DPO (Direct Preference Optimization) ottiene un effetto simile saltando il reward model e il RL: si ottimizza direttamente sulle coppie preferita/scartata – più semplice e stabile, ed è il motivo per cui lo trovi nelle pipeline open source. I dataset di preferenze pubblici (HH di Anthropic, UltraFeedback, OASST) sono la materia prima di entrambi.

Hai una domanda specifica su questo tema?

Interroga direttamente il motore FabGPT-FAQ con risposta in tempo reale.