RLHF (Reinforcement Learning from Human Feedback) è la tecnica che ha trasformato i modelli da completatori di testo ad assistenti: si mostrano a persone coppie di risposte ("quale preferisci?"), con quei giudizi si addestra un reward model che impara a prevedere le preferenze umane, e con il reinforcement learning si spinge l'LLM a produrre risposte che quel giudice premia.
È potente e delicato: il modello impara a piacere, che non è esattamente essere corretto – da qui la piaggeria ("ottima domanda!") e le risposte prudenti fino alla mutilazione. DPO (Direct Preference Optimization) ottiene un effetto simile saltando il reward model e il RL: si ottimizza direttamente sulle coppie preferita/scartata – più semplice e stabile, ed è il motivo per cui lo trovi nelle pipeline open source. I dataset di preferenze pubblici (HH di Anthropic, UltraFeedback, OASST) sono la materia prima di entrambi.