RLHF (Reinforcement Learning from Human Feedback)
Also called: RLHF
Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.
RLHF sammelt menschliche Rankings von Modellausgaben, trainiert damit ein Reward-Modell, das diese Präferenzen vorhersagt, und optimiert das Sprachmodell anschließend dagegen. Dieser Post-Training-Schritt macht den größten Teil des Unterschieds zwischen einem rohen Next-Token-Vorhersager und einem brauchbaren Assistenten aus. Er kodiert außerdem die Präferenzen derjenigen, die gerankt haben — eine reale und zu wenig diskutierte Einschränkung.
In der Praxis: Zwei Antworten, ein Mensch wählt die bessere, ein paar hunderttausend Mal wiederholt.