RLHF (Reinforcement Learning from Human Feedback)
Also called: RLHF
Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.
L’RLHF raccoglie classifiche umane degli output del modello, addestra un modello di ricompensa a prevedere quelle preferenze e poi ottimizza il modello linguistico rispetto a esso. Questa fase di post-training è quasi tutta la differenza tra un semplice predittore del token successivo e un assistente utilizzabile. Codifica anche le preferenze di chi ha stilato le classifiche, il che è un limite reale e poco discusso.
In pratica: Due risposte, un essere umano sceglie la migliore, si ripete qualche centinaio di migliaia di volte.