Generative AI & LLMs advanced

RLHF (Reinforcement Learning from Human Feedback)

Also called: RLHF

Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.

L’RLHF raccoglie classifiche umane degli output del modello, addestra un modello di ricompensa a prevedere quelle preferenze e poi ottimizza il modello linguistico rispetto a esso. Questa fase di post-training è quasi tutta la differenza tra un semplice predittore del token successivo e un assistente utilizzabile. Codifica anche le preferenze di chi ha stilato le classifiche, il che è un limite reale e poco discusso.

In pratica: Due risposte, un essere umano sceglie la migliore, si ripete qualche centinaio di migliaia di volte.

Where this comes up