Generative AI & LLMs advanced

RLHF (Reinforcement Learning from Human Feedback)

Also called: RLHF

Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.

Le RLHF collecte des classements humains de sorties du modèle, entraîne un modèle de récompense à prédire ces préférences, puis optimise le modèle de langage contre lui. Cette étape de post-entraînement fait l’essentiel de la différence entre un simple prédicteur du token suivant et un assistant utilisable. Elle encode aussi les préférences de ceux qui ont fait le classement, ce qui est une limite réelle et trop peu discutée.

En pratique : Deux réponses, un humain choisit la meilleure, on répète quelques centaines de milliers de fois.

Where this comes up