Generative AI & LLMs advanced

RLHF (Reinforcement Learning from Human Feedback)

Also called: RLHF

Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.

El RLHF recopila rankings humanos de las salidas del modelo, entrena un modelo de recompensa para predecir esas preferencias y luego optimiza el modelo de lenguaje contra él. Ese paso de post-entrenamiento es casi toda la diferencia entre un predictor crudo del siguiente token y un asistente usable. También codifica las preferencias de quien hizo el ranking, que es una limitación real y poco discutida.

En la práctica: Dos respuestas, un humano elige la mejor, y se repite unos cientos de miles de veces.

Where this comes up