RLHF (Reinforcement Learning from Human Feedback)
Also called: RLHF
Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.
El RLHF recopila rankings humanos de las salidas del modelo, entrena un modelo de recompensa para predecir esas preferencias y luego optimiza el modelo de lenguaje contra él. Ese paso de post-entrenamiento es casi toda la diferencia entre un predictor crudo del siguiente token y un asistente usable. También codifica las preferencias de quien hizo el ranking, que es una limitación real y poco discutida.
En la práctica: Dos respuestas, un humano elige la mejor, y se repite unos cientos de miles de veces.