Generative AI & LLMs advanced

RLHF (Reinforcement Learning from Human Feedback)

Also called: RLHF

Training a model on human preference judgements so it becomes helpful and well-behaved rather than merely fluent.

O RLHF coleta rankings humanos de saídas do modelo, treina um modelo de recompensa para prever essas preferências e depois otimiza o modelo de linguagem contra ele. Essa etapa de pós-treinamento responde pela maior parte da diferença entre um preditor bruto do próximo token e um assistente utilizável. Ela também codifica as preferências de quem fez os rankings, o que é uma limitação real e pouco discutida.

Na prática: Duas respostas, um humano escolhe a melhor, repita algumas centenas de milhares de vezes.

Where this comes up