Foundations intermediate

Reinforcement Learning

Also called: RL

Learning by trial and error, guided by rewards rather than labelled answers.

Um agente de aprendizado por reforço age em um ambiente, observa o que acontece e recebe um sinal de recompensa. Ao longo de muitos episódios, ele aprende uma política que maximiza a recompensa esperada. O RL está por trás de sistemas que jogam jogos e, em forma modificada, por trás da etapa de alinhamento dos modelos de chat modernos.

Na prática: Um agente aprende a jogar sem que nenhuma regra seja explicada — apenas um placar que sobe ou desce.

Where this comes up