Foundations intermediate

Reinforcement Learning

Also called: RL

Learning by trial and error, guided by rewards rather than labelled answers.

Un agente de aprendizaje por refuerzo actúa en un entorno, observa lo que pasa y recibe una señal de recompensa. A lo largo de muchos episodios aprende una política que maximiza la recompensa esperada. El aprendizaje por refuerzo está detrás de los sistemas que juegan partidas y, en forma modificada, detrás del paso de alineación de los modelos de chat modernos.

En la práctica: Un agente aprende a jugar sin que le expliquen ninguna regla — solo con un puntaje que sube o baja.

Where this comes up