Foundations intermediate

Reinforcement Learning

Also called: RL

Learning by trial and error, guided by rewards rather than labelled answers.

Ein Reinforcement-Learning-Agent handelt in einer Umgebung, beobachtet, was passiert, und erhält ein Belohnungssignal. Über viele Episoden lernt er eine Strategie, die die erwartete Belohnung maximiert. RL steckt hinter spielenden Systemen und, in abgewandelter Form, hinter dem Alignment-Schritt moderner Chat-Modelle.

In der Praxis: Ein Agent lernt ein Spiel, ohne dass ihm die Regeln erklärt werden — nur an einem Punktestand, der steigt oder fällt.

Where this comes up