Foundations intermediate

Reinforcement Learning

Also called: RL

Learning by trial and error, guided by rewards rather than labelled answers.

Un agent d’apprentissage par renforcement agit dans un environnement, observe ce qui se passe et reçoit un signal de récompense. Au fil de nombreux épisodes, il apprend une politique qui maximise la récompense attendue. L’apprentissage par renforcement est derrière les systèmes qui jouent à des jeux et, sous une forme modifiée, derrière l’étape d’alignement des modèles de chat modernes.

En pratique : Un agent apprend à jouer sans qu’aucune règle ne lui soit expliquée — seulement un score qui monte ou qui descend.

Where this comes up