Foundations intermediate

Reinforcement Learning

Also called: RL

Learning by trial and error, guided by rewards rather than labelled answers.

Un agente di apprendimento per rinforzo agisce in un ambiente, osserva cosa succede e riceve un segnale di ricompensa. Nel corso di molti episodi impara una policy che massimizza la ricompensa attesa. L’RL sta dietro ai sistemi che giocano e, in forma modificata, dietro alla fase di allineamento dei moderni modelli di chat.

In pratica: Un agente impara a giocare senza che gli venga spiegata alcuna regola — solo un punteggio che sale o scende.

Where this comes up