Reinforcement Learning
Also called: RL
Learning by trial and error, guided by rewards rather than labelled answers.
Um agente de aprendizado por reforço age em um ambiente, observa o que acontece e recebe um sinal de recompensa. Ao longo de muitos episódios, ele aprende uma política que maximiza a recompensa esperada. O RL está por trás de sistemas que jogam jogos e, em forma modificada, por trás da etapa de alinhamento dos modelos de chat modernos.
Na prática: Um agente aprende a jogar sem que nenhuma regra seja explicada — apenas um placar que sobe ou desce.
Where this comes up
- AI Learning Roadmap for Beginners: Your Comprehensive Guide
- AI Training for Logistics Coordinators: Your Path to Success
- AI for Trading Course: Your Complete Guide to Learning and Success
- Best AI Side Hustles in 2026: 50 Beginner Ideas, Tools & Pay
- Claude vs ChatGPT 2026: Which AI Is Better for You?
- Grok vs ChatGPT in 2026: Benchmarks, Pricing & Best Use Cases