Reinforcement Learning
Also called: RL
Learning by trial and error, guided by rewards rather than labelled answers.
Un agente de aprendizaje por refuerzo actúa en un entorno, observa lo que pasa y recibe una señal de recompensa. A lo largo de muchos episodios aprende una política que maximiza la recompensa esperada. El aprendizaje por refuerzo está detrás de los sistemas que juegan partidas y, en forma modificada, detrás del paso de alineación de los modelos de chat modernos.
En la práctica: Un agente aprende a jugar sin que le expliquen ninguna regla — solo con un puntaje que sube o baja.
Where this comes up
- AI Learning Roadmap for Beginners: Your Comprehensive Guide
- AI Training for Logistics Coordinators: Your Path to Success
- AI for Trading Course: Your Complete Guide to Learning and Success
- Best AI Side Hustles in 2026: 50 Beginner Ideas, Tools & Pay
- Claude vs ChatGPT 2026: Which AI Is Better for You?
- Grok vs ChatGPT in 2026: Benchmarks, Pricing & Best Use Cases