En el ámbito del machine learning y el control óptimo, el aprendizaje por refuerzo (RL, por sus siglas en inglés) se centra en cómo un agente inteligente debe tomar decisiones y ejecutar acciones en un entorno dinámico con el objetivo de maximizar una señal de recompensa a largo plazo.

Paradigmas del Aprendizaje Automático
El aprendizaje por refuerzo se distingue de los otros dos enfoques principales de la IA de la siguiente manera:
- Aprendizaje Supervisado: Intenta descubrir patrones en datos etiquetados.
- Aprendizaje No Supervisado: Busca patrones en datos no etiquetados.
- Aprendizaje por Refuerzo: Entrena a un agente a través de interacciones directas con su entorno, aprendiendo mediante ensayo y error.
El Dilema de Exploración vs. Explotación
Para maximizar las recompensas, el agente debe equilibrar dos estrategias fundamentales:
- Exploración: Probar nuevas acciones para obtener más información sobre el entorno y descubrir mejores estrategias.
- Explotación: Utilizar el conocimiento actual para tomar la acción que se sabe que produce la mejor recompensa.
La búsqueda del equilibrio óptimo entre estas dos estrategias se conoce como el dilema de exploración-explotación.
Principios y Modelado Matemático
Debido a su versatilidad, el RL es estudiado en diversas disciplinas como la teoría de juegos, la investigación de operaciones, la teoría de control y la estadística. En algunos contextos, se le denomina programación dinámica aproximada o programación neuro-dinámica.
El Proceso de Decisión de Markov (MDP)
El aprendizaje por refuerzo básico se modela generalmente como un Proceso de Decisión de Markov, que consta de los siguientes elementos:
| Elemento | Descripción |
|---|---|
| Espacio de Estados (S) | El conjunto de todas las situaciones posibles en las que el agente puede encontrarse. |
| Espacio de Acciones (A) | El conjunto de todas las acciones que el agente puede ejecutar. |
| Probabilidad de Transición | La probabilidad de pasar de un estado s a un estado s' al realizar una acción a. |
| Recompensa (R) | La señal inmediata recibida tras la transición entre estados. |
Diferencias con la Programación Dinámica Clásica
A diferencia de los métodos de programación dinámica tradicionales, los algoritmos de RL no asumen que se conoce el modelo matemático exacto del proceso de decisión de Markov. Esto permite que el RL sea aplicable a entornos complejos y extensos donde los métodos exactos resultan inviables.

