Q-Learning: Aprendizaje TD Fuera de Política
Desliza para mostrar el menú
Aprendizaje de una política óptima con SARSA puede ser desafiante. Similar al control Monte Carlo on-policy, normalmente requiere una disminución gradual de ε con el tiempo, acercándose eventualmente a cero para pasar de la exploración a la explotación. Este proceso suele ser lento y puede requerir un tiempo de entrenamiento extenso. Una alternativa es utilizar un método off-policy como Q-learning.
Q-learning es un algoritmo de control TD off-policy utilizado para estimar la función de valor de acción óptima q∗(s,a). Actualiza sus estimaciones basándose en la mejor acción actual, lo que lo convierte en un algoritmo off-policy.
Regla de actualización
A diferencia del control Monte Carlo fuera de política, Q-learning no requiere muestreo de importancia para corregir las diferencias entre las políticas de comportamiento y objetivo. En su lugar, utiliza una regla de actualización directa que se asemeja mucho a SARSA, pero con una diferencia clave.
La regla de actualización de Q-learning es:
Q(St,At)←Q(St,At)+α(Rt+1+γamaxQ(St+1,a)−Q(St,At))La única diferencia con SARSA está en el valor objetivo. En lugar de usar el valor de la siguiente acción realmente tomada, como hace SARSA:
γQ(St+1,At+1)Q-learning utiliza el valor de la mejor acción posible siguiente:
γamaxQ(St+1,a)Este cambio sutil tiene un gran impacto: permite que Q-learning evalúe las acciones utilizando una estimación de la política óptima, incluso mientras el agente sigue explorando. Eso es lo que lo convierte en un método fuera de política: aprende sobre la política codiciosa, independientemente de las acciones elegidas durante el entrenamiento.
¿Cuándo usar Q-Learning?
Q-learning es preferible cuando:
- Se trabaja con entornos deterministas, o entornos;
- Se necesita una mayor velocidad de convergencia.
¡Gracias por tus comentarios!
Pregunte a AI
Pregunte a AI
Pregunte lo que quiera o pruebe una de las preguntas sugeridas para comenzar nuestra charla