Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Aprende Iteración de Políticas Generalizada | Programación Dinámica
Introducción al Aprendizaje por Refuerzo con Python

Iteración de Políticas Generalizada

Desliza para mostrar el menú

En capítulos anteriores, aprendiste sobre la evaluación de políticas y la mejora de políticas. Estos procesos se complementan entre sí y se combinan de forma natural en un marco conocido como iteración generalizada de políticas.

Note
Definición

La iteración generalizada de políticas (GPI) es un marco en el que la evaluación de políticas y la mejora de políticas interactúan de manera iterativa con el objetivo común de determinar una política óptima.

La mayoría de los métodos de aprendizaje por refuerzo pueden describirse dentro del marco de la GPI. Las principales diferencias entre estos métodos provienen de las implementaciones específicas de la evaluación y mejora de políticas, así como de la naturaleza de sus interacciones.

Interacción entre dos procesos

La evaluación de políticas y la mejora de políticas pueden considerarse procesos tanto cooperativos como competitivos, según la perspectiva:

  • Cooperativos: ambos procesos trabajan hacia un objetivo común: encontrar la política y función de valor óptimas. La evaluación de políticas estima la función de valor para una política dada, mientras que la mejora de políticas refina la política basándose en estas estimaciones;
  • Competitivos: cada proceso tiene objetivos en conflicto. La evaluación de políticas busca estimar con precisión la función de valor para la política actual, lo que a menudo provoca que la política deje de ser codiciosa. Por el contrario, la mejora de políticas ajusta la política para que sea codiciosa respecto a las estimaciones actuales de la función de valor, lo que típicamente vuelve incorrectas esas estimaciones. Esta constante dinámica de fuerzas continúa hasta que tanto la política como la función de valor convergen a sus formas óptimas.
Iteración generalizada de políticas

Resumen

La iteración generalizada de políticas es un marco útil para comprender cómo los diferentes métodos de aprendizaje por refuerzo abordan la resolución de los MDPs. En los próximos capítulos, explorarás cómo estas ideas pueden aplicarse para crear dos métodos esenciales de programación dinámica: iteración de políticas e iteración de valores.

question mark

Selecciona los dos procesos que trabajan juntos en el marco de la iteración generalizada de políticas

Selecciona todas las respuestas correctas

¿Todo estuvo claro?

¿Cómo podemos mejorarlo?

¡Gracias por tus comentarios!

Sección 3. Capítulo 6

Pregunte a AI

expand

Pregunte a AI

ChatGPT

Pregunte lo que quiera o pruebe una de las preguntas sugeridas para comenzar nuestra charla

Sección 3. Capítulo 6
some-alt