Generalisierte Politikiteration
Swipe um das Menü anzuzeigen
In den vorherigen Kapiteln wurden Politikbewertung und Politikverbesserung behandelt. Diese Prozesse ergänzen sich gegenseitig und werden auf natürliche Weise in einem Rahmenwerk zusammengeführt, das als generalisierte Politikiteration bekannt ist.
Generalisierte Politikiteration (GPI) ist ein Rahmenwerk, in dem Politikbewertung und Politikverbesserung iterativ miteinander interagieren, mit dem gemeinsamen Ziel, eine optimale Politik zu bestimmen.
Die meisten Methoden des Reinforcement Learning lassen sich im Rahmen der GPI beschreiben. Die wesentlichen Unterschiede zwischen diesen Methoden ergeben sich aus den konkreten Umsetzungen der Politikbewertung und Politikverbesserung sowie aus der Art ihrer Interaktionen.
Interaktion zwischen zwei Prozessen
Politikbewertung und Politikverbesserung können je nach Perspektive sowohl als kooperative als auch als kompetitive Prozesse betrachtet werden:
- Kooperativ: Beide Prozesse arbeiten auf ein gemeinsames Ziel hin—die optimale Politik und Wertfunktion zu finden. Die Politikbewertung schätzt die Wertfunktion für eine gegebene Politik, während die Politikverbesserung die Politik auf Grundlage dieser Schätzungen verfeinert;
- Kompetitiv: Jeder Prozess verfolgt widersprüchliche Ziele. Die Politikbewertung zielt darauf ab, die Wertfunktion für die aktuelle Politik genau zu schätzen, was häufig dazu führt, dass die Politik nicht mehr gierig ist. Im Gegensatz dazu passt die Politikverbesserung die Politik so an, dass sie bezüglich der aktuellen Wertfunktionsschätzungen gierig ist, wodurch diese Schätzungen typischerweise falsch werden. Dieses ständige Wechselspiel setzt sich fort, bis sowohl die Politik als auch die Wertfunktion ihre optimalen Formen erreicht haben.
Zusammenfassung
Generalisierte Politikiteration ist ein nützliches Rahmenwerk, um zu verstehen, wie verschiedene Methoden des Reinforcement Learnings an die Lösung von MDPs herangehen. In den kommenden Kapiteln wird erläutert, wie diese Konzepte zur Entwicklung von zwei grundlegenden DP-Methoden angewendet werden können: Politikiteration und Wertiteration.
Danke für Ihr Feedback!
Fragen Sie AI
Fragen Sie AI
Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen
Generalisierte Politikiteration
In den vorherigen Kapiteln wurden Politikbewertung und Politikverbesserung behandelt. Diese Prozesse ergänzen sich gegenseitig und werden auf natürliche Weise in einem Rahmenwerk zusammengeführt, das als generalisierte Politikiteration bekannt ist.
Generalisierte Politikiteration (GPI) ist ein Rahmenwerk, in dem Politikbewertung und Politikverbesserung iterativ miteinander interagieren, mit dem gemeinsamen Ziel, eine optimale Politik zu bestimmen.
Die meisten Methoden des Reinforcement Learning lassen sich im Rahmen der GPI beschreiben. Die wesentlichen Unterschiede zwischen diesen Methoden ergeben sich aus den konkreten Umsetzungen der Politikbewertung und Politikverbesserung sowie aus der Art ihrer Interaktionen.
Interaktion zwischen zwei Prozessen
Politikbewertung und Politikverbesserung können je nach Perspektive sowohl als kooperative als auch als kompetitive Prozesse betrachtet werden:
- Kooperativ: Beide Prozesse arbeiten auf ein gemeinsames Ziel hin—die optimale Politik und Wertfunktion zu finden. Die Politikbewertung schätzt die Wertfunktion für eine gegebene Politik, während die Politikverbesserung die Politik auf Grundlage dieser Schätzungen verfeinert;
- Kompetitiv: Jeder Prozess verfolgt widersprüchliche Ziele. Die Politikbewertung zielt darauf ab, die Wertfunktion für die aktuelle Politik genau zu schätzen, was häufig dazu führt, dass die Politik nicht mehr gierig ist. Im Gegensatz dazu passt die Politikverbesserung die Politik so an, dass sie bezüglich der aktuellen Wertfunktionsschätzungen gierig ist, wodurch diese Schätzungen typischerweise falsch werden. Dieses ständige Wechselspiel setzt sich fort, bis sowohl die Politik als auch die Wertfunktion ihre optimalen Formen erreicht haben.
Zusammenfassung
Generalisierte Politikiteration ist ein nützliches Rahmenwerk, um zu verstehen, wie verschiedene Methoden des Reinforcement Learnings an die Lösung von MDPs herangehen. In den kommenden Kapiteln wird erläutert, wie diese Konzepte zur Entwicklung von zwei grundlegenden DP-Methoden angewendet werden können: Politikiteration und Wertiteration.
Danke für Ihr Feedback!