Wertiteration
Swipe um das Menü anzuzeigen
Obwohl Policy Iteration ein effektiver Ansatz zur Lösung von MDPs ist, weist sie einen erheblichen Nachteil auf: Jeder Iterationsschritt beinhaltet eine separate Policy Evaluation. Wird die Policy Evaluation iterativ durchgeführt, sind mehrere Durchläufe über den gesamten State Space erforderlich, was zu erheblichem Rechenaufwand und längeren Berechnungszeiten führt.
Eine gute Alternative ist die Value Iteration, eine Methode, die Policy Evaluation und Policy Improvement in einem einzigen Schritt zusammenführt. Diese Methode aktualisiert die Value Function direkt, bis sie zur optimalen Value Function konvergiert. Nach der Konvergenz kann die optimale Policy direkt aus dieser optimalen Value Function abgeleitet werden.
Funktionsweise
Die Value Iteration arbeitet, indem sie während der Policy Evaluation nur ein Backup durchführt, bevor die Policy Improvement erfolgt. Dies führt zur folgenden Aktualisierungsformel:
vk+1(s)←amaxs′,r∑p(s′,r∣s,a)(r+γvk(s′))∀s∈SDurch die Umwandlung der Bellman-Optimalitätsgleichung in eine Aktualisierungsregel werden Policy Evaluation und Policy Improvement in einem einzigen Schritt zusammengeführt.
Pseudocode
Danke für Ihr Feedback!
Fragen Sie AI
Fragen Sie AI
Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen
Wertiteration
Obwohl Policy Iteration ein effektiver Ansatz zur Lösung von MDPs ist, weist sie einen erheblichen Nachteil auf: Jeder Iterationsschritt beinhaltet eine separate Policy Evaluation. Wird die Policy Evaluation iterativ durchgeführt, sind mehrere Durchläufe über den gesamten State Space erforderlich, was zu erheblichem Rechenaufwand und längeren Berechnungszeiten führt.
Eine gute Alternative ist die Value Iteration, eine Methode, die Policy Evaluation und Policy Improvement in einem einzigen Schritt zusammenführt. Diese Methode aktualisiert die Value Function direkt, bis sie zur optimalen Value Function konvergiert. Nach der Konvergenz kann die optimale Policy direkt aus dieser optimalen Value Function abgeleitet werden.
Funktionsweise
Die Value Iteration arbeitet, indem sie während der Policy Evaluation nur ein Backup durchführt, bevor die Policy Improvement erfolgt. Dies führt zur folgenden Aktualisierungsformel:
vk+1(s)←amaxs′,r∑p(s′,r∣s,a)(r+γvk(s′))∀s∈SDurch die Umwandlung der Bellman-Optimalitätsgleichung in eine Aktualisierungsregel werden Policy Evaluation und Policy Improvement in einem einzigen Schritt zusammengeführt.
Pseudocode
Danke für Ihr Feedback!