Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Politikiteration | Dynamische Programmierung
Einführung in Reinforcement Learning mit Python

Politikiteration

Swipe um das Menü anzuzeigen

Die Idee hinter der Policy Iteration ist einfach:

  1. Eine anfängliche π\pi und vv wählen;
  2. Mit der Policy Evaluation vv aktualisieren, bis es mit π\pi konsistent ist;
  3. Mit der Policy Improvement π\pi aktualisieren, bis sie bezüglich vv gierig ist;
  4. Schritte 2-3 wiederholen, bis Konvergenz erreicht ist.

Bei dieser Methode gibt es keine partiellen Aktualisierungen:

  • Während der Policy Evaluation werden die Werte für jeden Zustand aktualisiert, bis sie mit der aktuellen Policy übereinstimmen;
  • Während der Policy Improvement wird die Policy bezüglich der Wertfunktion gierig gemacht.

Pseudocode

Pseudocode für Policy Iteration
question mark

Basierend auf dem Pseudocode: Welche Bedingung führt dazu, dass die äußere Schleife der Policy-Iteration stoppt?

Wählen Sie die richtige Antwort aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 3. Kapitel 7

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Politikiteration

Die Idee hinter der Policy Iteration ist einfach:

  1. Eine anfängliche π\pi und vv wählen;
  2. Mit der Policy Evaluation vv aktualisieren, bis es mit π\pi konsistent ist;
  3. Mit der Policy Improvement π\pi aktualisieren, bis sie bezüglich vv gierig ist;
  4. Schritte 2-3 wiederholen, bis Konvergenz erreicht ist.

Bei dieser Methode gibt es keine partiellen Aktualisierungen:

  • Während der Policy Evaluation werden die Werte für jeden Zustand aktualisiert, bis sie mit der aktuellen Policy übereinstimmen;
  • Während der Policy Improvement wird die Policy bezüglich der Wertfunktion gierig gemacht.

Pseudocode

Pseudocode für Policy Iteration
War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 3. Kapitel 7
some-alt