Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Leer Beleiditeratie | Dynamisch Programmeren
Introductie tot Reinforcement Learning met Python

Beleiditeratie

Veeg om het menu te tonen

Het idee achter policy iteration is eenvoudig:

  1. Neem een initiële π\pi en vv;
  2. Gebruik policy evaluation om vv bij te werken totdat deze consistent is met π\pi;
  3. Gebruik policy improvement om π\pi bij te werken totdat deze greedy is ten opzichte van vv;
  4. Herhaal stappen 2-3 tot convergentie.

Bij deze methode zijn er geen gedeeltelijke updates:

  • Tijdens policy evaluation worden waarden voor elke toestand bijgewerkt totdat ze consistent zijn met het huidige beleid;
  • Tijdens policy improvement wordt het beleid greedy gemaakt ten opzichte van de waarde-functie.

Pseudocode

Pseudocode voor policy iteration
question mark

Op basis van de pseudocode, welke voorwaarde zorgt ervoor dat de buitenste lus van beleidsiteratie stopt?

Selecteer het correcte antwoord

Was alles duidelijk?

Hoe kunnen we het verbeteren?

Bedankt voor je feedback!

Sectie 3. Hoofdstuk 7

Vraag AI

expand

Vraag AI

ChatGPT

Vraag wat u wilt of probeer een van de voorgestelde vragen om onze chat te starten.

Beleiditeratie

Het idee achter policy iteration is eenvoudig:

  1. Neem een initiële π\pi en vv;
  2. Gebruik policy evaluation om vv bij te werken totdat deze consistent is met π\pi;
  3. Gebruik policy improvement om π\pi bij te werken totdat deze greedy is ten opzichte van vv;
  4. Herhaal stappen 2-3 tot convergentie.

Bij deze methode zijn er geen gedeeltelijke updates:

  • Tijdens policy evaluation worden waarden voor elke toestand bijgewerkt totdat ze consistent zijn met het huidige beleid;
  • Tijdens policy improvement wordt het beleid greedy gemaakt ten opzichte van de waarde-functie.

Pseudocode

Pseudocode voor policy iteration
Was alles duidelijk?

Hoe kunnen we het verbeteren?

Bedankt voor je feedback!

Sectie 3. Hoofdstuk 7
some-alt