Beleiditeratie
Veeg om het menu te tonen
Het idee achter policy iteration is eenvoudig:
- Neem een initiële π en v;
- Gebruik policy evaluation om v bij te werken totdat deze consistent is met π;
- Gebruik policy improvement om π bij te werken totdat deze greedy is ten opzichte van v;
- Herhaal stappen 2-3 tot convergentie.
Bij deze methode zijn er geen gedeeltelijke updates:
- Tijdens policy evaluation worden waarden voor elke toestand bijgewerkt totdat ze consistent zijn met het huidige beleid;
- Tijdens policy improvement wordt het beleid greedy gemaakt ten opzichte van de waarde-functie.
Pseudocode
Was alles duidelijk?
Bedankt voor je feedback!
Sectie 3. Hoofdstuk 7
Vraag AI
Vraag AI
Vraag wat u wilt of probeer een van de voorgestelde vragen om onze chat te starten.
Sectie 3. Hoofdstuk 7