Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Leer Waarde-Iteratie | Dynamisch Programmeren
Introductie tot Reinforcement Learning met Python

Waarde-Iteratie

Veeg om het menu te tonen

Hoewel policy iteration een effectieve methode is voor het oplossen van MDP's, heeft het een belangrijk nadeel: elke iteratie omvat een afzonderlijke policy evaluation stap. Wanneer policy evaluation iteratief wordt uitgevoerd, zijn er meerdere doorlopen van de volledige state space nodig, wat leidt tot aanzienlijke computationele overhead en langere rekentijden.

Een goed alternatief is value iteration, een methode die policy evaluation en policy improvement samenvoegt tot één enkele stap. Deze methode werkt de value function direct bij totdat deze convergeert naar de optimale value function. Zodra convergentie is bereikt, kan de optimale policy direct uit deze optimale value function worden afgeleid.

Hoe werkt het?

Value iteration werkt door slechts één backup uit te voeren tijdens policy evaluation, voordat policy improvement wordt toegepast. Dit resulteert in de volgende updateformule:

vk+1(s)maxas,rp(s,rs,a)(r+γvk(s))sSv_{k+1}(s) \gets \max_a \sum_{s',r}p(s',r|s,a)\Bigl(r+\gamma v_k(s')\Bigr) \qquad \forall s \in S

Door de Bellman optimaliteitsvergelijking om te zetten in een update-regel, worden policy evaluation en policy improvement samengevoegd tot één enkele stap.

Pseudocode

Pseudocode voor waarde-iteratie
question mark

Op basis van de pseudocode, wanneer stopt de waarde-iteratie?

Selecteer het correcte antwoord

Was alles duidelijk?

Hoe kunnen we het verbeteren?

Bedankt voor je feedback!

Sectie 3. Hoofdstuk 8

Vraag AI

expand

Vraag AI

ChatGPT

Vraag wat u wilt of probeer een van de voorgestelde vragen om onze chat te starten.

Waarde-Iteratie

Hoewel policy iteration een effectieve methode is voor het oplossen van MDP's, heeft het een belangrijk nadeel: elke iteratie omvat een afzonderlijke policy evaluation stap. Wanneer policy evaluation iteratief wordt uitgevoerd, zijn er meerdere doorlopen van de volledige state space nodig, wat leidt tot aanzienlijke computationele overhead en langere rekentijden.

Een goed alternatief is value iteration, een methode die policy evaluation en policy improvement samenvoegt tot één enkele stap. Deze methode werkt de value function direct bij totdat deze convergeert naar de optimale value function. Zodra convergentie is bereikt, kan de optimale policy direct uit deze optimale value function worden afgeleid.

Hoe werkt het?

Value iteration werkt door slechts één backup uit te voeren tijdens policy evaluation, voordat policy improvement wordt toegepast. Dit resulteert in de volgende updateformule:

vk+1(s)maxas,rp(s,rs,a)(r+γvk(s))sSv_{k+1}(s) \gets \max_a \sum_{s',r}p(s',r|s,a)\Bigl(r+\gamma v_k(s')\Bigr) \qquad \forall s \in S

Door de Bellman optimaliteitsvergelijking om te zetten in een update-regel, worden policy evaluation en policy improvement samengevoegd tot één enkele stap.

Pseudocode

Pseudocode voor waarde-iteratie
Was alles duidelijk?

Hoe kunnen we het verbeteren?

Bedankt voor je feedback!

Sectie 3. Hoofdstuk 8
some-alt