Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lære Verdiiterasjon | Dynamisk Programmering
Introduksjon til Reinforcement Learning med Python

Verdiiterasjon

Sveip for å vise menyen

Selv om policy iteration er en effektiv metode for å løse MDP-er, har den en betydelig ulempe: hver iterasjon innebærer et eget trinn for policy evaluation. Når policy evaluation utføres iterativt, krever det flere gjennomganger av hele state space, noe som fører til betydelig beregningsmessig belastning og lengre kjøretider.

Et godt alternativ er value iteration, en metode som kombinerer policy evaluation og policy improvement i ett enkelt trinn. Denne metoden oppdaterer verdifunksjonen direkte til den konvergerer mot optimal value function. Når konvergens er oppnådd, kan optimal policy utledes direkte fra denne optimale verdifunksjonen.

Hvordan fungerer det?

Value iteration fungerer ved å utføre kun én backup under policy evaluation før policy improvement. Dette gir følgende oppdateringsformel:

vk+1(s)maxas,rp(s,rs,a)(r+γvk(s))sSv_{k+1}(s) \gets \max_a \sum_{s',r}p(s',r|s,a)\Bigl(r+\gamma v_k(s')\Bigr) \qquad \forall s \in S

Ved å gjøre Bellmans optimalitetslikning om til en oppdateringsregel, slås policy evaluation og policy improvement sammen til ett trinn.

Pseudokode

Pseudokode for verdiiterasjon
question mark

Basert på pseudokoden, når stopper verdiiterasjonen?

Velg det helt riktige svaret

Alt var klart?

Hvordan kan vi forbedre det?

Takk for tilbakemeldingene dine!

Seksjon 3. Kapittel 8

Spør AI

expand

Spør AI

ChatGPT

Spør om hva du vil, eller prøv ett av de foreslåtte spørsmålene for å starte chatten vår

Seksjon 3. Kapittel 8
some-alt