Verdiiterasjon
Sveip for å vise menyen
Selv om policy iteration er en effektiv metode for å løse MDP-er, har den en betydelig ulempe: hver iterasjon innebærer et eget trinn for policy evaluation. Når policy evaluation utføres iterativt, krever det flere gjennomganger av hele state space, noe som fører til betydelig beregningsmessig belastning og lengre kjøretider.
Et godt alternativ er value iteration, en metode som kombinerer policy evaluation og policy improvement i ett enkelt trinn. Denne metoden oppdaterer verdifunksjonen direkte til den konvergerer mot optimal value function. Når konvergens er oppnådd, kan optimal policy utledes direkte fra denne optimale verdifunksjonen.
Hvordan fungerer det?
Value iteration fungerer ved å utføre kun én backup under policy evaluation før policy improvement. Dette gir følgende oppdateringsformel:
vk+1(s)←amaxs′,r∑p(s′,r∣s,a)(r+γvk(s′))∀s∈SVed å gjøre Bellmans optimalitetslikning om til en oppdateringsregel, slås policy evaluation og policy improvement sammen til ett trinn.
Pseudokode
Takk for tilbakemeldingene dine!
Spør AI
Spør AI
Spør om hva du vil, eller prøv ett av de foreslåtte spørsmålene for å starte chatten vår