Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lära Generaliserad Policyiteration | Dynamisk Programmering
Introduktion till Reinforcement Learning med Python

Generaliserad Policyiteration

Svep för att visa menyn

I tidigare kapitel lärde du dig om policyevaluering och policyförbättring. Dessa processer kompletterar varandra och kombineras naturligt i ett ramverk som kallas generaliserad policyiteration.

Note
Definition

Generaliserad policyiteration (GPI) är ett ramverk där policyevaluering och policyförbättring samverkar iterativt med det gemensamma målet att bestämma en optimal policy.

De flesta metoder inom förstärkningsinlärning kan beskrivas inom ramen för GPI. De viktigaste skillnaderna mellan dessa metoder beror på specifika implementationer av policyevaluering och policyförbättring, samt karaktären på deras interaktioner.

Interaktion mellan två processer

Policyevaluering och policyförbättring kan ses som både samarbetande och konkurrerande processer, beroende på perspektivet:

  • Samarbetande: båda processerna arbetar mot ett gemensamt mål—att hitta optimal policy och värdefunktion. Policyevaluering uppskattar värdefunktionen för en given policy, medan policyförbättring förfinar policyn baserat på dessa uppskattningar;
  • Konkurrerande: varje process har motstridiga mål. Policyevaluering syftar till att noggrant uppskatta värdefunktionen för den aktuella policyn, vilket ofta gör att policyn inte längre är girig. Omvänt justerar policyförbättring policyn till att vara girig med avseende på de aktuella värdefunktionsuppskattningarna, vilket vanligtvis gör dessa uppskattningar felaktiga. Denna ständiga dragkamp fortsätter tills både policyn och värdefunktionen konvergerar till sina optimala former.
Generaliserad policyiteration

Sammanfattning

Generaliserad policyiteration är ett användbart ramverk för att förstå hur olika metoder inom förstärkningsinlärning angriper lösningen av MDP:er. I de kommande kapitlen kommer du att utforska hur dessa idéer kan tillämpas för att skapa två grundläggande DP-metoder: policyiteration och värdeiteration.

question mark

Välj de två processer som arbetar tillsammans i ramverket för generaliserad policyiteration

Välj alla rätta svar

Var allt tydligt?

Hur kan vi förbättra det?

Tack för dina kommentarer!

Avsnitt 3. Kapitel 6

Fråga AI

expand

Fråga AI

ChatGPT

Fråga vad du vill eller prova någon av de föreslagna frågorna för att starta vårt samtal

Avsnitt 3. Kapitel 6
some-alt