Markovbeslutsprocess
Svep för att visa menyn
Markovbeslutsprocess (MDP) är en matematisk ram som används för att modellera beslutsfattande problem där en agent interagerar med en miljö över tid.
Förstärkningsinlärningsproblem formuleras ofta som MDP:er, vilket ger ett strukturerat sätt att definiera problemet. MDP:er beskriver miljön med hjälp av fyra nyckelkomponenter: tillstånd, handlingar, övergångar och belöningar. Dessa komponenter samverkar enligt Markovegenskapen, som säkerställer att framtida tillstånd beror endast på nuvarande tillstånd och handling, inte på tidigare tillstånd.
De fyra komponenterna
Tillstånd
Ett tillstånd s är en representation av miljön vid en specifik tidpunkt. Mängden av alla möjliga tillstånd kallas tillståndsrum S.
Ett tillstånd representeras vanligtvis av en uppsättning parametrar som fångar de relevanta egenskaperna hos miljön. Dessa parametrar kan inkludera olika aspekter såsom position, hastighet, rotation, etc.
Åtgärd
En åtgärd a är ett beslut eller ett drag som agenten gör för att påverka miljön. Mängden av alla möjliga åtgärder kallas för ett aktionsutrymme A.
Mängden av möjliga åtgärder beror vanligtvis på nuvarande tillstånd.
Övergång
Övergång beskriver hur miljöns tillstånd förändras som svar på agentens handling. Övergångsfunktionen p anger sannolikheten för att gå från ett tillstånd till ett annat, givet en specifik handling.
I många fall kan miljöer vara antingen deterministiska eller stokastiska, vilket innebär att övergången kan vara förutsägbar eller innefatta en viss grad av slumpmässighet.
Belöning
En belöning r är ett numeriskt värde som agenten får efter att ha utfört en åtgärd i ett visst tillstånd. Funktionen som kopplar övergångar till förväntade belöningar kallas belöningsfunktion R.
Belöningar styr agenten mot önskvärt beteende och kan vara antingen positiva eller negativa. Belöningsdesign är komplext, eftersom agenten kan försöka utnyttja belöningarna.
Markovegenskapen
Markovegenskapen i en Markovbeslutsprocess innebär att nästa tillstånd och belöning beror endast på nuvarande tillstånd och handling, inte på tidigare information. Detta säkerställer en minneslös struktur, vilket förenklar inlärningsprocessen.
Matematiskt kan denna egenskap beskrivas med följande formel:
=P(Rt+1=r,St+1=s′∣St,At)=P(Rt+1=r,St+1=s′∣S0,A0,R1,...,St−1,At−1,Rt,St,At)där:
- St är ett tillstånd vid tidpunkt t;
- At är en åtgärd som utförs vid tidpunkt t;
- Rt är en belöning vid tidpunkt t.
Den minneslösa egenskapen hos MDP innebär inte att tidigare observationer ignoreras. Det aktuella tillståndet bör koda all relevant historisk information.
Tack för dina kommentarer!
Fråga AI
Fråga AI
Fråga vad du vill eller prova någon av de föreslagna frågorna för att starta vårt samtal