Optimaalisuusehdot
Pyyhkäise näyttääksesi valikon
Edellisessä luvussa opit Bellmanin yhtälöistä tilan arvo- ja tila-toimintoarvofunktioille. Nämä yhtälöt kuvaavat, kuinka tilojen arvot voidaan määritellä rekursiivisesti muiden tilojen arvojen kautta, ja arvot riippuvat annetusta politiikasta. Kaikki politiikat eivät kuitenkaan ole yhtä tehokkaita. Arvofunktiot muodostavatkin politiikoille osittaisjärjestyksen, joka voidaan esittää seuraavasti:
π≥π′⟺vπ(s)≥vπ′(s)∀s∈SPolitiikka π on parempi tai yhtä hyvä kuin politiikka π′, jos kaikissa mahdollisissa tiloissa politiikan π odotettu tuotto ei ole pienempi kuin politiikan π′ odotettu tuotto.
Osittaisjärjestys noudattaa tavanomaisia järjestyssääntöjä, mutta ei pakota vertailemaan jokaista paria. Tässä tapauksessa voimme järjestää kaksi politiikkaa vain, jos ne tuottavat samat tulokset tai toinen selvästi ylittää toisen. Muissa tapauksissa politiikat jäävät vertaamattomiksi.
Optimaalinen politiikka
Jokaisessa MDP:ssä on olemassa vähintään yksi politiikka, joka on yhtä hyvä tai parempi kuin kaikki muut politiikat. Tätä politiikkaa kutsutaan optimaaliseksi politiikaksi π∗. Vaikka optimaalisia politiikkoja voi olla useita, niitä kaikkia merkitään π∗.
Miksi optimaalinen politiikka on aina olemassa?
Saatat miettiä, miksi optimaalinen politiikka aina on olemassa missä tahansa MDP:ssä. Tämä on hyvä kysymys, ja sen taustalla oleva intuitio on yllättävän yksinkertainen. Muista, että tilat MDP:ssä kuvaavat täysin ympäristön tilan. Tämä tarkoittaa, että jokainen tila on riippumaton muista: yhdessä tilassa valittu toiminto ei vaikuta muiden tilojen palkkioihin tai lopputuloksiin. Valitsemalla siis optimaalisimman toiminnon jokaisessa tilassa erikseen, päädyt luonnollisesti kokonaisuudessaan parhaaseen toimintojen sarjaan koko prosessin aikana. Tämä joukko optimaalisia toimintoja jokaisessa tilassa muodostaa optimaalisen politiikan.
Lisäksi on aina olemassa vähintään yksi politiikka, joka on sekä optimaalinen että deterministinen. Jos jossakin tilassa s kaksi toimintoa a ja a′ tuottavat saman odotetun tuoton, yhden valitseminen ei vaikuta politiikan optimaalisuuteen. Soveltamalla tätä periaatetta kaikkiin tiloihin politiikasta tulee deterministinen säilyttäen samalla sen optimaalisuuden.
Optimaaliset arvofunktiot
Optimaaliset politiikat jakavat samat arvofunktiot — tämä käy ilmi, kun tarkastellaan, miten politiikkoja verrataan. Tämä tarkoittaa, että optimaaliset politiikat jakavat sekä tilan arvon funktion että toiminnon arvon funktion.
Lisäksi optimaalisilla arvofunktioilla on omat Bellmanin yhtälönsä, jotka voidaan kirjoittaa viittaamatta mihinkään tiettyyn politiikkaan. Näitä yhtälöitä kutsutaan Bellmanin optimaalisen yhtälöiksi.
Optimaalinen tilan arvon funktio
Optimaalinen tilan arvofunktio V∗ (tai v∗) kuvaa suurimman odotetun tuoton, joka on saavutettavissa tietyssä tilassa noudattamalla optimaalista politiikkaa.
Se voidaan määritellä matemaattisesti seuraavasti:
v∗(s)=πmaxvπ(s)=Eπ∗[Gt∣St=s]Bellmanin optimaalinen yhtälö tälle arvofunktiolle voidaan johtaa seuraavasti:
v∗(s)=a∑π∗(a∣s)s′,r∑p(s′,r∣s,a)(r+γv∗(s′))=amaxs′,r∑p(s′,r∣s,a)(r+γv∗(s′))Intuitio
Kuten jo tiedät, on aina olemassa vähintään yksi politiikka, joka on sekä optimaalinen että deterministinen. Tällainen politiikka valitsee jokaisessa tilassa johdonmukaisesti yhden tietyn toimen, joka maksimoi odotetun tuoton. Tämän vuoksi optimaalisen toimen valitsemisen todennäköisyys on aina 1, ja minkä tahansa muun toimen todennäköisyys on 0. Tämän perusteella alkuperäinen Bellmanin yhtälö ei enää tarvitse summamerkkiä. Koska tiedämme valitsevamme aina parhaan mahdollisen toimen, voimme yksinkertaisesti korvata summan ottamalla maksimin kaikista mahdollisista toimista.
Optimaalinen toimintojen arvofunktio
Optimaalinen toimintojen arvofunktio Q∗ (tai q∗) kuvaa suurimman odotetun tuoton, joka voidaan saavuttaa suorittamalla tietty toimi tietyssä tilassa ja noudattamalla sen jälkeen optimaalista politiikkaa.
Se voidaan määritellä matemaattisesti seuraavasti:
q∗(s,a)=πmaxqπ(s,a)=Eπ∗[Gt∣St=s,At=a]Bellmanin optimaalisuusyhtälö tälle arvon funktiolle voidaan johtaa seuraavasti:
q∗(s,a)=s′,r∑p(s′,r∣s,a)(r+γa′∑π∗(a′∣s′)q∗(s′,a′))=s′,r∑p(s′,r∣s,a)(r+γa′maxq∗(s′,a′))Intuitio
Samoin kuin tilan arvon funktiossa, summa voidaan korvata ottamalla maksimi kaikista mahdollisista toiminnoista.
Kiitos palautteestasi!
Kysy tekoälyä
Kysy tekoälyä
Kysy mitä tahansa tai kokeile jotakin ehdotetuista kysymyksistä aloittaaksesi keskustelumme