Mikä on ajallisen eron oppiminen?
Pyyhkäise näyttääksesi valikon
Sekä dynaamisessa ohjelmoinnissa että Monte Carlo -menetelmissä on erinomaisia ideoita, mutta myös merkittäviä haittoja.
Dynaaminen ohjelmointi
Dynaaminen ohjelmointi mahdollistaa tilan arvofunktion tehokkaan laskemisen ja optimaalisen politiikan johtamisen siitä. Se hyödyntää bootstrappingia — nykyisen tilan arvon laskemista tulevien tilojen arvojen perusteella — tämän saavuttamiseksi.
Vaikka bootstrappingin idea onkin tehokas, dynaamisessa ohjelmoinnissa on kaksi merkittävää haittaa:
- Se vaatii täydellisen ja eksplisiittisen mallin ympäristöstä;
- Tilan arvot lasketaan jokaiselle tilalle, vaikka tila ei olisi lähelläkään optimaalista polkua.
Monte Carlo -menetelmät
Monte Carlo -menetelmät korjaavat dynaamisen ohjelmoinnin kaksi haittapuolta:
- Ne eivät vaadi mallia, vaan oppivat kokemuksesta;
- Kokemuksesta oppimisen tapa rajoittaa tutkimista, joten vähemmän tärkeisiin tiloihin päädytään harvoin.
Ne tuovat kuitenkin mukanaan uuden ongelman — oppimisprosessi tapahtuu vasta, kun episodi on päättynyt. Tämä rajoittaa Monte Carlo -menetelmien soveltuvuutta pieniin episodisiin tehtäviin, sillä suuremmat tehtävät vaatisivat valtavan määrän toimintoja ennen kuin episodi päättyy.
Aikaisen eron oppiminen
Aikaisen eron (TD) oppiminen yhdistää sekä dynaamisen ohjelmoinnin että Monte Carlo -menetelmien periaatteet. Se hyödyntää kokemuksesta oppimista Monte Carlo -menetelmistä ja yhdistää siihen bootstrappingin dynaamisesta ohjelmoinnista.
Tämän seurauksena TD-oppiminen korjaa molempien menetelmien suurimmat ongelmat:
- Kokemuksesta oppiminen ratkaisee mallin tarpeen ja suurten tilojen ongelman;
- Bootstrapping ratkaisee episodisen oppimisen ongelman.
Miten se toimii?
TD-oppiminen toimii yksinkertaisessa silmukassa:
- Arvon arviointi: agentti aloittaa alkuperäisellä arvauksella siitä, kuinka hyvä nykyinen tila on;
- Toiminnan suorittaminen: agentti suorittaa toiminnon, saa palkkion ja päätyy uuteen tilaan;
- Arvion päivittäminen: käyttäen palkkiota ja uuden tilan arvoa agentti säätää alkuperäistä arviotaan hieman tarkemmaksi;
- Toisto: ajan myötä, toistamalla tätä silmukkaa, agentti rakentaa vähitellen parempia ja tarkempia arviota eri tilojen arvoista.
Vertailutaulukko
Kiitos palautteestasi!
Kysy tekoälyä
Kysy tekoälyä
Kysy mitä tahansa tai kokeile jotakin ehdotetuista kysymyksistä aloittaaksesi keskustelumme