Etsintämenetelmät
Pyyhkäise näyttääksesi valikon
Exploring starts -oletus on hyödyllinen varmistamaan, että kaikki tilat (tila-toimintaparit) käydään ajan myötä läpi. Useimmissa todellisissa tehtävissä siinä on kuitenkin merkittävä haittapuoli: se vaatii mallin, joka alustaa agentin satunnaisiin tiloihin.
Harvinaisissa tapauksissa — kun ympäristö luonnostaan aloittaa jaksot satunnaisista tiloista, jotka kattavat koko tila-avaruuden — exploring starts voidaan käyttää ongelmitta. Yleisemmin tehtävissä on kuitenkin kiinteä tai rajallinen joukko aloitustiloja, jolloin tällainen satunnaistaminen ei ole mahdollista ilman osittaista mallia. Tämän mallin tulisi vähintään pystyä simuloimaan yksi askel ympäristössä mistä tahansa tilasta. Vaikka tämä onkin vähemmän vaativaa kuin täyden mallin tarve, se on usein epäkäytännöllistä.
Vaihtoehtoiset tutkimusmenetelmät
Jos satunnaisesta tilasta (tila-toimintapari) aloittaminen ei ole mahdollista, vaihtoehtona on varmistaa, että jokaisella toiminnolla on nollasta poikkeava todennäköisyys tulla valituksi jokaisessa tilassa. Tämä takaa, että ajan myötä agentti tutkii kaikki saavutettavissa olevat osat tilatilasta. Jos tila voidaan saavuttaa jollakin kelvollisella toimintojen sarjalla, se saavutetaan lopulta; ja jos sitä ei voida saavuttaa ympäristön dynamiikan puitteissa, sillä ei ole merkitystä oppimisprosessin kannalta.
Tämä ajatus johtaa stokastisten politiikkojen käyttöön, joissa agentti ei aina valitse parasta tunnettua toimintoa, vaan valitsee toimintoja satunnaisuudella. Yleinen strategia tähän on tuttu ε-ahne politiikka (\varepsilon-greedy policy), jossa ahne toimintoa valitaan useimmiten, mutta todennäköisyydellä ε valitaan satunnainen toiminto. Tämä varmistaa jatkuvan tutkimisen samalla kun suositaan korkean arvon toimintoja.
Tässä vaiheessa on myös hyödyllistä erottaa kaksi pääasiallista menetelmäluokkaa:
- On-policy-menetelmät arvioivat ja parantavat samaa politiikkaa, jota käytetään datan tuottamiseen;
- Off-policy-menetelmät arvioivat ja parantavat yhtä politiikkaa, mutta tuottavat datan toisella politiikalla.
1. Mikä on suurin ongelma exploring starts -oletuksessa?
2. Mikä on ero on-policy- ja off-policy-menetelmien välillä vahvistusoppimisessa?
Kiitos palautteestasi!
Kysy tekoälyä
Kysy tekoälyä
Kysy mitä tahansa tai kokeile jotakin ehdotetuista kysymyksistä aloittaaksesi keskustelumme