Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Oppiskele Malli, Politiikka ja Arvot | RL:n Ydinteoria
Vahvistusoppimisen Perusteet Pythonilla

Malli, Politiikka ja Arvot

Pyyhkäise näyttääksesi valikon

Malli

Note
Määritelmä

Malli on ympäristön esitys, joka määrittelee tilojen välisten siirtymätodennäköisyyksien ja odotettujen palkkioiden arvot suoritetuille toiminnoille.

Vahvistusoppimisalgoritmit voidaan jakaa kahteen kategoriaan:

  • Mallipohjaiset: tässä lähestymistavassa agentti oppii tai sillä on käytössään ympäristön malli, jonka avulla se voi simuloida tulevia tiloja ja palkkioita ennen toiminnan suorittamista. Tämä mahdollistaa agentin suunnittelun ja paremmin perusteltujen päätösten tekemisen;
  • Mallittomat: tässä lähestymistavassa agentilla ei ole suoraa mallia ympäristöstä. Se oppii ainoastaan vuorovaikutuksen kautta ympäristön kanssa, luottaen kokeiluun ja erehdykseen löytääkseen parhaat toiminnot.

Käytännössä ympäristöt, joissa on eksplisiittinen malli, ovat harvinaisia, mikä vaikeuttaa agenttien mallipohjaisten strategioiden hyödyntämistä. Tämän seurauksena mallittomat lähestymistavat ovat yleistyneet ja niitä on tutkittu laajasti vahvistusoppimisen tutkimuksessa ja sovelluksissa.

Malli ja ei-malli

Politiikka

Note
Määritelmä

Politiikka π\pi on strategia, jonka agentti valitsee määrittääkseen toimintonsa ympäristön nykytilan perusteella.

Politiikkoja on kahta tyyppiä:

  • Deterministinen politiikka: agentti valitsee aina saman toiminnon tietyssä tilassa;
  • Stokastinen politiikka: agentti valitsee toimintoja todennäköisyysjakaumien perusteella.

Oppimisprosessin aikana agentin tavoitteena on löytää optimaalinen politiikka. Optimaalinen politiikka on sellainen, joka maksimoi odotetun tuoton, ohjaten agenttia tekemään parhaat mahdolliset päätökset missä tahansa annetussa tilassa.

Satunnaiset ja optimaaliset politiikat

Arvofunktiot

Arvofunktiot ovat keskeisiä agentin arvioidessa tietyn tilan tai tila-toimintaparin potentiaalia. Niitä käytetään tulevien odotettujen palkkioiden arvioimiseen, mikä auttaa agenttia tekemään perusteltuja päätöksiä.

Tilaarvofunktio

Note
Määritelmä

Tilaarvofunktio VV (tai vv) on funktio, joka antaa odotetun tuoton ollessa tietyssä tilassa ja noudattaen tiettyä politiikkaa. Se auttaa arvioimaan tilojen toivottavuutta.

Tilaarvon esimerkit

Tilaarvon voi esittää matemaattisesti seuraavasti:

vπ(s)=Eπ[GtSt=s]=Eπ[k=0γkRt+k+1St=s]\def\E{\operatorname{\mathbb{E}}} v_\pi(s) = \E_\pi[G_t | S_t = s] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s\Biggr]

Tilanne-toimintoarvofunktio

Note
Määritelmä

Tilanne-toimintoarvofunktio QQ (tai qq) on funktio, joka antaa odotetun tuoton, kun suoritetaan tietty toiminto tietyssä tilassa ja noudatetaan tämän jälkeen tiettyä politiikkaa. Se auttaa arvioimaan toimintojen mielekkyyttä eri tiloissa.

Tilanne-toimintoarvofunktiota kutsutaan usein myös toimintoarvofunktioksi.

Tilanne-toimintoarvon esimerkit

Toiminnon arvo voidaan ilmaista matemaattisesti seuraavasti:

qπ(s,a)=Eπ[GtSt=s,At=a]=Eπ[k=0γkRt+k+1St=s,At=a]\def\E{\operatorname{\mathbb{E}}} q_\pi(s, a) = \E_\pi[G_t | S_t = s, A_t = a] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s, A_t = a\Biggr]

Mallin, politiikan ja arvofunktioiden välinen suhde

Käsitteet malli, politiikka ja arvofunktiot ovat tiiviisti yhteydessä toisiinsa ja muodostavat kattavan viitekehyksen RL-algoritmien luokittelulle. Tämä viitekehys määritellään kahden pääakselin avulla:

  • Oppimisen kohde: tämä akseli kuvaa RL-algoritmien kirjoa niiden riippuvuuden perusteella arvofunktioihin, politiikkafunktioihin tai molempiin;
  • Mallin käyttö: tämä akseli erottaa algoritmit sen perusteella, hyödyntävätkö ne ympäristön mallia vai oppivatko ne pelkästään vuorovaikutuksen kautta.

Yhdistämällä nämä ulottuvuudet RL-algoritmit voidaan luokitella erillisiin kategorioihin, joilla on omat ominaisuutensa ja ihanteelliset käyttötapauksensa. Näiden suhteiden ymmärtäminen auttaa valitsemaan sopivan algoritmin tiettyihin tehtäviin, mikä varmistaa tehokkaan oppimisen ja päätöksenteon.

Mallin, politiikan ja arvon algoritmien luokittelu
question-icon

Täydennä aukot

To predict the response of the environment, a can be used.
A
is a model of an agent's behavior.
To determine the value of a/an
, state value function is used.
To determine the value of a/an
, state-action value function is used.

Klikkaa tai vedä ja pudota esineitä ja täytä tyhjät kohdat

Oliko kaikki selvää?

Miten voimme parantaa sitä?

Kiitos palautteestasi!

Osio 1. Luku 5

Kysy tekoälyä

expand

Kysy tekoälyä

ChatGPT

Kysy mitä tahansa tai kokeile jotakin ehdotetuista kysymyksistä aloittaaksesi keskustelumme

Malli, Politiikka ja Arvot

Malli

Note
Määritelmä

Malli on ympäristön esitys, joka määrittelee tilojen välisten siirtymätodennäköisyyksien ja odotettujen palkkioiden arvot suoritetuille toiminnoille.

Vahvistusoppimisalgoritmit voidaan jakaa kahteen kategoriaan:

  • Mallipohjaiset: tässä lähestymistavassa agentti oppii tai sillä on käytössään ympäristön malli, jonka avulla se voi simuloida tulevia tiloja ja palkkioita ennen toiminnan suorittamista. Tämä mahdollistaa agentin suunnittelun ja paremmin perusteltujen päätösten tekemisen;
  • Mallittomat: tässä lähestymistavassa agentilla ei ole suoraa mallia ympäristöstä. Se oppii ainoastaan vuorovaikutuksen kautta ympäristön kanssa, luottaen kokeiluun ja erehdykseen löytääkseen parhaat toiminnot.

Käytännössä ympäristöt, joissa on eksplisiittinen malli, ovat harvinaisia, mikä vaikeuttaa agenttien mallipohjaisten strategioiden hyödyntämistä. Tämän seurauksena mallittomat lähestymistavat ovat yleistyneet ja niitä on tutkittu laajasti vahvistusoppimisen tutkimuksessa ja sovelluksissa.

Malli ja ei-malli

Politiikka

Note
Määritelmä

Politiikka π\pi on strategia, jonka agentti valitsee määrittääkseen toimintonsa ympäristön nykytilan perusteella.

Politiikkoja on kahta tyyppiä:

  • Deterministinen politiikka: agentti valitsee aina saman toiminnon tietyssä tilassa;
  • Stokastinen politiikka: agentti valitsee toimintoja todennäköisyysjakaumien perusteella.

Oppimisprosessin aikana agentin tavoitteena on löytää optimaalinen politiikka. Optimaalinen politiikka on sellainen, joka maksimoi odotetun tuoton, ohjaten agenttia tekemään parhaat mahdolliset päätökset missä tahansa annetussa tilassa.

Satunnaiset ja optimaaliset politiikat

Arvofunktiot

Arvofunktiot ovat keskeisiä agentin arvioidessa tietyn tilan tai tila-toimintaparin potentiaalia. Niitä käytetään tulevien odotettujen palkkioiden arvioimiseen, mikä auttaa agenttia tekemään perusteltuja päätöksiä.

Tilaarvofunktio

Note
Määritelmä

Tilaarvofunktio VV (tai vv) on funktio, joka antaa odotetun tuoton ollessa tietyssä tilassa ja noudattaen tiettyä politiikkaa. Se auttaa arvioimaan tilojen toivottavuutta.

Tilaarvon esimerkit

Tilaarvon voi esittää matemaattisesti seuraavasti:

vπ(s)=Eπ[GtSt=s]=Eπ[k=0γkRt+k+1St=s]\def\E{\operatorname{\mathbb{E}}} v_\pi(s) = \E_\pi[G_t | S_t = s] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s\Biggr]

Tilanne-toimintoarvofunktio

Note
Määritelmä

Tilanne-toimintoarvofunktio QQ (tai qq) on funktio, joka antaa odotetun tuoton, kun suoritetaan tietty toiminto tietyssä tilassa ja noudatetaan tämän jälkeen tiettyä politiikkaa. Se auttaa arvioimaan toimintojen mielekkyyttä eri tiloissa.

Tilanne-toimintoarvofunktiota kutsutaan usein myös toimintoarvofunktioksi.

Tilanne-toimintoarvon esimerkit

Toiminnon arvo voidaan ilmaista matemaattisesti seuraavasti:

qπ(s,a)=Eπ[GtSt=s,At=a]=Eπ[k=0γkRt+k+1St=s,At=a]\def\E{\operatorname{\mathbb{E}}} q_\pi(s, a) = \E_\pi[G_t | S_t = s, A_t = a] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s, A_t = a\Biggr]

Mallin, politiikan ja arvofunktioiden välinen suhde

Käsitteet malli, politiikka ja arvofunktiot ovat tiiviisti yhteydessä toisiinsa ja muodostavat kattavan viitekehyksen RL-algoritmien luokittelulle. Tämä viitekehys määritellään kahden pääakselin avulla:

  • Oppimisen kohde: tämä akseli kuvaa RL-algoritmien kirjoa niiden riippuvuuden perusteella arvofunktioihin, politiikkafunktioihin tai molempiin;
  • Mallin käyttö: tämä akseli erottaa algoritmit sen perusteella, hyödyntävätkö ne ympäristön mallia vai oppivatko ne pelkästään vuorovaikutuksen kautta.

Yhdistämällä nämä ulottuvuudet RL-algoritmit voidaan luokitella erillisiin kategorioihin, joilla on omat ominaisuutensa ja ihanteelliset käyttötapauksensa. Näiden suhteiden ymmärtäminen auttaa valitsemaan sopivan algoritmin tiettyihin tehtäviin, mikä varmistaa tehokkaan oppimisen ja päätöksenteon.

Mallin, politiikan ja arvon algoritmien luokittelu
Oliko kaikki selvää?

Miten voimme parantaa sitä?

Kiitos palautteestasi!

Osio 1. Luku 5
some-alt