Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lære Probleminnledning | Multi-Armet Bandittproblem
Introduksjon til Reinforcement Learning med Python

Probleminnledning

Sveip for å vise menyen

Multi-armed bandit (MAB)-problemet er en kjent utfordring innenfor forsterkende læring, beslutningstaking og sannsynlighetsteori. Det innebærer at en agent gjentatte ganger velger mellom flere handlinger, hvor hver handling gir en belønning fra en fast sannsynlighetsfordeling. Målet er å maksimere avkastningen over et fast antall tidssteg.

Opprinnelse til problemet

Begrepet "multi-armed bandit" stammer fra analogien til en spilleautomat, ofte kalt en "one-armed bandit" på grunn av spaken. I dette scenariet kan man se for seg flere spilleautomater, eller en spilleautomat med flere spaker (armer), hvor hver arm er knyttet til en unik sannsynlighetsfordeling for belønninger. Målet er å maksimere avkastningen over et begrenset antall forsøk ved nøye å velge hvilken spak som skal trekkes.

Banditter og belønningsfordelinger

Utfordringen

MAB-problemet illustrerer utfordringen med å balansere utforskning og utnyttelse:

  • Utforskning: prøve ulike armer for å samle informasjon om deres utbetalinger;
  • Utnyttelse: trekke i den armen som for øyeblikket virker best for å maksimere umiddelbare belønninger.

En naiv tilnærming — å spille på én arm gjentatte ganger — kan føre til suboptimale gevinster hvis en bedre arm finnes, men ikke blir utforsket. På den annen side kan overdreven utforskning sløse ressurser på alternativer med lav belønning.

Virkelige applikasjoner

Bruksområder for multi-armet banditt

Selv om det opprinnelig ble formulert innen pengespill, dukker MAB-problemet opp i mange felt:

  • Nettannonsering: valg av beste annonse å vise basert på brukerengasjement;
  • Kliniske studier: testing av flere behandlinger for å finne den mest effektive;
  • Anbefalingssystemer: vise det mest relevante innholdet til brukere.
question mark

Hva er den viktigste utfordringen i multi-armed bandit-problemet?

Velg det helt riktige svaret

Alt var klart?

Hvordan kan vi forbedre det?

Takk for tilbakemeldingene dine!

Seksjon 2. Kapittel 1

Spør AI

expand

Spør AI

ChatGPT

Spør om hva du vil, eller prøv ett av de foreslåtte spørsmålene for å starte chatten vår

Seksjon 2. Kapittel 1
some-alt