Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Modell, Politik und Werte | Kernprinzipien des RL
Einführung in Reinforcement Learning mit Python

Modell, Politik und Werte

Swipe um das Menü anzuzeigen

Modell

Note
Definition

Ein Modell ist eine Darstellung der Umgebung, die die Übergangswahrscheinlichkeiten zwischen Zuständen und die erwarteten Belohnungen für ausgeführte Aktionen definiert.

Verstärkendes Lernen-Algorithmen lassen sich in zwei Kategorien einteilen:

  • Modellbasiert: Bei diesem Ansatz lernt der Agent ein Modell der Umgebung oder hat Zugriff darauf, was ihm ermöglicht, zukünftige Zustände und Belohnungen zu simulieren, bevor er Aktionen ausführt. Dadurch kann der Agent planen und fundiertere Entscheidungen treffen;
  • Modellfrei: Bei diesem Ansatz verfügt der Agent über kein direktes Modell der Umgebung. Er lernt ausschließlich durch Interaktion mit der Umgebung und verlässt sich auf Versuch und Irrtum, um die besten Aktionen zu entdecken.

In der Praxis sind Umgebungen mit expliziten Modellen selten, was es für Agenten schwierig macht, sich auf modellbasierte Strategien zu verlassen. Daher haben sich modellfreie Ansätze in der Forschung und Anwendung des verstärkenden Lernens als häufiger und intensiver untersucht erwiesen.

Modell und kein Modell

Politik

Note
Definition

Politik π\pi ist die Strategie, der ein Agent folgt, um seine Aktionen basierend auf dem aktuellen Zustand der Umgebung zu bestimmen.

Es gibt zwei Arten von Strategien:

  • Deterministische Strategie: Der Agent wählt für einen gegebenen Zustand immer die gleiche Aktion aus;
  • Stochastische Strategie: Der Agent wählt Aktionen basierend auf Wahrscheinlichkeitsverteilungen aus.

Während des Lernprozesses besteht das Ziel des Agenten darin, eine optimale Strategie zu finden. Eine optimale Strategie maximiert den erwarteten Ertrag und führt den Agenten dazu, in jedem gegebenen Zustand die bestmöglichen Entscheidungen zu treffen.

Zufällige und optimale Strategien

Wertfunktionen

Wertfunktionen sind entscheidend, um zu verstehen, wie ein Agent das Potenzial eines bestimmten Zustands oder Zustand-Aktions-Paares bewertet. Sie dienen zur Schätzung zukünftiger erwarteter Belohnungen und unterstützen den Agenten bei fundierten Entscheidungen.

Zustandswertfunktion

Note
Definition

Zustandswertfunktion VV (oder vv) ist eine Funktion, die den erwarteten Ertrag für das Befinden in einem bestimmten Zustand und das Befolgen einer spezifischen Politik angibt. Sie unterstützt die Bewertung der Attraktivität von Zuständen.

Beispiele für Zustandswerte

Der Wert eines Zustands kann mathematisch wie folgt ausgedrückt werden:

vπ(s)=Eπ[GtSt=s]=Eπ[k=0γkRt+k+1St=s]\def\E{\operatorname{\mathbb{E}}} v_\pi(s) = \E_\pi[G_t | S_t = s] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s\Biggr]

Zustands-Aktions-Wertfunktion

Note
Definition

Zustands-Aktions-Wertfunktion QQ (oder qq) ist eine Funktion, die den erwarteten Ertrag angibt, wenn eine bestimmte Aktion in einem gegebenen Zustand ausgeführt und anschließend einer spezifischen Politik gefolgt wird. Sie unterstützt die Bewertung der Attraktivität von Aktionen in Zuständen.

Zustands-Aktions-Wertfunktion wird häufig auch als Aktionswertfunktion bezeichnet.

Beispiele für Zustands-Aktions-Werte

Der Wert einer Aktion kann mathematisch wie folgt ausgedrückt werden:

qπ(s,a)=Eπ[GtSt=s,At=a]=Eπ[k=0γkRt+k+1St=s,At=a]\def\E{\operatorname{\mathbb{E}}} q_\pi(s, a) = \E_\pi[G_t | S_t = s, A_t = a] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s, A_t = a\Biggr]

Beziehung zwischen Modell, Politik und Wertfunktionen

Die Konzepte Modell, Politik und Wertfunktionen sind eng miteinander verknüpft und bilden einen umfassenden Rahmen zur Kategorisierung von RL-Algorithmen. Dieser Rahmen wird durch zwei Hauptachsen definiert:

  • Lernziel: Diese Achse stellt das Spektrum der RL-Algorithmen basierend auf ihrer Abhängigkeit von Wertfunktionen, Politikfunktionen oder einer Kombination aus beiden dar;
  • Modellanwendung: Diese Achse unterscheidet Algorithmen danach, ob sie ein Modell der Umgebung nutzen oder ausschließlich durch Interaktion lernen.

Durch die Kombination dieser Dimensionen lassen sich RL-Algorithmen in unterschiedliche Kategorien einteilen, die jeweils eigene Merkmale und ideale Anwendungsfälle aufweisen. Das Verständnis dieser Zusammenhänge unterstützt bei der Auswahl des passenden Algorithmus für spezifische Aufgaben und gewährleistet effiziente Lern- und Entscheidungsprozesse.

Modell-, Policy- und Wertalgorithmus-Klassifizierung
question-icon

Lücken ausfüllen

To predict the response of the environment, a can be used.
A
is a model of an agent's behavior.
To determine the value of a/an
, state value function is used.
To determine the value of a/an
, state-action value function is used.

Klicken oder ziehen Sie Elemente und füllen Sie die Lücken aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 1. Kapitel 5

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Modell, Politik und Werte

Modell

Note
Definition

Ein Modell ist eine Darstellung der Umgebung, die die Übergangswahrscheinlichkeiten zwischen Zuständen und die erwarteten Belohnungen für ausgeführte Aktionen definiert.

Verstärkendes Lernen-Algorithmen lassen sich in zwei Kategorien einteilen:

  • Modellbasiert: Bei diesem Ansatz lernt der Agent ein Modell der Umgebung oder hat Zugriff darauf, was ihm ermöglicht, zukünftige Zustände und Belohnungen zu simulieren, bevor er Aktionen ausführt. Dadurch kann der Agent planen und fundiertere Entscheidungen treffen;
  • Modellfrei: Bei diesem Ansatz verfügt der Agent über kein direktes Modell der Umgebung. Er lernt ausschließlich durch Interaktion mit der Umgebung und verlässt sich auf Versuch und Irrtum, um die besten Aktionen zu entdecken.

In der Praxis sind Umgebungen mit expliziten Modellen selten, was es für Agenten schwierig macht, sich auf modellbasierte Strategien zu verlassen. Daher haben sich modellfreie Ansätze in der Forschung und Anwendung des verstärkenden Lernens als häufiger und intensiver untersucht erwiesen.

Modell und kein Modell

Politik

Note
Definition

Politik π\pi ist die Strategie, der ein Agent folgt, um seine Aktionen basierend auf dem aktuellen Zustand der Umgebung zu bestimmen.

Es gibt zwei Arten von Strategien:

  • Deterministische Strategie: Der Agent wählt für einen gegebenen Zustand immer die gleiche Aktion aus;
  • Stochastische Strategie: Der Agent wählt Aktionen basierend auf Wahrscheinlichkeitsverteilungen aus.

Während des Lernprozesses besteht das Ziel des Agenten darin, eine optimale Strategie zu finden. Eine optimale Strategie maximiert den erwarteten Ertrag und führt den Agenten dazu, in jedem gegebenen Zustand die bestmöglichen Entscheidungen zu treffen.

Zufällige und optimale Strategien

Wertfunktionen

Wertfunktionen sind entscheidend, um zu verstehen, wie ein Agent das Potenzial eines bestimmten Zustands oder Zustand-Aktions-Paares bewertet. Sie dienen zur Schätzung zukünftiger erwarteter Belohnungen und unterstützen den Agenten bei fundierten Entscheidungen.

Zustandswertfunktion

Note
Definition

Zustandswertfunktion VV (oder vv) ist eine Funktion, die den erwarteten Ertrag für das Befinden in einem bestimmten Zustand und das Befolgen einer spezifischen Politik angibt. Sie unterstützt die Bewertung der Attraktivität von Zuständen.

Beispiele für Zustandswerte

Der Wert eines Zustands kann mathematisch wie folgt ausgedrückt werden:

vπ(s)=Eπ[GtSt=s]=Eπ[k=0γkRt+k+1St=s]\def\E{\operatorname{\mathbb{E}}} v_\pi(s) = \E_\pi[G_t | S_t = s] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s\Biggr]

Zustands-Aktions-Wertfunktion

Note
Definition

Zustands-Aktions-Wertfunktion QQ (oder qq) ist eine Funktion, die den erwarteten Ertrag angibt, wenn eine bestimmte Aktion in einem gegebenen Zustand ausgeführt und anschließend einer spezifischen Politik gefolgt wird. Sie unterstützt die Bewertung der Attraktivität von Aktionen in Zuständen.

Zustands-Aktions-Wertfunktion wird häufig auch als Aktionswertfunktion bezeichnet.

Beispiele für Zustands-Aktions-Werte

Der Wert einer Aktion kann mathematisch wie folgt ausgedrückt werden:

qπ(s,a)=Eπ[GtSt=s,At=a]=Eπ[k=0γkRt+k+1St=s,At=a]\def\E{\operatorname{\mathbb{E}}} q_\pi(s, a) = \E_\pi[G_t | S_t = s, A_t = a] = \E_\pi\Biggl[\sum_{k=0}^\infty \gamma^k R_{t+k+1} | S_t = s, A_t = a\Biggr]

Beziehung zwischen Modell, Politik und Wertfunktionen

Die Konzepte Modell, Politik und Wertfunktionen sind eng miteinander verknüpft und bilden einen umfassenden Rahmen zur Kategorisierung von RL-Algorithmen. Dieser Rahmen wird durch zwei Hauptachsen definiert:

  • Lernziel: Diese Achse stellt das Spektrum der RL-Algorithmen basierend auf ihrer Abhängigkeit von Wertfunktionen, Politikfunktionen oder einer Kombination aus beiden dar;
  • Modellanwendung: Diese Achse unterscheidet Algorithmen danach, ob sie ein Modell der Umgebung nutzen oder ausschließlich durch Interaktion lernen.

Durch die Kombination dieser Dimensionen lassen sich RL-Algorithmen in unterschiedliche Kategorien einteilen, die jeweils eigene Merkmale und ideale Anwendungsfälle aufweisen. Das Verständnis dieser Zusammenhänge unterstützt bei der Auswahl des passenden Algorithmus für spezifische Aufgaben und gewährleistet effiziente Lern- und Entscheidungsprozesse.

Modell-, Policy- und Wertalgorithmus-Klassifizierung
War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 1. Kapitel 5
some-alt