Iterazione delle Politiche
Scorri per mostrare il menu
L'idea alla base della policy iteration è semplice:
- Scegliere un'π e un v iniziali;
- Utilizzare la valutazione della policy per aggiornare v fino a renderlo coerente con π;
- Utilizzare il miglioramento della policy per aggiornare π fino a renderla greedy rispetto a v;
- Ripetere i passi 2-3 fino alla convergenza.
In questo metodo, non ci sono aggiornamenti parziali:
- Durante la valutazione della policy, i valori vengono aggiornati per ogni stato, fino a che non sono coerenti con la policy corrente;
- Durante il miglioramento della policy, la policy viene resa greedy rispetto alla funzione di valore.
Pseudocodice
Tutto è chiaro?
Grazie per i tuoi commenti!
Sezione 3. Capitolo 7
Chieda ad AI
Chieda ad AI
Chieda pure quello che desidera o provi una delle domande suggerite per iniziare la nostra conversazione
Iterazione delle Politiche
L'idea alla base della policy iteration è semplice:
- Scegliere un'π e un v iniziali;
- Utilizzare la valutazione della policy per aggiornare v fino a renderlo coerente con π;
- Utilizzare il miglioramento della policy per aggiornare π fino a renderla greedy rispetto a v;
- Ripetere i passi 2-3 fino alla convergenza.
In questo metodo, non ci sono aggiornamenti parziali:
- Durante la valutazione della policy, i valori vengono aggiornati per ogni stato, fino a che non sono coerenti con la policy corrente;
- Durante il miglioramento della policy, la policy viene resa greedy rispetto alla funzione di valore.
Pseudocodice
Tutto è chiaro?
Grazie per i tuoi commenti!
Sezione 3. Capitolo 7