TD(0) : Estimation de la Fonction de Valeur
Glissez pour afficher le menu
La version la plus simple de l'apprentissage TD est appelée TD(0). Elle met à jour la valeur d'un état en fonction de la récompense immédiate et de la valeur estimée de l'état suivant. Il s'agit d'une méthode TD à un pas.
Règle de mise à jour
Étant donné un état St, une récompense Rt+1 et l'état suivant St+1, la règle de mise à jour s'écrit :
V(St)←V(St)+α(Rt+1+γV(St+1)−V(St))où
- α est un taux d'apprentissage, ou taille de pas ;
- δt=Rt+1+γV(St+1)−V(St) est une erreur TD.
Intuition
La fonction de valeur d'état vπ peut être définie et développée comme suit :
vπ(s)=Eπ[Gt∣St=s]=Eπ[Rt+γGt+1∣St=s]=Eπ[Rt+γvπ(St+1)∣St=s]Cela donne la première partie de δt — le retour observé Rt+1+γV(St+1). Et la seconde partie de δt est le retour attendu V(St). L'erreur TD δt représente donc l'écart observable entre ce qui s'est réellement produit et ce que l'on croyait auparavant. Ainsi, la règle de mise à jour ajuste légèrement la croyance précédente à chaque étape, la rapprochant de la réalité.
TD(0) vs Estimation Monte Carlo
TD(0) et l'estimation Monte Carlo utilisent tous deux des expériences échantillonnées pour estimer la fonction de valeur d'état vπ(s) pour une politique π. Sous des conditions de convergence standard, ils convergent tous deux vers la véritable valeur vπ(s) lorsque le nombre de visites de chaque état tend vers l'infini. En pratique, cependant, la quantité de données disponible est toujours finie, et les deux méthodes diffèrent considérablement dans la manière dont elles utilisent ces données et dans la rapidité de leur apprentissage.
Compromis biais-variance
Du point de vue du compromis biais–variance :
L’estimation Monte Carlo attend la fin d’un épisode puis utilise le retour complet pour mettre à jour les valeurs. Cela produit des estimations non biaisées — les retours reflètent réellement la distribution sous-jacente — mais ils peuvent varier fortement, surtout dans des tâches longues ou très stochastiques. Une variance élevée signifie qu’il faut de nombreux épisodes pour lisser le bruit et obtenir des estimations de valeur stables.
TD(0) utilise le bootstrap en combinant chaque récompense à un pas avec l’estimation actuelle de la valeur de l’état suivant. Cela introduit un biais — les premières mises à jour reposent sur des estimations imparfaites — mais maintient une faible variance, puisque chaque mise à jour est basée sur une petite erreur incrémentale. Une variance plus faible permet à TD(0) de propager l’information de récompense plus rapidement dans l’espace d’états, même si le biais initial peut ralentir la convergence.
Données d’apprentissage vs Modèle d’apprentissage
Une autre façon d’aborder ces deux méthodes consiste à analyser ce que chacune apprend réellement :
L’estimation Monte Carlo apprend directement à partir des retours observés, ajustant effectivement ses estimations de valeur aux épisodes spécifiques rencontrés. Cela signifie qu’elle minimise l’erreur sur ces trajectoires d’entraînement, mais comme elle ne construit jamais une vue explicite de la façon dont les états se succèdent, elle peut avoir du mal à généraliser à de nouvelles situations ou à des cas légèrement différents.
TD(0), en revanche, s’appuie sur chaque transition en un seul pas, combinant la récompense immédiate avec son estimation de la valeur de l’état suivant. Ce faisant, il capture efficacement les relations entre les états — un modèle implicite de la dynamique de l’environnement. Cette compréhension de type modélisation permet à TD(0) de mieux généraliser à des transitions non observées, produisant souvent des estimations de valeur plus précises sur de nouvelles données.
Pseudocode
Merci pour vos commentaires !
Demandez à l'IA
Demandez à l'IA
Posez n'importe quelle question ou essayez l'une des questions suggérées pour commencer notre discussion