Êtes-vous un étudiant de l'EPFL à la recherche d'un projet de semestre?
Travaillez avec nous sur des projets en science des données et en visualisation, et déployez votre projet sous forme d'application sur Graph Search.
Cette séance de cours présente l'apprentissage par différence temporelle (TD learning) et l'algorithme standard TD(0) pour estimer les valeurs dans l'apprentissage par renforcement. Il couvre le concept de valeurs V, les valeurs d'état et l'équation de Bellman pour la cohérence des valeurs des états voisins. La séance de cours explique également comment les méthodes TD explorent le graphique au fil du temps, comparent les valeurs aux pas de temps voisins et mettent à jour les valeurs en fonction de la «différence temporelle».