Cette séance de cours présente l'apprentissage par différence temporelle (TD learning) et l'algorithme standard TD(0) pour estimer les valeurs dans l'apprentissage par renforcement. Il couvre le concept de valeurs V, les valeurs d'état et l'équation de Bellman pour la cohérence des valeurs des états voisins. La séance de cours explique également comment les méthodes TD explorent le graphique au fil du temps, comparent les valeurs aux pas de temps voisins et mettent à jour les valeurs en fonction de la «différence temporelle».