Êtes-vous un étudiant de l'EPFL à la recherche d'un projet de semestre?
Travaillez avec nous sur des projets en science des données et en visualisation, et déployez votre projet sous forme d'application sur Graph Search.
Cette séance de cours présente les méthodes de gradient de politique en utilisant un exemple simple d'un seul neurone avec une sortie binaire. La séance de cours explique comment associer des actions à des stimuli, optimiser directement les récompenses et changer le poids des neurones pour maximiser les récompenses attendues.