Séance de cours

Méthodes Monte-Carlo pour l'apprentissage par renforcement

Séances de cours associées (31)

Graph Chatbot

Chattez avec Graph Search

Posez n’importe quelle question sur les cours, conférences, exercices, recherches, actualités, etc. de l’EPFL ou essayez les exemples de questions ci-dessous.

AVERTISSEMENT : Le chatbot Graph n'est pas programmé pour fournir des réponses explicites ou catégoriques à vos questions. Il transforme plutôt vos questions en demandes API qui sont distribuées aux différents services informatiques officiellement administrés par l'EPFL. Son but est uniquement de collecter et de recommander des références pertinentes à des contenus que vous pouvez explorer pour vous aider à répondre à vos questions.

Connectez-vous pour utiliser Chat avec Graph Search

Apprentissage continu du renforcement : apprentissage automatique avancé

Explore les défis d'apprentissage en renforcement continu de l'état, l'estimation de la fonction de valeur, les gradients des politiques et l'apprentissage des politiques par l'exploration pondérée.

Chaîne de Monte Carlo Markov biaisée

Explore la chaîne de Monte Carlo Markov biaisée, y compris l'estimation optimale de Bayes et l'algorithme Metropolis-Hastings.

Modèles de mélange : Estimation basée sur la simulation

Explore les modèles de mélange, y compris les mélanges discrets et continus, et leur application dans la capture de l'hétérogénéité du goût dans les populations.

Évaluation du modèle et réglage de l'hyperparamètre

Explore l'évaluation des modèles, le réglage hyperparamétrique et les stratégies de rééchantillonnage dans l'apprentissage automatique.

Renforcement de l'apprentissage : bases et applications

Couvre les bases de l'apprentissage du renforcement, y compris les processus décisionnels de Markov et les méthodes de gradient des politiques, et explore les applications du monde réel et les avancées récentes.

Renforcement de l'apprentissage : Q-Learning

Couvre l'apprentissage Q en renforçant l'apprentissage, en explorant les valeurs d'action, les politiques et l'impact sociétal des algorithmes.

Chaînes Monte Carlo Markov

Couvre l'apprentissage non supervisé, la réduction de dimensionnalité, SVD, l'estimation de bas grade, PCA, et les chaînes Monte Carlo Markov.

Renforcement des principes de l'apprentissage grâce à la rétroaction humaine

Intensifier l'apprentissage avec la rétroaction humaine, discuter de la convergence des estimateurs et introduire une approche pessimiste pour améliorer les performances.

Sélection du modèle : évaluation et généralisation

Explore la sélection, l'évaluation et la généralisation des modèles dans l'apprentissage automatique, en mettant l'accent sur l'estimation impartiale des performances et les risques de surapprentissage.

Agents d'apprentissage profond : Renforcement de l'apprentissage

Explore les agents d'apprentissage profond dans l'apprentissage du renforcement, en mettant l'accent sur les approximations du réseau neuronal et les défis dans la formation des systèmes multiactifs.