Plan du cours
1. Introduction à l'apprentissage par renforcement profond
- Qu'est-ce que l'apprentissage par renforcement ?
- Différence entre apprentissage supervisé, non supervisé et par renforcement
- Applications du DRL en 2025 (robotique, soins de santé, finance, logistique)
- Comprendre la boucle d'interaction agent-environnement
2. Fondamentaux de l'apprentissage par renforcement
- Processus de décision de Markov (MDP)
- État, action, récompense, politique et fonctions de valeur
- Compromis entre exploration et exploitation
- Méthodes de Monte Carlo et apprentissage Temporal-Difference (TD)
3. Implémentation d'algorithmes de base en apprentissage par renforcement
- Méthodes tabulaires : programmation dynamique, évaluation de politique et itération
- Q-Learning et SARSA
- Exploration epsilon-greedy et stratégies de décroissance
- Implémentation d'environnements de RL avec OpenAI Gymnasium
4. Passage à l'apprentissage par renforcement profond
- Limitations des méthodes tabulaires
- Utilisation de réseaux de neurones pour l'approximation de fonctions
- Architecture et flux de travail du Deep Q-Network (DQN)
- Lecture d'expérience et réseaux cibles
5. Algorithmes avancés de DRL
- Double DQN, Dueling DQN et lecture d'expérience prioritaire
- Méthodes de gradient de politique : algorithme REINFORCE
- Architectures Actor-Critic (A2C, A3C)
- Optimisation de la politique proximale (PPO)
- Soft Actor-Critic (SAC)
6. Travail avec des espaces d'actions continues
- Défis du contrôle continu
- Utilisation du DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Outils et cadres pratiques
- Utilisation de Stable-Baselines3 et Ray RLlib
- Journalisation et suivi avec TensorBoard
- Ajustement des hyperparamètres pour les modèles DRL
8. Conception des récompenses et des environnements
- Façonnage des récompenses et équilibre des pénalités
- Concepts de transfert d'apprentissage de la simulation au réel
- Création d'environnements personnalisés dans Gymnasium
9. Environnements partiellement observables et généralisation
- Gestion des informations d'état incomplètes (POMDP)
- Approches basées sur la mémoire utilisant LSTMs et RNNs
- Amélioration de la robustesse et de la généralisation des agents
10. Théorie des jeux et apprentissage par renforcement multi-agents
- Introduction aux environnements multi-agents
- Coopération vs compétition
- Applications dans l'entraînement adversarial et l'optimisation des stratégies
11. Études de cas et applications réelles
- Simulations de conduite autonome
- Tarification dynamique et stratégies de trading financier
- Robotique et automatisation industrielle
12. Dépannage et optimisation
- Diagnostic des entraînements instables
- Gestion de la rareté des récompenses et du surapprentissage
- Mise à l'échelle des modèles DRL sur GPU et systèmes distribués
13. Résumé et prochaines étapes
- Récapitulatif de l'architecture DRL et des algorithmes clés
- Tendances de l'industrie et directions de recherche (par exemple, RLHF, modèles hybrides)
- Ressources supplémentaires et matières de lecture
Pré requis
- Maîtrise de la programmation Python
- Compréhension du calcul différentiel et de l'algèbre linéaire
- Connaissances de base en probabilités et en statistiques
- Expérience dans la construction de modèles d'apprentissage automatique en utilisant Python et NumPy ou TensorFlow/PyTorch
Public cible
- Développeurs intéressés par l'IA et les systèmes intelligents
- Spécialistes des données explorant les cadres de l'apprentissage par renforcement
- Ingénieurs en apprentissage automatique travaillant sur des systèmes autonomes
Nos clients témoignent (3)
J'ai vraiment aimé la fin où nous avons pris le temps de jouer avec CHAT GPT. La salle n'était pas très bien organisée pour cela - au lieu d'une grande table, quelques petites tables auraient été préférables afin que nous puissions travailler en petits groupes et brainstormer.
Nola - Laramie County Community College
Formation - Artificial Intelligence (AI) Overview
Traduction automatique
Travailler à partir des principes fondamentaux de manière concentrée, puis passer à l'application d'études de cas le même jour
Maggie Webb - Department of Jobs, Regions, and Precincts
Formation - Artificial Neural Networks, Machine Learning, Deep Thinking
Traduction automatique
Qu'il utilisait des données réelles d'entreprise. Le formateur avait une très bonne approche en faisant participer et concourir les stagiaires
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Formation - Applied AI from Scratch in Python
Traduction automatique