Prenez contact avec nous

Plan du cours

1. Introduction à l'apprentissage par renforcement profond

  • Qu'est-ce que l'apprentissage par renforcement ?
  • Différence entre apprentissage supervisé, non supervisé et par renforcement
  • Applications du DRL en 2025 (robotique, soins de santé, finance, logistique)
  • Comprendre la boucle d'interaction agent-environnement

2. Fondamentaux de l'apprentissage par renforcement

  • Processus de décision de Markov (MDP)
  • État, action, récompense, politique et fonctions de valeur
  • Compromis entre exploration et exploitation
  • Méthodes de Monte Carlo et apprentissage Temporal-Difference (TD)

3. Implémentation d'algorithmes de base en apprentissage par renforcement

  • Méthodes tabulaires : programmation dynamique, évaluation de politique et itération
  • Q-Learning et SARSA
  • Exploration epsilon-greedy et stratégies de décroissance
  • Implémentation d'environnements de RL avec OpenAI Gymnasium

4. Passage à l'apprentissage par renforcement profond

  • Limitations des méthodes tabulaires
  • Utilisation de réseaux de neurones pour l'approximation de fonctions
  • Architecture et flux de travail du Deep Q-Network (DQN)
  • Lecture d'expérience et réseaux cibles

5. Algorithmes avancés de DRL

  • Double DQN, Dueling DQN et lecture d'expérience prioritaire
  • Méthodes de gradient de politique : algorithme REINFORCE
  • Architectures Actor-Critic (A2C, A3C)
  • Optimisation de la politique proximale (PPO)
  • Soft Actor-Critic (SAC)

6. Travail avec des espaces d'actions continues

  • Défis du contrôle continu
  • Utilisation du DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Outils et cadres pratiques

  • Utilisation de Stable-Baselines3 et Ray RLlib
  • Journalisation et suivi avec TensorBoard
  • Ajustement des hyperparamètres pour les modèles DRL

8. Conception des récompenses et des environnements

  • Façonnage des récompenses et équilibre des pénalités
  • Concepts de transfert d'apprentissage de la simulation au réel
  • Création d'environnements personnalisés dans Gymnasium

9. Environnements partiellement observables et généralisation

  • Gestion des informations d'état incomplètes (POMDP)
  • Approches basées sur la mémoire utilisant LSTMs et RNNs
  • Amélioration de la robustesse et de la généralisation des agents

10. Théorie des jeux et apprentissage par renforcement multi-agents

  • Introduction aux environnements multi-agents
  • Coopération vs compétition
  • Applications dans l'entraînement adversarial et l'optimisation des stratégies

11. Études de cas et applications réelles

  • Simulations de conduite autonome
  • Tarification dynamique et stratégies de trading financier
  • Robotique et automatisation industrielle

12. Dépannage et optimisation

  • Diagnostic des entraînements instables
  • Gestion de la rareté des récompenses et du surapprentissage
  • Mise à l'échelle des modèles DRL sur GPU et systèmes distribués

13. Résumé et prochaines étapes

  • Récapitulatif de l'architecture DRL et des algorithmes clés
  • Tendances de l'industrie et directions de recherche (par exemple, RLHF, modèles hybrides)
  • Ressources supplémentaires et matières de lecture

Pré requis

  • Maîtrise de la programmation Python
  • Compréhension du calcul différentiel et de l'algèbre linéaire
  • Connaissances de base en probabilités et en statistiques
  • Expérience dans la construction de modèles d'apprentissage automatique en utilisant Python et NumPy ou TensorFlow/PyTorch

Public cible

  • Développeurs intéressés par l'IA et les systèmes intelligents
  • Spécialistes des données explorant les cadres de l'apprentissage par renforcement
  • Ingénieurs en apprentissage automatique travaillant sur des systèmes autonomes
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (3)

Cours à venir

Catégories Similaires