Plan du cours
Fondements des systèmes agentiques en production
- Architectures agentiques : boucles, outils, mémoire et couches d'orchestration
- Cycle de vie des agents : développement, déploiement et fonctionnement continu
- Défis de la gestion des agents à l'échelle de la production
Infrastructures et modèles de déploiement
- Déploiement des agents dans des environnements conteneurisés et cloud
- Modèles de mise à l'échelle : mise à l'échelle horizontale vs verticale, concurrence et limitation du débit (throttling)
- Orchestration multi-agents et équilibrage des charges de travail
Surveillance et observabilité
- Métriques clés : latence, taux de réussite, utilisation de la mémoire et profondeur des appels d'agents
- Suivi de l'activité des agents et des graphes d'appels
- Instrumentation de l'observabilité à l'aide de Prometheus, OpenTelemetry et Grafana
Journaux (Logging), audit et conformité
- Journalisation centralisée et collecte structurée des événements
- Conformité et auditabilité dans les flux de travail agentiques
- Conception des pistes d'audit et des mécanismes de rejeu pour le débogage
Réglage des performances et optimisation des ressources
- Réduction du surcoût de déduction (inference) et optimisation des cycles d'orchestration des agents
- Mise en cache des modèles et incorporations légères (embeddings) pour une récupération plus rapide
- Tests de charge et scénarios de stress pour les pipelines d'IA
Contrôle des coûts et gouvernance
- Comprendre les facteurs de coût des agents : appels API, mémoire, calcul et intégrations externes
- Suivi des coûts au niveau de l'agent et mise en œuvre de modèles de répartition des coûts (chargeback)
- Politiques d'automatisation pour prévenir la prolifération des agents et la consommation de ressources inactives
Stratégies CI/CD et de déploiement pour les agents
- Intégration des pipelines d'agents dans les systèmes CI/CD
- Tests, gestion des versions et stratégies de retour arrière (rollback) pour les mises à jour itératives des agents
- Déploiements progressifs et mécanismes de déploiement sûrs
Récupération après défaillance et ingénierie de la fiabilité
- Conception pour la tolérance aux pannes et la dégradation gracieuse
- Modèles de nouvelle tentative (retry), de délai d'attente (timeout) et d'interrupteur de circuit (circuit breaker) pour la fiabilité des agents
- Frameworks de réponse aux incidents et d'analyse post-incident (post-mortem) pour les opérations d'IA
Projet de synthèse
- Construire et déployer un système d'IA agentique avec une supervision complète et un suivi des coûts
- Simuler la charge, mesurer les performances et optimiser l'utilisation des ressources
- Présenter l'architecture finale et le tableau de bord de surveillance à ses pairs
Synthèse et prochaines étapes
Pré requis
- Compréhension solide du MLOps et des systèmes d'apprentissage automatique en production
- Expérience avec les déploiements conteneurisés (Docker/Kubernetes)
- Familiarité avec l'optimisation des coûts cloud et les outils d'observabilité
Public cible
- Ingénieurs MLOps
- Ingénieurs en fiabilité des sites (SRE)
- Gestionnaires d'ingénierie supervisant l'infrastructure d'IA
Nos clients témoignent (3)
Le formateur est patient et très aidant. Il maîtrise bien le sujet.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Formation - Agentic AI for Business Automation: Use Cases & Integration
Traduction automatique
Bon mélange de connaissances et de pratique
Ion Mironescu - Facultatea S.A.I.A.P.M.
Formation - Agentic AI for Enterprise Applications
Traduction automatique
Le mélange de théorie et de pratique, ainsi que des perspectives de haut niveau et de bas niveau
Ion Mironescu - Facultatea S.A.I.A.P.M.
Formation - Autonomous Decision-Making with Agentic AI
Traduction automatique