Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à l’AIOps prédictive
- Vue d’ensemble de l’analytique prédictive dans les opérations informatiques
- Sources de données pour la prédiction (journaux, métriques, événements)
- Concepts clés en prévision par séries temporelles et modèles d’anomalies
Conception de modèles de prédiction des incidents
- Étiquetage des incidents historiques et du comportement système
- Choix et entraînement de modèles (p. ex. LSTM, Random Forest, AutoML)
- Évaluation des performances du modèle et gestion des faux positifs
Collecte de données et ingénierie des caractéristiques
- Ingestion et alignement des données de journaux et de métriques pour l’entrée du modèle
- Extraction de caractéristiques à partir de données structurées et non structurées
- Gestion du bruit et des données manquantes dans les pipelines opérationnels
Automatisation de l’analyse des causes profondes (RCA)
- Corrélation basée sur les graphes des services et de l’infrastructure
- Utilisation du ML pour déduire les causes profondes probables à partir de chaînes d’événements
- Visualisation de la RCA avec des tableaux de bord tenant compte de la topologie
Remédiation et automatisation des flux de travail
- Intégration avec les plateformes d’automatisation (p. ex. Ansible, Rundeck)
- Déclenchement de retours en arrière, de redémarrages ou de redirection de trafic
- Audit et documentation des interventions automatisées
Mise à l’échelle des pipelines AIOps intelligents
- MLOps pour l’observabilité : réentraînement et versionnage des modèles
- Exécution de prédictions en temps réel sur des nœuds distribués
- Meilleures pratiques pour le déploiement de l’AIOps dans les environnements de production
Études de cas et applications pratiques
- Analyse de données d’incidents réelles à l’aide de modèles AIOps prédictifs
- Déploiement de pipelines de RCA avec des données synthétiques et de production
- Revue d’utilisations industrielles : pannes cloud, instabilité des microservices, dégradations réseau
Résumé et prochaines étapes
Pré requis
- Expérience avec des systèmes de surveillance tels que Prometheus ou ELK
- Connaissances opérationnelles de Python et d’apprentissage automatique de base
- Familiarité avec les flux de travail de gestion des incidents
Public cible
- Ingénieurs en fiabilité des sites (SRE) seniors
- Architectes en automatisation IT
- Responsables de plateformes DevOps et d’observabilité