Prenez contact avec nous
 Durée 14 heures

Plan du cours

Introduction à l’AIOps prédictive

  • Vue d’ensemble de l’analytique prédictive dans les opérations informatiques
  • Sources de données pour la prédiction (journaux, métriques, événements)
  • Concepts clés en prévision par séries temporelles et modèles d’anomalies

Conception de modèles de prédiction des incidents

  • Étiquetage des incidents historiques et du comportement système
  • Choix et entraînement de modèles (p. ex. LSTM, Random Forest, AutoML)
  • Évaluation des performances du modèle et gestion des faux positifs

Collecte de données et ingénierie des caractéristiques

  • Ingestion et alignement des données de journaux et de métriques pour l’entrée du modèle
  • Extraction de caractéristiques à partir de données structurées et non structurées
  • Gestion du bruit et des données manquantes dans les pipelines opérationnels

Automatisation de l’analyse des causes profondes (RCA)

  • Corrélation basée sur les graphes des services et de l’infrastructure
  • Utilisation du ML pour déduire les causes profondes probables à partir de chaînes d’événements
  • Visualisation de la RCA avec des tableaux de bord tenant compte de la topologie

Remédiation et automatisation des flux de travail

  • Intégration avec les plateformes d’automatisation (p. ex. Ansible, Rundeck)
  • Déclenchement de retours en arrière, de redémarrages ou de redirection de trafic
  • Audit et documentation des interventions automatisées

Mise à l’échelle des pipelines AIOps intelligents

  • MLOps pour l’observabilité : réentraînement et versionnage des modèles
  • Exécution de prédictions en temps réel sur des nœuds distribués
  • Meilleures pratiques pour le déploiement de l’AIOps dans les environnements de production

Études de cas et applications pratiques

  • Analyse de données d’incidents réelles à l’aide de modèles AIOps prédictifs
  • Déploiement de pipelines de RCA avec des données synthétiques et de production
  • Revue d’utilisations industrielles : pannes cloud, instabilité des microservices, dégradations réseau

Résumé et prochaines étapes

Pré requis

  • Expérience avec des systèmes de surveillance tels que Prometheus ou ELK
  • Connaissances opérationnelles de Python et d’apprentissage automatique de base
  • Familiarité avec les flux de travail de gestion des incidents

Public cible

  • Ingénieurs en fiabilité des sites (SRE) seniors
  • Architectes en automatisation IT
  • Responsables de plateformes DevOps et d’observabilité

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires