Prenez contact avec nous

Plan du cours

Paysage de l'observabilité par l'IA

  • Des tableaux de bord aux conversations : le passage à une observabilité augmentée par l'IA.
  • Capacités des LLM pertinentes pour l'observabilité : résumé, raisonnement, correspondance de motifs.
  • Architectures de référence : intégration de l'IA dans les stacks d'observabilité existantes.

Requêtage de télémétrie en langage naturel

  • Texte-to-PromQL : traduction du langage naturel en requêtes de surveillance.
  • Requêtage en langage naturel pour Elasticsearch, OpenSearch et les référentiels de journaux Loki.
  • Génération SQL à partir du langage naturel pour la télémétrie structurée.
  • Construction d'un agent assistant aux requêtes avec utilisation d'outils et conscience contextuelle.

Analyse de journaux alimentée par les LLM

  • Découpage automatique des journaux et structuration avec les LLM.
  • Détection d'anomalies dans les flux de journaux en utilisant la similarité d'embedding.
  • Regroupement des journaux et découverte de motifs à grande échelle.
  • Génération d'explications lisibles par l'homme à partir de séquences de journaux brutes.

Alerte intelligente et enrichissement des incidents

  • Corrélation et déduplication des alertes avec compréhension sémantique.
  • Rassemblement automatique du contexte des incidents à partir des manuels de procédure, des incidents passés et de la documentation.
  • Aiguillage intelligent des alertes en fonction de la compréhension du contenu et de l'expertise de l'équipe.
  • Réduction de la fatigue d'alerte grâce à la réduction du bruit pilotée par l'IA.

Analyse des causes racines assistée par l'IA

  • Génération d'hypothèses à partir de la corrélation de la télémétrie multi-sources.
  • Enchaînement des preuves : liaison des symptômes entre les métriques, les journaux et les traces.
  • Dépannage guidé avec des sessions de diagnostic IA interactives.
  • Construction d'un agent d'analyse des causes racines avec enquête progressive.

Réponse aux incidents automatisée et communication

  • Génération de résumés d'incidents et de mises à jour de statut à partir de la télémétrie.
  • Ébauche automatique de post-mortem avec reconstruction de la chronologie.
  • Communication aux parties prenantes adaptée aux audiences techniques et exécutives.
  • Suggestions de manuels de procédure et recommandations de remediation automatisées.

ML pour l'observabilité

  • Prévision de séries temporelles pour la planification de la capacité et la prédiction d'anomalies.
  • Modèles fondamentaux pour la détection d'anomalies en zero-shot sur les métriques.
  • Cartographie des dépendances de services et découverte de topologie basées sur les embeddings.
  • Entraînement et déploiement de modèles ML légers à côté des pipelines d'observabilité.

Déploiement en production et éthique

  • Considérations de latence et de coût pour l'observabilité IA en temps réel.
  • Vie privée des données : s'assurer que les LLM ne divulguent pas de télémétrie sensible.
  • Supervision humaine : lorsque le diagnostic par l'IA nécessite une validation par l'opérateur.
  • Mesure de l'impact : MTTD, MTTR et métriques de l'expérience de garde (on-call).

Pré requis

  • Expérience avec des outils d'observabilité tels que Prometheus, Grafana, Datadog ou OpenTelemetry.
  • Connaissance des concepts de gestion des journaux et des métriques.
  • Scripting Python de base pour le traitement des données.

Audience cible

  • Ingénieurs SRE et en observabilité adoptant des outils améliorés par l'IA.
  • Ingénieurs plateforme construisant des pipelines de surveillance de nouvelle génération.
  • Chefs DevOps évaluant l'intégration des LLM dans les workflows d'incidents.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires