Prenez contact avec nous

Plan du cours

Introduction à Apache Airflow

  • Qu’est-ce que l’orchestration des flux de travail
  • Caractéristiques clés et avantages d’Apache Airflow
  • Améliorations d’Airflow 2.x et aperçu de l’écosystème

Architecture et concepts fondamentaux

  • Processeurs de planification, serveur Web et travailleurs
  • DAG, tâches et opérateurs
  • Exécutants et back-ends (Local, Celery, Kubernetes)

Installation et configuration

  • Installation d’Airflow dans des environnements locaux et cloud
  • Configuration d’Airflow avec différents exécutants
  • Configuration des bases de données de métadonnées et des connexions

Navigation dans l’interface utilisateur et la CLI d’Airflow

  • Découverte de l’interface Web d’Airflow
  • Supervision des exécutions de DAG, des tâches et des journaux
  • Utilisation de la CLI d’Airflow pour l’administration

Création et gestion des DAG

  • Création de DAG avec l’API TaskFlow
  • Utilisation d’opérateurs, de capteurs et de crochets (hooks)
  • Gestion des dépendances et des intervalles de planification

Intégration d’Airflow aux services de données et cloud

  • Connexion aux bases de données, aux API et aux files de messagerie
  • Exécution de pipelines ETL avec Airflow
  • Intégrations cloud : opérateurs AWS, GCP, Azure

Supervision et observabilité

  • Journaux de tâches et supervision en temps réel
  • Métriques avec Prometheus et Grafana
  • Alertes et notifications par courrier électronique ou Slack

Sécurisation d’Apache Airflow

  • Contrôle d’accès basé sur les rôles (RBAC)
  • Authentification avec LDAP, OAuth et SSO
  • Gestion des secrets avec Vault et les coffres de secrets cloud

Mise à l’échelle d’Apache Airflow

  • Parallélisme, concurrence et files de tâches
  • Utilisation de CeleryExecutor et KubernetesExecutor
  • Déploiement d’Airflow sur Kubernetes avec Helm

Bonnes pratiques pour la production

  • Contrôle de version et CI/CD pour les DAG
  • Test et débogage des DAG
  • Maintien de la fiabilité et des performances à grande échelle

Dépannage et optimisation

  • Débogage des DAG et des tâches en échec
  • Optimisation des performances des DAG
  • Erreurs courantes et moyens de les éviter

Résumé et prochaines étapes

Pré requis

  • Expérience en programmation Python
  • Familiarité avec les concepts d’ingénierie des données ou de l’infDevOps
  • Compréhension de l’ETL ou de l’orchestration des flux de travail

Public cible

  • Scientifiques des données
  • Ingénieurs en données
  • Ingénieurs en infDevOps et en infrastructure
  • Développeurs logiciels
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (7)

Cours à venir

Catégories Similaires