Plan du cours
Introduction, objectifs et stratégie de migration
- Objectifs du cours, alignement du profil des participants et critères de réussite
- Approches de migration à haut niveau et considérations relatives aux risques
- Mise en place des espaces de travail, des dépôts et des jeux de données de laboratoire
Jour 1 — Fondements de la migration et architecture
- Concepts Lakehouse, aperçu de Delta Lake et architecture de Databricks
- Différences entre SMP et MPP et implications pour la migration
- Conception Medallion (Bronze → Argent → Or) et aperçu d'Unity Catalog
TP Jour 1 — Traduction d'une procédure stockée
- Migration pratique d'une procédure stockée d'exemple vers un notebook
- Transformation des tables temporaires et des curseurs en transformations DataFrame
- Validation et comparaison avec la sortie originale
Jour 2 — Delta Lake avancé et chargement incrémental
- Transactions ACID, journaux de commit, versioning et retour dans le temps (time travel)
- Auto Loader, motifs MERGE INTO, upserts et évolution du schéma
- OPTIMIZE, VACUUM, Z-ORDER, partitionnement et optimisation du stockage
TP Jour 2 — Ingestion incrémentale et optimisation
- Mise en œuvre de l'ingestion Auto Loader et des flux de travail MERGE
- Application de OPTIMIZE, Z-ORDER et VACUUM ; validation des résultats
- Mesure des améliorations des performances de lecture/écriture
Jour 3 — SQL dans Databricks, performances et débogage
- Fonctionnalités analytiques SQL : fonctions sur fenêtres, fonctions d'ordre supérieur, gestion JSON/tableaux
- Lecture de l'interface Spark UI, DAG, mélanges (shuffles), étapes, tâches et diagnostic des goulets d'étranglement
- Motifs de réglage des requêtes : jointures en diffusion (broadcast), indices (hints), mise en cache et réduction des débordements (spill)
TP Jour 3 — Refactorisation SQL et réglage des performances
- Refactorisation d'un processus SQL lourd en Spark SQL optimisé
- Utilisation des traces Spark UI pour identifier et corriger les problèmes de déséquilibre (skew) et de mélange (shuffle)
- Évaluation comparative (benchmark) avant/après et documentation des étapes de réglage
Jour 4 — PySpark tactique : Remplacement de la logique procédurale
- Modèle d'exécution Spark : pilote (driver), exécuteurs, évaluation paresseuse et stratégies de partitionnement
- Transformation des boucles et des curseurs en opérations DataFrame vectorisées
- Modularisation, UDF/pandas UDF, widgets et bibliothèques réutilisables
TP Jour 4 — Refactorisation de scripts procéduraux
- Refactorisation d'un script ETL procédural en notebooks PySpark modulaires
- Introduction de la paramétrisation, des tests de style unitaire et des fonctions réutilisables
- Revue de code et application de la liste de vérification des bonnes pratiques
Jour 5 — Orchestration, pipeline de bout en bout et bonnes pratiques
- Databricks Workflows : conception des tâches, dépendances, déclencheurs et gestion des erreurs
- Conception de pipelines Medallion incrémentaux avec règles de qualité et validation du schéma
- Intégration avec Git (GitHub/Azure DevOps), CI et stratégies de test pour la logique PySpark
TP Jour 5 — Construction d'un pipeline complet de bout en bout
- Assemblage du pipeline Bronze → Argent → Or orchestré avec Workflows
- Mise en œuvre de la journalisation, de l'audit, des réessais et des validations automatisées
- Exécution du pipeline complet, validation des sorties et préparation des notes de déploiement
Exploitation, gouvernance et préparation à la production
- Gouvernance Unity Catalog, lignée et bonnes pratiques en matière de contrôles d'accès
- Coûts, dimensionnement des clusters, mise à l'échelle automatique et motifs de concurrence des tâches
- Listes de vérification de déploiement, stratégies de retour arrière et création de runbooks
Revue finale, transfert des connaissances et prochaines étapes
- Présentations des participants sur le travail de migration et les leçons apprises
- Analyse des écarts, activités de suivi recommandées et remise des matériaux de formation
- Références, chemins d'apprentissage supplémentaires et options de support
Pré requis
- Une compréhension des concepts d'ingénierie des données
- De l'expérience en SQL et des procédures stockées (Synapse / SQL Server)
- Une familiarité avec les concepts d'orchestration ETL (ADF ou similaire)
Public cible
- Gestionnaires technologiques possédant un background en ingénierie des données
- Ingénieurs en données souhaitant migrer la logique OLAP procédurale vers des motifs Lakehouse
- Ingénieurs plateforme responsables de l'adoption de Databricks
Nos clients témoignent (1)
les labs et la qualité des exercices de mise en pratique