Plan du cours
Fondamentaux de la plateforme Databricks et du Lakehouse
- Architecture et composants du Lakehouse Databricks
- Organisation des espaces de travail et des catalogues
Espace de travail Databricks et blocs-notes
- Navigation dans l'espace de travail et développement basé sur les blocs-notes
- Structuration du code en blocs-notes réutilisables
Architecture et exécution d'Apache Spark
- Architecture de l'environnement d'exécution Spark et modèle d'exécution
- Évaluation paresseuse et DAG (Directed Acyclic Graph) des jobs
DataFrames PySpark et API DataFrame
- Abstractions de DataFrames et schémas
- Opérations de base de DataFrames et expressions de colonnes
Traduction du SQL vers les DataFrames PySpark
- Traduction des clauses SQL principales en opérations DataFrame
- Fonctions fenêtrées et agrégations dans PySpark
Lecture et écriture des données dans Databricks
- Lecture à partir de sources courantes (fichiers et bases de données)
- Écriture et partitionnement des données dans le Lakehouse
Delta Lake et gestion des tables
- Tables Delta et transactions ACID
- Voyage dans le temps et évolution du schéma
Nettoyage et transformation des données
- Nettoyage des données et conversion de types
- Construction de logique de transformation réutilisable
Fonctions définies par l'utilisateur (UDF) et code modulaire
- UDF Python et pandas UDFs
- Modularisation de la logique procédurale en fonctions
Tuning des performances et optimisation
- Stratégies de partitionnement et de mise en cache
- Identification des goulots d'étranglement via l'interface utilisateur Spark
Fondamentaux du traitement par flux structuré (Structured Streaming)
- Traitement par lots versus traitement en continu
- DataFrames en streaming et agrégations de base
Jobs Databricks et orchestration des workflows
- Planification des blocs-notes comme jobs et tâches
- Construction de workflows multi-étapes avec dépendances
Unity Catalog et gouvernance des données
- Architecture et espaces de noms d'Unity Catalog
- Contrôle d'accès et lignée des données
Tests, débogage et pratiques de production
- Tests unitaires de la logique PySpark
- Débogage et normes de qualité du code
Cas d'usage finaux pour les services financiers
- Construction d'un pipeline ETL bancaire complet
- Transformation des processus SQL hérités en PySpark
Migration des charges de travail SQL vers PySpark
- Stratégie de migration et modèles de planification
- Conversion incrémentale des workflows SQL vers PySpark
Pré requis
- Expérience avec la programmation Python, y compris les fonctions et les types de données
- Compréhension du SQL, notamment des jointures, des agrégations et des sous-requêtes
- Aucune expérience préalable avec Databricks ou PySpark n'est requise
Audience cible
- Ingénieurs des données, analystes de données et professionnels du domaine
- Équipes qui migrent leurs workflows SQL existants vers Databricks et PySpark
Nos clients témoignent (1)
J'ai aimé qu'il soit pratique. J'ai adoré appliquer les connaissances théoriques avec des exemples pratiques.
Aurelia-Adriana - Allianz Services Romania
Formation - Python and Spark for Big Data (PySpark)
Traduction automatique