Prenez contact avec nous

Plan du cours

Fondamentaux de la plateforme Databricks et du Lakehouse

  • Architecture et composants du Lakehouse Databricks
  • Organisation des espaces de travail et des catalogues

Espace de travail Databricks et blocs-notes

  • Navigation dans l'espace de travail et développement basé sur les blocs-notes
  • Structuration du code en blocs-notes réutilisables

Architecture et exécution d'Apache Spark

  • Architecture de l'environnement d'exécution Spark et modèle d'exécution
  • Évaluation paresseuse et DAG (Directed Acyclic Graph) des jobs

DataFrames PySpark et API DataFrame

  • Abstractions de DataFrames et schémas
  • Opérations de base de DataFrames et expressions de colonnes

Traduction du SQL vers les DataFrames PySpark

  • Traduction des clauses SQL principales en opérations DataFrame
  • Fonctions fenêtrées et agrégations dans PySpark

Lecture et écriture des données dans Databricks

  • Lecture à partir de sources courantes (fichiers et bases de données)
  • Écriture et partitionnement des données dans le Lakehouse

Delta Lake et gestion des tables

  • Tables Delta et transactions ACID
  • Voyage dans le temps et évolution du schéma

Nettoyage et transformation des données

  • Nettoyage des données et conversion de types
  • Construction de logique de transformation réutilisable

Fonctions définies par l'utilisateur (UDF) et code modulaire

  • UDF Python et pandas UDFs
  • Modularisation de la logique procédurale en fonctions

Tuning des performances et optimisation

  • Stratégies de partitionnement et de mise en cache
  • Identification des goulots d'étranglement via l'interface utilisateur Spark

Fondamentaux du traitement par flux structuré (Structured Streaming)

  • Traitement par lots versus traitement en continu
  • DataFrames en streaming et agrégations de base

Jobs Databricks et orchestration des workflows

  • Planification des blocs-notes comme jobs et tâches
  • Construction de workflows multi-étapes avec dépendances

Unity Catalog et gouvernance des données

  • Architecture et espaces de noms d'Unity Catalog
  • Contrôle d'accès et lignée des données

Tests, débogage et pratiques de production

  • Tests unitaires de la logique PySpark
  • Débogage et normes de qualité du code

Cas d'usage finaux pour les services financiers

  • Construction d'un pipeline ETL bancaire complet
  • Transformation des processus SQL hérités en PySpark

Migration des charges de travail SQL vers PySpark

  • Stratégie de migration et modèles de planification
  • Conversion incrémentale des workflows SQL vers PySpark

Pré requis

  • Expérience avec la programmation Python, y compris les fonctions et les types de données
  • Compréhension du SQL, notamment des jointures, des agrégations et des sous-requêtes
  • Aucune expérience préalable avec Databricks ou PySpark n'est requise

Audience cible

  • Ingénieurs des données, analystes de données et professionnels du domaine
  • Équipes qui migrent leurs workflows SQL existants vers Databricks et PySpark
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires