Prenez contact avec nous

Plan du cours

Introduction :

  • Apache Spark dans l'écosystème Hadoop
  • Brève introduction à Python et Scala

Fondamentaux (théorie) :

  • Architecture
  • RDD
  • Transformations et Actions
  • Stage, Tâche, Dépendances

Comprendre les bases avec l'environnement Databricks (atelier pratique) :

  • Exercices utilisant l'API RDD
  • Fonctions de base pour les actions et transformations
  • PairRDD
  • Jointures (Join)
  • Stratégies de mise en cache
  • Exercices utilisant l'API DataFrame
  • SparkSQL
  • DataFrame : sélection, filtre, regroupement, tri
  • UDF (Fonction Utilisateur Définie)
  • Exploration de l'API DataSet
  • Streaming

Comprendre le déploiement avec l'environnement AWS (atelier pratique) :

  • Fondamentaux d'AWS Glue
  • Comprendre les différences entre AWS EMR et AWS Glue
  • Exemples de travaux (jobs) dans les deux environnements
  • Compréhension des avantages et des inconvénients

Contenu supplémentaire :

  • Introduction à l'orchestration avec Apache Airflow

Pré requis

Compétences en programmation (idéalement Python, Scala)

Notions de base en SQL

 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (3)

Cours à venir

Catégories Similaires