Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction :
- Apache Spark dans l'écosystème Hadoop
- Brève introduction à Python et Scala
Fondamentaux (théorie) :
- Architecture
- RDD
- Transformations et Actions
- Stage, Tâche, Dépendances
Comprendre les bases avec l'environnement Databricks (atelier pratique) :
- Exercices utilisant l'API RDD
- Fonctions de base pour les actions et transformations
- PairRDD
- Jointures (Join)
- Stratégies de mise en cache
- Exercices utilisant l'API DataFrame
- SparkSQL
- DataFrame : sélection, filtre, regroupement, tri
- UDF (Fonction Utilisateur Définie)
- Exploration de l'API DataSet
- Streaming
Comprendre le déploiement avec l'environnement AWS (atelier pratique) :
- Fondamentaux d'AWS Glue
- Comprendre les différences entre AWS EMR et AWS Glue
- Exemples de travaux (jobs) dans les deux environnements
- Compréhension des avantages et des inconvénients
Contenu supplémentaire :
- Introduction à l'orchestration avec Apache Airflow
Pré requis
Compétences en programmation (idéalement Python, Scala)
Notions de base en SQL
21 Heures
Nos clients témoignent (3)
Avoir des sessions pratiques / des devoirs
Poornima Chenthamarakshan - Intelligent Medical Objects
Formation - Apache Spark in the Cloud
Traduction automatique
1. Bon équilibre entre les concepts de haut niveau et les détails techniques. 2. Andras est très compétent dans son enseignement. 3. Exercice
Steven Wu - Intelligent Medical Objects
Formation - Apache Spark in the Cloud
Traduction automatique
Découvrez le streaming Spark, Databricks et AWS Redshift
Lim Meng Tee - Jobstreet.com Shared Services Sdn. Bhd.
Formation - Apache Spark in the Cloud
Traduction automatique