Prenez contact avec nous

Plan du cours

Fondamentaux de NiFi et du flux de données

  • Données en mouvement vs données au repos : concepts et défis
  • Architecture de NiFi : noyaux, contrôleur de flux, provenance et bulletin
  • Composants clés : processeurs, connexions, contrôleurs et provenance

Contexte Big Data et intégration

  • Rôle de NiFi dans les écosystèmes Big Data (Hadoop, Kafka, stockage cloud)
  • Aperçu de HDFS, MapReduce et des alternatives modernes
  • Cas d'utilisation : ingestion de flux, envoi de journaux, pipelines d'événements

Installation, configuration et mise en place du cluster

  • Installation de NiFi en mode mono-nœud et en mode cluster
  • Configuration du cluster : rôles des nœuds, ZooKeeper et équilibrage de charge
  • Orchestration des déploiements NiFi : utilisation d'Ansible, Docker ou Helm

Conception et gestion des flux de données

  • Routage, filtrage, découpage et fusion des flux
  • Configuration des processeurs (InvokeHTTP, QueryRecord, PutDatabaseRecord, etc.)
  • Gestion des schémas, de l'enrichissement et des opérations de transformation
  • Gestion des erreurs, relations de réessai et contre-pression

Scénarios d'intégration

  • Connexion aux bases de données, systèmes de messagerie et API REST
  • Streaming vers les systèmes d'analyse : Kafka, Elasticsearch ou stockage cloud
  • Intégration avec Splunk, Prometheus ou pipelines de journalisation

Supervision, récupération et provenance

  • Utilisation de l'interface utilisateur NiFi, des métriques et du visualiseur de provenance
  • Conception de la récupération autonome et de la gestion élégante des pannes
  • Sauvegarde, gestion des versions des flux et gestion des changements

Réglage des performances et optimisation

  • Réglage de la JVM, du tas, des pools de threads et des paramètres de clustering
  • Optimisation de la conception des flux pour réduire les goulets d'étranglement
  • Isolation des ressources, priorisation des flux et contrôle du débit

Meilleures pratiques et gouvernance

  • Documentation des flux, normes de nommage, conception modulaire
  • Sécurité : TLS, authentification, contrôle d'accès, chiffrement des données
  • Contrôle des changements, versionnage, accès basé sur les rôles, pistes d'audit

Dépannage et gestion des incidents

  • Problèmes courants : blocages, fuites de mémoire, erreurs de processeur
  • Analyse des journaux, diagnostic des erreurs et enquête sur la cause racine
  • Stratégies de récupération et retour en arrière des flux

Travaux pratiques : Mise en œuvre d'un pipeline de données réaliste

  • Construction d'un flux de bout en bout : ingestion, transformation, livraison
  • Mise en œuvre de la gestion des erreurs, de la contre-pression et de la mise à l'échelle
  • Tests de performance et réglage du pipeline

Résumé et prochaines étapes

Pré requis

  • Expérience avec la ligne de commande Linux
  • Comprendre les bases du réseau et des systèmes de données
  • Avoir une expérience du streaming de données ou des concepts ETL

Public cible

  • Administrateurs système
  • Ingénieurs des données
  • Développeurs
  • Professionnels DevOps
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (7)

Cours à venir

Catégories Similaires