Prenez contact avec nous

Plan du cours

Chaque session dure 2 heures

Jour 1 : Session 1 : Aperçu des entreprises sur l'importance du Business Intelligence Big Data dans le secteur gouvernemental

  • Études de cas de la NIH et du DoE
  • Taux d'adaptation du Big Data dans les agences gouvernementales et la manière dont elles alignent leur future exploitation autour de l'analyse prédictive du Big Data
  • Domaines d'application à grande échelle dans le DoD, la NSA, l'IRS, l'USDA, etc.
  • Interfaçage du Big Data avec les données héritées (legacy)
  • Compréhension de base des technologies habilitantes dans l'analyse prédictive
  • Intégration de données et visualisation de tableaux de bord
  • Gestion de la fraude
  • Génération de règles métier / détection de fraude
  • Détection et profilage des menaces
  • Analyse des avantages par rapport aux coûts pour la mise en œuvre du Big Data

Jour 1 : Session 2 : Introduction au Big Data-1

  • Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
  • Entrepôts de données – schéma statique, jeu de données évoluant lentement
  • Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Solutions basées sur Hadoop – pas de conditions sur la structure du jeu de données.
  • Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
  • Lots – adapté à l'analyse / non interactif
  • Volume : flux de données CEP
  • Choix typiques – produits CEP (par ex. Infostreams, Apama, MarkLogic, etc)
  • Moins prêts pour la production – Storm/S4
  • Bases de données NoSQL – (colonnes et clé-valeur) : Le mieux adapté comme adjoint analytique à l'entrepôt de données / base de données

Jour 1 : Session 3 : Introduction au Big Data-2

Solutions NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hiérarchique) - GT.m, Cache
  • KV Store (Ordonné) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Base de données d'objets - ZopeDB, DB40, Shoal
  • Stockage de documents - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de données XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Stockage de colonnes larges - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variantes de données : Introduction aux problèmes de nettoyage des données dans le Big Data

  • RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
  • NoSQL – semi-structuré, suffisamment structuré pour stocker les données sans schéma exact avant le stockage
  • Problèmes de nettoyage des données

Jour 1 : Session 4 : Introduction au Big Data-3 : Hadoop

  • Quand choisir Hadoop ?
  • STRUCTURÉ - Les entrepôts de données / bases de données d'entreprise peuvent stocker de grandes quantités de données (à un coût) mais imposent une structure (pas bon pour l'exploration active)
  • Données SEMI-STRUCTURÉES – difficile à faire avec les solutions traditionnelles (entrepôts de données / bases de données)
  • Le stockage des données = un énorme effort et statique même après la mise en œuvre
  • Pour la variété et le volume de données, traités sur du matériel standard – HADOOP
  • Matériel standard (H/W) nécessaire pour créer un cluster Hadoop

Introduction à Map Reduce /HDFS

  • MapReduce – distribution du calcul sur plusieurs serveurs
  • HDFS – rendre les données disponibles localement pour le processus de calcul (avec redondance)
  • Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
  • Responsabilité du développeur de donner un sens aux données
  • Programmation MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS

Jour 2 : Session 1 : Écosystème du Big Data - Construire l'ETL Big Data : univers des outils Big Data - lesquels utiliser et quand ?

  • Hadoop vs. Autres solutions NoSQL
  • Pour un accès interactif et aléatoire aux données
  • Hbase (base de données orientée colonnes) au-dessus de Hadoop
  • Accès aléatoire aux données mais restrictions imposées (max 1 PB)
  • Pas bon pour l'analyse ad hoc, bon pour la journalisation, le comptage, les séries chronologiques
  • Sqoop - Import depuis les bases de données vers Hive ou HDFS (accès JDBC/ODBC)
  • Flume – Flux de données (par ex. données de journalisation) vers HDFS

Jour 2 : Session 2 : Système de gestion du Big Data

  • Déplacement de pièces, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
  • Pipeline complexe/flux de travail : Oozie – gérer le flux de travail, les dépendances, la chaîne
  • Déployer, configurer, gérer le cluster, mettre à niveau, etc. (admin système) : Ambari
  • Dans le nuage : Whirr

Jour 2 : Session 3 : Analyse prédictive dans le Business Intelligence -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :

  • Introduction à l'apprentissage automatique
  • Apprentissage des techniques de classification
  • Prédiction bayésienne - préparation du fichier d'entraînement
  • Machine à vecteurs de support
  • Algèbre d'arbres p-Tree KNN & extraction verticale
  • Réseau de neurones
  • Problème des grandes variables du Big Data - Forêt aléatoire (RF)
  • Problème d'automatisation du Big Data – Ensemble multi-modèles RF
  • Automatisation par Soft10-M
  • Outil d'analyse de texte - Treeminer
  • Apprentissage agile
  • Apprentissage basé sur les agents
  • Apprentissage distribué
  • Introduction aux outils open source pour l'analyse prédictive : R, Rapidminer, Mahut

Jour 2 : Session 4 : Écosystème d'analyse prédictive-2 : Problèmes courants d'analyse prédictive dans le secteur gouvernemental

  • Analyse de l'insight
  • Analyse de visualisation
  • Analyse prédictive structurée
  • Analyse prédictive non structurée
  • Profilage des menaces / fraudeurs / fournisseurs
  • Moteur de recommandation
  • Détection de motifs
  • Découverte de règles / scénarios – échec, fraude, optimisation
  • Découverte des causes profondes
  • Analyse des sentiments
  • Analyse CRM
  • Analyse réseau
  • Analyse de texte
  • Révision assistée par la technologie
  • Analyse de la fraude
  • Analyse en temps réel

Jour 3 : Session 1 : Analyse en temps réel et à grande échelle sur Hadoop

  • Pourquoi les algorithmes d'analyse courants échouent dans Hadoop/HDFS
  • Apache Hama - pour le calcul distribué synchrone par lots
  • Apache SPARK - pour le calcul en grappe pour l'analyse en temps réel
  • CMU Graphics Lab2 - Approche asynchrone basée sur les graphes pour le calcul distribué
  • Approche basée sur l'algèbre p de KNN de Treeminer pour réduire le coût matériel de fonctionnement

Jour 3 : Session 2 : Outils pour l'eDiscovery et la Forensique

  • eDiscovery sur le Big Data vs. données héritées – une comparaison du coût et des performances
  • Codage prédictif et révision assistée par la technologie (TAR)
  • Démonstration en direct d'un produit Tar (vMiner) pour comprendre comment la TAR fonctionne pour une découverte plus rapide
  • Indexation plus rapide via HDFS – vélocité des données
  • Traitement du langage naturel (NLP) – diverses techniques et produits open source
  • eDiscovery dans les langues étrangères - technologie pour le traitement des langues étrangères

Jour 3 : Session 3 : Business Intelligence Big Data pour la cybersécurité – Compréhension de la vue à 360 degrés de la collecte rapide de données à l'identification des menaces

  • Comprendre les bases de l'analyse de la sécurité - surface d'attaque, mauvaise configuration de la sécurité, défenses de l'hôte
  • Infrastructure réseau / grand pipeline de données / ETL de réponse pour l'analyse en temps réel
  • Préscriptif vs prédictif – Règles fixes basées sur des règles vs auto-découverte des règles de menace à partir des métadonnées

Jour 3 : Session 4 : Big Data dans l'USDA : Application en agriculture

  • Introduction à l'IoT (Internet des objets) pour l'agriculture - Big Data basé sur des capteurs et contrôle
  • Introduction à l'imagerie satellite et à son application en agriculture
  • Intégration des données de capteurs et d'images pour la fertilité du sol, la recommandation de cultures et les prévisions
  • Assurance agricole et Big Data
  • Prévision des pertes de récoltes

Jour 4 : Session 1 : BI de prévention des fraudes à partir du Big Data dans le secteur gouvernemental - Analyse de la fraude :

  • Classification de base de l'analyse de la fraude - basée sur les règles vs analyse prédictive
  • Apprentissage automatique supervisé vs non supervisé pour la détection de motifs de fraude
  • Fraude des fournisseurs / facturation excessive pour les projets
  • Fraude Medicare et Medicaid - techniques de détection de fraude pour le traitement des demandes
  • Fraudes au remboursement de voyage
  • Fraudes au remboursement de l'IRS
  • Des études de cas et des démonstrations en direct seront fournies lorsque les données seront disponibles.

Jour 4 : Session 2 : Analyse des médias sociaux - Collecte et analyse d'intelligence

  • API ETL Big Data pour l'extraction des données des médias sociaux
  • Texte, image, métadonnées et vidéo
  • Analyse des sentiments à partir du flux de médias sociaux
  • Filtrage contextuel et non contextuel du flux de médias sociaux
  • Tableau de bord des médias sociaux pour intégrer les médias sociaux variés
  • Profilage automatisé du profil des médias sociaux
  • Une démonstration en direct de chaque analyse sera fournie via l'outil Treeminer.

Jour 4 : Session 3 : Analyse Big Data dans le traitement d'images et les flux vidéo

  • Techniques de stockage d'images dans le Big Data - Solution de stockage pour les données dépassant les pétaoctets
  • LTFS et LTO
  • GPFS-LTFS (Solution de stockage en couches pour les grandes données d'images)
  • Fondamentaux de l'analyse d'images
  • Reconnaissance d'objets
  • Segmentation d'images
  • Suivi de mouvement
  • Reconstruction d'images 3D

Jour 4 : Session 4 : Applications du Big Data dans la NIH :

  • Domaines émergents de la bio-informatique
  • Métalégenomique et problèmes d'exploitation des données du Big Data
  • Analyse prédictive du Big Data pour la pharmacogénomique, la métabolomique et la protéomique
  • Big Data dans le processus génomique aval
  • Application de l'analyse prédictive du Big Data dans la santé publique

Tableau de bord Big Data pour un accès rapide à des données variées et affichage :

  • Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
  • Gestion du Big Data
  • Étude de cas du Tableau de bord Big Data : Tableau et Pentaho
  • Utiliser l'application Big Data pour pousser les services basés sur la localisation dans le secteur gouvernemental.
  • Système de suivi et de gestion

Jour 5 : Session 1 : Comment justifier la mise en œuvre du Business Intelligence Big Data au sein d'une organisation :

  • Définir le ROI pour la mise en œuvre du Big Data
  • Études de cas pour l'économie de temps des analystes pour la collecte et la préparation des données – augmentation du gain de productivité
  • Études de cas de gains de revenus provenant de l'économie des coûts des bases de données licenciées
  • Gains de revenus provenant des services basés sur la localisation
  • Économies provenant de la prévention des fraudes
  • Une approche intégrée de feuille de calcul pour calculer les dépenses approx. vs. les gains de revenus / économies de la mise en œuvre du Big Data.

Jour 5 : Session 2 : Procédure étape par étape pour remplacer le système de données hérité par un système Big Data :

  • Comprendre la feuille de route pratique de migration du Big Data
  • Quelles sont les informations importantes nécessaires avant d'architecturer une mise en œuvre du Big Data
  • Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
  • Comment estimer la croissance des données
  • Études de cas

Jour 5 : Session 4 : Revue des fournisseurs de Big Data et de leurs produits. Session Q/R :

  • Accenture
  • APTEAN (anciennement CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anciennement 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Partie d'EMC)

Pré requis

  • Connaissances de base du fonctionnement des entreprises et des systèmes de données du gouvernement dans leur domaine
  • Compréhension de base de SQL/Oracle ou des bases de données relationnelles
  • Compréhension de base de la statistique (au niveau des feuilles de calcul)
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires