Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Chaque session dure 2 heures
Jour 1 : Session 1 : Aperçu des entreprises sur l'importance du Business Intelligence Big Data dans le secteur gouvernemental
- Études de cas de la NIH et du DoE
- Taux d'adaptation du Big Data dans les agences gouvernementales et la manière dont elles alignent leur future exploitation autour de l'analyse prédictive du Big Data
- Domaines d'application à grande échelle dans le DoD, la NSA, l'IRS, l'USDA, etc.
- Interfaçage du Big Data avec les données héritées (legacy)
- Compréhension de base des technologies habilitantes dans l'analyse prédictive
- Intégration de données et visualisation de tableaux de bord
- Gestion de la fraude
- Génération de règles métier / détection de fraude
- Détection et profilage des menaces
- Analyse des avantages par rapport aux coûts pour la mise en œuvre du Big Data
Jour 1 : Session 2 : Introduction au Big Data-1
- Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
- Entrepôts de données – schéma statique, jeu de données évoluant lentement
- Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Solutions basées sur Hadoop – pas de conditions sur la structure du jeu de données.
- Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
- Lots – adapté à l'analyse / non interactif
- Volume : flux de données CEP
- Choix typiques – produits CEP (par ex. Infostreams, Apama, MarkLogic, etc)
- Moins prêts pour la production – Storm/S4
- Bases de données NoSQL – (colonnes et clé-valeur) : Le mieux adapté comme adjoint analytique à l'entrepôt de données / base de données
Jour 1 : Session 3 : Introduction au Big Data-2
Solutions NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hiérarchique) - GT.m, Cache
- KV Store (Ordonné) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de données d'objets - ZopeDB, DB40, Shoal
- Stockage de documents - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de données XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Stockage de colonnes larges - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variantes de données : Introduction aux problèmes de nettoyage des données dans le Big Data
- RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
- NoSQL – semi-structuré, suffisamment structuré pour stocker les données sans schéma exact avant le stockage
- Problèmes de nettoyage des données
Jour 1 : Session 4 : Introduction au Big Data-3 : Hadoop
- Quand choisir Hadoop ?
- STRUCTURÉ - Les entrepôts de données / bases de données d'entreprise peuvent stocker de grandes quantités de données (à un coût) mais imposent une structure (pas bon pour l'exploration active)
- Données SEMI-STRUCTURÉES – difficile à faire avec les solutions traditionnelles (entrepôts de données / bases de données)
- Le stockage des données = un énorme effort et statique même après la mise en œuvre
- Pour la variété et le volume de données, traités sur du matériel standard – HADOOP
- Matériel standard (H/W) nécessaire pour créer un cluster Hadoop
Introduction à Map Reduce /HDFS
- MapReduce – distribution du calcul sur plusieurs serveurs
- HDFS – rendre les données disponibles localement pour le processus de calcul (avec redondance)
- Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
- Responsabilité du développeur de donner un sens aux données
- Programmation MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS
Jour 2 : Session 1 : Écosystème du Big Data - Construire l'ETL Big Data : univers des outils Big Data - lesquels utiliser et quand ?
- Hadoop vs. Autres solutions NoSQL
- Pour un accès interactif et aléatoire aux données
- Hbase (base de données orientée colonnes) au-dessus de Hadoop
- Accès aléatoire aux données mais restrictions imposées (max 1 PB)
- Pas bon pour l'analyse ad hoc, bon pour la journalisation, le comptage, les séries chronologiques
- Sqoop - Import depuis les bases de données vers Hive ou HDFS (accès JDBC/ODBC)
- Flume – Flux de données (par ex. données de journalisation) vers HDFS
Jour 2 : Session 2 : Système de gestion du Big Data
- Déplacement de pièces, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
- Pipeline complexe/flux de travail : Oozie – gérer le flux de travail, les dépendances, la chaîne
- Déployer, configurer, gérer le cluster, mettre à niveau, etc. (admin système) : Ambari
- Dans le nuage : Whirr
Jour 2 : Session 3 : Analyse prédictive dans le Business Intelligence -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :
- Introduction à l'apprentissage automatique
- Apprentissage des techniques de classification
- Prédiction bayésienne - préparation du fichier d'entraînement
- Machine à vecteurs de support
- Algèbre d'arbres p-Tree KNN & extraction verticale
- Réseau de neurones
- Problème des grandes variables du Big Data - Forêt aléatoire (RF)
- Problème d'automatisation du Big Data – Ensemble multi-modèles RF
- Automatisation par Soft10-M
- Outil d'analyse de texte - Treeminer
- Apprentissage agile
- Apprentissage basé sur les agents
- Apprentissage distribué
- Introduction aux outils open source pour l'analyse prédictive : R, Rapidminer, Mahut
Jour 2 : Session 4 : Écosystème d'analyse prédictive-2 : Problèmes courants d'analyse prédictive dans le secteur gouvernemental
- Analyse de l'insight
- Analyse de visualisation
- Analyse prédictive structurée
- Analyse prédictive non structurée
- Profilage des menaces / fraudeurs / fournisseurs
- Moteur de recommandation
- Détection de motifs
- Découverte de règles / scénarios – échec, fraude, optimisation
- Découverte des causes profondes
- Analyse des sentiments
- Analyse CRM
- Analyse réseau
- Analyse de texte
- Révision assistée par la technologie
- Analyse de la fraude
- Analyse en temps réel
Jour 3 : Session 1 : Analyse en temps réel et à grande échelle sur Hadoop
- Pourquoi les algorithmes d'analyse courants échouent dans Hadoop/HDFS
- Apache Hama - pour le calcul distribué synchrone par lots
- Apache SPARK - pour le calcul en grappe pour l'analyse en temps réel
- CMU Graphics Lab2 - Approche asynchrone basée sur les graphes pour le calcul distribué
- Approche basée sur l'algèbre p de KNN de Treeminer pour réduire le coût matériel de fonctionnement
Jour 3 : Session 2 : Outils pour l'eDiscovery et la Forensique
- eDiscovery sur le Big Data vs. données héritées – une comparaison du coût et des performances
- Codage prédictif et révision assistée par la technologie (TAR)
- Démonstration en direct d'un produit Tar (vMiner) pour comprendre comment la TAR fonctionne pour une découverte plus rapide
- Indexation plus rapide via HDFS – vélocité des données
- Traitement du langage naturel (NLP) – diverses techniques et produits open source
- eDiscovery dans les langues étrangères - technologie pour le traitement des langues étrangères
Jour 3 : Session 3 : Business Intelligence Big Data pour la cybersécurité – Compréhension de la vue à 360 degrés de la collecte rapide de données à l'identification des menaces
- Comprendre les bases de l'analyse de la sécurité - surface d'attaque, mauvaise configuration de la sécurité, défenses de l'hôte
- Infrastructure réseau / grand pipeline de données / ETL de réponse pour l'analyse en temps réel
- Préscriptif vs prédictif – Règles fixes basées sur des règles vs auto-découverte des règles de menace à partir des métadonnées
Jour 3 : Session 4 : Big Data dans l'USDA : Application en agriculture
- Introduction à l'IoT (Internet des objets) pour l'agriculture - Big Data basé sur des capteurs et contrôle
- Introduction à l'imagerie satellite et à son application en agriculture
- Intégration des données de capteurs et d'images pour la fertilité du sol, la recommandation de cultures et les prévisions
- Assurance agricole et Big Data
- Prévision des pertes de récoltes
Jour 4 : Session 1 : BI de prévention des fraudes à partir du Big Data dans le secteur gouvernemental - Analyse de la fraude :
- Classification de base de l'analyse de la fraude - basée sur les règles vs analyse prédictive
- Apprentissage automatique supervisé vs non supervisé pour la détection de motifs de fraude
- Fraude des fournisseurs / facturation excessive pour les projets
- Fraude Medicare et Medicaid - techniques de détection de fraude pour le traitement des demandes
- Fraudes au remboursement de voyage
- Fraudes au remboursement de l'IRS
- Des études de cas et des démonstrations en direct seront fournies lorsque les données seront disponibles.
Jour 4 : Session 2 : Analyse des médias sociaux - Collecte et analyse d'intelligence
- API ETL Big Data pour l'extraction des données des médias sociaux
- Texte, image, métadonnées et vidéo
- Analyse des sentiments à partir du flux de médias sociaux
- Filtrage contextuel et non contextuel du flux de médias sociaux
- Tableau de bord des médias sociaux pour intégrer les médias sociaux variés
- Profilage automatisé du profil des médias sociaux
- Une démonstration en direct de chaque analyse sera fournie via l'outil Treeminer.
Jour 4 : Session 3 : Analyse Big Data dans le traitement d'images et les flux vidéo
- Techniques de stockage d'images dans le Big Data - Solution de stockage pour les données dépassant les pétaoctets
- LTFS et LTO
- GPFS-LTFS (Solution de stockage en couches pour les grandes données d'images)
- Fondamentaux de l'analyse d'images
- Reconnaissance d'objets
- Segmentation d'images
- Suivi de mouvement
- Reconstruction d'images 3D
Jour 4 : Session 4 : Applications du Big Data dans la NIH :
- Domaines émergents de la bio-informatique
- Métalégenomique et problèmes d'exploitation des données du Big Data
- Analyse prédictive du Big Data pour la pharmacogénomique, la métabolomique et la protéomique
- Big Data dans le processus génomique aval
- Application de l'analyse prédictive du Big Data dans la santé publique
Tableau de bord Big Data pour un accès rapide à des données variées et affichage :
- Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
- Gestion du Big Data
- Étude de cas du Tableau de bord Big Data : Tableau et Pentaho
- Utiliser l'application Big Data pour pousser les services basés sur la localisation dans le secteur gouvernemental.
- Système de suivi et de gestion
Jour 5 : Session 1 : Comment justifier la mise en œuvre du Business Intelligence Big Data au sein d'une organisation :
- Définir le ROI pour la mise en œuvre du Big Data
- Études de cas pour l'économie de temps des analystes pour la collecte et la préparation des données – augmentation du gain de productivité
- Études de cas de gains de revenus provenant de l'économie des coûts des bases de données licenciées
- Gains de revenus provenant des services basés sur la localisation
- Économies provenant de la prévention des fraudes
- Une approche intégrée de feuille de calcul pour calculer les dépenses approx. vs. les gains de revenus / économies de la mise en œuvre du Big Data.
Jour 5 : Session 2 : Procédure étape par étape pour remplacer le système de données hérité par un système Big Data :
- Comprendre la feuille de route pratique de migration du Big Data
- Quelles sont les informations importantes nécessaires avant d'architecturer une mise en œuvre du Big Data
- Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
- Comment estimer la croissance des données
- Études de cas
Jour 5 : Session 4 : Revue des fournisseurs de Big Data et de leurs produits. Session Q/R :
- Accenture
- APTEAN (anciennement CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anciennement 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Partie d'EMC)
Pré requis
- Connaissances de base du fonctionnement des entreprises et des systèmes de données du gouvernement dans leur domaine
- Compréhension de base de SQL/Oracle ou des bases de données relationnelles
- Compréhension de base de la statistique (au niveau des feuilles de calcul)
35 Heures
Nos clients témoignent (1)
La capacité du formateur à aligner le cours sur les exigences de l'organisation, et non simplement à le dispenser pour le principe de sa livraison.
Masilonyane - Revenue Services Lesotho
Formation - Big Data Business Intelligence for Govt. Agencies
Traduction automatique