Architecture Big Data
Si le Big Data est LE sujet du moment, il est souvent considéré comme une boîte noire dans laquelle il est très difficile de se retrouver. Large regroupement de méthodes, d'objectifs et de technologies différentes, il demeure l'objet de nombreux questionnements :
Quelle valeur tirer des données à notre disposition ? A partir de quand parlons-nous de Big Data ? Quels outils pour gérer de gros volume de données ? Traitement batch ou traitement en continue ? Positionner l'Intelligence Artificielle par rapport au Big Data ? Quels métiers et quelles compétences pour évoluer dans ce domaine ?
- 70 %de travaux pratiques
- 95 %de satisfaction client
- 3jours de formations
À qui s’adresse cette formation "Architecture Big Data" ?
Architectes SI
Développeurs
Chefs de projet
DSI
Data Scientist
Data Miners Description de la formation "Architecture Big Data"
Architecture Big Data en bref. Cette formation Retengr dure 3 jours, soit 21 heures. Public visé : DSI, Architecte SI, Chef de projet, Développeur, Data Miner, Data Scientist. En inter-entreprises, elle coûte 2 100 € HT par participant. Prochaine session du 19 octobre au 21 octobre 2026, à distance. Elle est aussi proposée en intra-entreprise, pour vos équipes.
-
Présentation
Si le Big Data est LE sujet du moment, il est souvent considéré comme une boîte noire dans laquelle il est très difficile de se retrouver. Large regroupement de méthodes, d'objectifs et de technologies différentes, il demeure l'objet de nombreux questionnements :
Quelle valeur tirer des données à notre disposition ? A partir de quand parlons-nous de Big Data ? Quels outils pour gérer de gros volume de données ? Traitement batch ou traitement en continue ? Positionner l'Intelligence Artificielle par rapport au Big Data ? Quels métiers et quelles compétences pour évoluer dans ce domaine ?
Durée : 3 jours, soit 21 heures.
-
Méthode pédagogique
- Composée à 70% de pratique, cette formation utilise des exercices illustrés et didactiques.
- Une évaluation quotidienne de l'acquisition des connaissances de la veille est effectuée.
- Une synthèse est proposée en fin de formation.
- Une évaluation à chaud sera proposée au stagiaire à la fin du cours. Un support de cours sera remis à chaque participant comprenant les slides sur la théorie, les exercices. Une feuille d'émargement par demi-journée de présence est fournie en fin de formation ainsi qu'une attestation de fin de formation si le stagiaire a bien assisté à la totalité de la session.
- Un suivi et un échange avec les participants seront mis en place quelques jours après la formation.
-
Objectifs
- Définir les concepts et identifier l'apport du Big Data
- Comment déterminer la valeur que l'on peut tirer des données à disposition ?
- Cadrer l'écosystème technologique nécessaire à notre besoin
- Penser et organiser la collecte des données
- Choisir une technologie de stockage de données adaptée à notre usage
- Connaître les technologies pour traiter les données (plus ou moins volumineuses)
- Définir et comprendre les différents métiers : datascientist, data engineer
-
Audience
- DSI, Architecte SI, Chef de projet, Développeur, Data Miner, Data Scientist
-
Pré-requis
- Les compétences professionnelles suivantes sont souhaitables : la connaissance d'un langage de programmation structuré et les bases du monde relationnel.
- Afin de valider les compétences et les pré-requis de chaque participant, en amont de la formation, le formateur organise un entretien téléphonique. Il confirme alors que le participant a le niveau nécessaire et que le contenu répond bien à ses attentes.
-
Le formateur
Le formateur est un expert du domaine qui intervient sur le sujet depuis plusieurs années en formation mais aussi en conseil.
Doté d'une grande qualité d'écoute, sa pédagogie et sa compétence technique vous permettront d'acquérir les compétences sur les architectures Big Data.
-
Le programme
Comprendre les concepts et les enjeux du BigData
- Origines et définition du BigData.
- Les 3 V : Volume, Vélocité et Variété
- Diversité dans les cas d'usage : données chaudes, données froides
- Vos Data : Quelle valeur tirer de vos données ?
- Un exemple d'architecture Big Data.
- Exercice / Démo : Parcourir différentes sources de données accessibles via le WEB (API)
Expliquer les technologies du Big Data
- Quelles données et pour quoi faire ?
- Définir les outils de collecte de données
- Anticiper les moyens de stockage en fonction des usages
- Le datalake : votre référentiel de données
- Paralléliser ou traiter vos données en continue ?
- S'approprier les données avec des analyses visuelles : la dataviz
Stocker des données
- État de l'art : Le NoSql, sonne t'il le glas des bases de données relationnelles ?
- Le triangle de CAP
- Pourquoi le NoSql ?
- Les différentes approches : document / wide column / key-value
- Tour d'horizon des solutions à disposition : MongoDB, Cassandra, HBase…
- Exercice / Démo : définir et mettre en place un modèle de stockage de type document avec MongoDB
Collecter les données
- Comprendre les différentes sources de données : iOT / SI / Réseau sociaux / API : D'où viennent les données ?
- Gérer des formats de données différents : JSON, XML, CSV, binaires, …
- De l'importance des connecteurs…
- Tour d'horizon des outils du marché : NIFI / Node Red / Flume / Sqoop
- Exercice / Démo : Utiliser NIFI pour collecter les données d'une API publique
Hadoop
- Comprendre le périmètre de Hadoop : Stockage et traitement
- Une plateforme de traitement batch et de stockage de données froides
- Architecture et composants de la plateforme Hadoop.
- HDFS, YARN et Mapreduce : les 3 piliers
- Un écosystème complexe et complet : Hive, HBase
- Exercice / Démo : Manipuler des fichiers via Hue, mise en place de tables et requêtes Hive sur une plateforme Hadoop
Spark
- Un framework pour paralléliser des traitements
- Positionnement Spark / Hadoop
- Quelle infrastructure de déploiement
- Comprendre la complexité de la parallélisation des traitements
- SparkML : une librairie pour la datascience
- Exercice / Démo : Mise en place et analyse d'un traitement simple
Stream processing
- Le besoin de traitement au fil de l'eau
- Streaming ETL
- Streaming analytics
- Prise de décision en temps réel
- Les approches et outils de streaming : Spark Streaming / Kafka Streaming / Flink…
- Exercice / Démo : analyse en continue d'un flux de données simple
Transporter vos données : Kafka
- Définir le besoin d'un bus de données
- Les middleware Orienté Messages dans un contexte BigData
- Définir les acteurs : Producers & Consumers
- Comprendre les composants : Messages, brokers, topics, …
- Un outil taillé pour les performances
- Kafka Connect : Connectez vos outils à Kafka
- Exercice / Démo : Mise en place d'un bus Kafka pour permettre à Elasticsearch de manipuler des données extraites via NIFI
Big Data et Intelligence Artificielle
- Présentation de l'Intelligence Artificielle
- Positionnement de l'Intelligence Artificielle dans un contexte Big Data
- Les différentes approches du machine learning : Clusterisation, classification, régression
- Les implémentations : Scikit Learning / SparkML
- Le « Deep learning »
- Démo : processus complet d'un projet de datascience (analyse des données, sélection de données, apprentissage, scoring)
Datavisualization
- Pourquoi faire ?
- Dataviz pour comprendre les données
- L'écosystème de la Dataviz : outils et API
- Exercice / Démo : Analyse visuelle d'un jeu de données
-
Tarif
2100 € HT
-
Formation à distance
Le distanciel est une modalité que nous pratiquons couramment.
Retengr vous permet aussi de suivre cette formation à distance, sous forme de classe virtuelle (6 participants maximum), avec un formateur expert sur le sujet. La formation se déroule via une connexion en visio conférence (ZOOM, GoogleMeet, Teams ou autres) et vous permet d'alterner théorie et pratique de façon accompagnée ou autonome, le tout dans le respect des objectifs pédagogiques et des évaluations des acquis.
Les émargements, évaluations, attestation de formation, remises des supports de cours et autres documents se feront en ligne.
En ce qui concerne le matériel informatique du participant, il est seulement préconisé un ordinateur et une connexion internet. Nous nous chargeons du reste.
Chaque participant se verra attribuer une Machine Virtuelle qui sera exécutée dans le Cloud d'Amazon. Il disposera alors de la puissance et des outils nécessaires pour le bon déroulement de la formation. Aucune installation de la part du participant n'est requise avant la formation.
Une journée type de formation à distance se décompose de la façon suivante :
Matin :
- 2h de théorie en visioconférence
- 10 à 15 minutes de présentation d'exercices en visio
- 1h de TP en autonomie avec possibilité de solliciter le formateur (partage d'écran à distance pour une assistance efficace).
Après-midi :
- 2h de théorie en visioconférence
- 10 à 15 minutes de présentation d'exercices en visio
- 1h de TP en autonomie avec possibilité de solliciter le formateur (partage d'écran à distance pour une assistance efficace).
Les prochaines dates pour cette formation
- Architecture Big Data À distanceS'inscrire
Nos clients parlent de ce cours
“Le point fort de cette formation est la transition entre une partie théorique riche avec une mise en pratique qui permet la démystification des outils/langages et donc un réel usage de ces concepts (même si, bien sûr, il reste beaucoup de chemin pour devenir datascientist !)”
StéphaneThalès“Très satisfait de cette formation : passionnant de mettre en pratique à chaud les concepts présentés sur des TP bien réalisés. J'ai pu accroitre mes connaissances dans le domaine et renforcer ceux que je n'avais pas le temps de travailler dans mon activité. Merci à Alexia pour son énergie et ses partages 🙂 j'ai apprécié les quizz par équipe.”
SébastienOrange“Je n'avais pas forcément d'attentes précises dans le sens où je ne connaissais rien du sujet avant de débuter cette formation. Cette formation a complètement répondu à mes attentes dans la mesure où je comprends maintenant le métier de data scientist, et les différentes étapes à mettre en œuvre dans un projet.”
FlorianAxiodis“Les modules m'ont permis de nous introduire à une grande panoplie d'outils data analyse et algorithmes de machines learning accompagné de la théorie pour leur donner un sens, et la présentation de site Dataiku ou Kaggle nous offre de quoi continuer à apprendre et pratiquer. Bilan : très satisfait de ces quatre jours.”
Jean-BaptisteCelad“Globalement, je pense être capable de décrire le métier de datascientist et des compétences mises en œuvre. Je pense appliquer certaines connaissances acquises surtout dans la mise en forme des données pour une exploitation plus efficace à court terme.”
FabienneCS Group“Cette formation fournit une définition claire des principaux concepts, méthodes et usages, retrace l'histoire de l'IA dans ses grandes lignes, détaille la dynamique actuelle à l'échelle mondiale et nationale, et enfin présente de manière plus détaillée les modèles et algorithmes ML/DL. les informations ont été présentées et partagées de manière claire et logique, avec des phases ludiques d'apprentissage, de réflexion et d'échange avec la formatrice. Excellente prestation de formation !”
SébastienCLS“Formation de qualité, dispensée avec beaucoup de professionnalisme et de bienveillance. Le contenu est riche et permet de donner un bon éventail des possibilités qu'offre Spark. Merci beaucoup.”
StanleyOrange