Se former en Big Data : Collecte et Analyse de Données Massives avec Apache Spark | Dunsaron
Le programme Big Data : Collecte et Analyse de Données Massives avec Apache Spark a été conçu pour des professionnels en poste.
Cette formation professionnelle permet aux collaborateurs techniques et métiers d'acquérir les compétences nécessaires pour exploiter Apache Spark dans un environnement enterprise. Vous apprendrez à configurer des clusters, à optimiser les requêtes et à intégrer Spark dans vos processus de prise de décision. Les cas pratiques abordent la manipulation de datasets de plusieurs téraoctets, la gestion des ressources et les bonnes pratiques pour sécuriser vos données.
Objectifs
- Comprendre l’architecture distribuée d’Apache Spark", "Configurer et optimiser un cluster Spark pour des traitements massifs", "Maîtriser les APIs PySpark pour l’analyse et la transformation de données", "Résoudre des problématiques métiers via des traitements parallèles", "Intégrer Spark dans une chaîne de production data fiable"]
Programme
[{"module": "Fondamentaux d'Apache Spark", "content": "Présentation de Spark : pourquoi cet outil face aux solutions traditionnelles ? Architecture modulaire (Driver, Executors, Cluster Manager). Comparaison avec MapReduce et Hadoop. Installation et configuration d’un environnement local et distribué.", "duration_hours": 2}, {"module": "Manipulation de données avec PySpark", "content": "Chargement et exploration de datasets volumineux. Opérations de base : filtres, agrégations, jointures. Gestion des types de données (DataFrames vs RDD). Persistance et optimisation des performances (partitionnement, caching).", "duration_hours": 2}, {"module": "Traitement distribué et optimisation", "content": "Exécution de jobs parallèles sur un cluster. Répartition des ressources (CPU, mémoire). Bonnes p
Modalités
- Durée : 1 jour (7 heures)
- Format : presentiel
- Tarif : Sur devis , finançable OPCO
Cette formation est dispensée par BusinessDigital.fr, organisme certifié Qualiopi (NDA 84692529769).