Apache Spark – Niveau Avancé : Optimisation, Streaming et Traitements Scalables

Optimiser les performances de leurs jobs Spark : partitionnement, cache, joins, formats
Informations pratiques
PUBLIC VISÉ
Data engineers, développeurs ou data scientists utilisant Spark en production. Architectes ou tech leads responsables de pipelines de données distribués. Équipes travaillant sur des projets Big Data avec des contraintes de performance, de volume ou de temps réel
Prérequis
Pratique régulière de Spark (PySpark ou Scala). Maîtrise des DataFrames, transformations de base, Spark SQL. Connaissances en cluster, format de données, et environnement distribué
Méthodes et moyens
Travaux pratiques : formation alternant théorie et pratique.
Objectifs visés

Ce que vous saurez faire à l'issue de la formation

À l’issue de la formation, les participants seront capables de :

  • Optimiser les performances de leurs jobs Spark : partitionnement, cache, joins, formats
  • Structurer des pipelines complexes et robustes
  • Gérer des traitements en streaming temps réel avec Spark Structured Streaming
  • Implémenter des workflows de machine learning distribué avec Spark MLlib
  • Déployer Spark efficacement dans un cluster (YARN, Kubernetes, Databricks…)
Programme détaillé

Un parcours structuré, module par module

Chaque module alterne apports théoriques, démonstrations et exercices pratiques pour ancrer les acquis.

Architecture approfondie de Spark

  • Analyse détaillée : DAG, stages, tasks, shuffles
  • Fonctionnement du Catalyst Optimizer et du Tungsten Engine
  • Paramètres critiques : mémoire, nombre d’exécuteurs, partitions, parallélisme

Optimisation des performances

  • Partitionnement personnalisé (repartition, coalesce, partitionBy)
  • Joins performants : broadcast, sort-merge, bucketed joins
  • Cache/persist : usages et limites
  • Choix des formats de données : Parquet, ORC, Delta
  • Utilisation de explain() et Spark UI pour profiler un job

Gestion avancée des données

  • Manipulation de fichiers volumineux / structurés
  • Lecture/écriture optimisées : compression, schema evolution, merge
  • Traitement de données hiérarchiques (nested structures, arrays)

Spark Structured Streaming avancé

  • Fenêtrage temporel, agrégations par fenêtre
  • Gestion de l’état (stateful operations)
  • Stratégies de déclenchement (triggering)
  • Tolérance aux pannes : checkpointing, exactly-once
  • Intégration Kafka ↔ Spark : lecture, écriture, offset management

Machine Learning distribué avec MLlib

  • Pipelines de traitement : VectorAssembler, StringIndexer, StandardScaler
  • Modèles supervisés : régression, classification, arbres de décision
  • Évaluation, grid search, cross-validation en mode distribué
  • Sauvegarde/rechargement de modèles Spark MLlib
  • Différences Spark MLlib vs scikit-learn / TensorFlow

Structuration de projets Spark

  • Bonnes pratiques de structuration de code (fonctions, scripts modulaires)
  • Déploiement en production : packaging avec spark-submit, intégration CI/CD
  • Variables d’environnement, configuration dynamique
  • Exécution sur Databricks, EMR, Azure Synapse ou Kubernetes

Atelier final

  • Conception et exécution d’un pipeline complet :
  • Ingestion Kafka ou fichiers
  • Traitement batch + streaming
  • Pipeline ML distribué
  • Export dans stockage optimisé
  • Profiling et tuning

Modalités d'évaluation

  • En cours de formation, par des études de cas ou des travaux pratiques
  • Et, en fin de formation, par un questionnaire d'auto-évaluation
Certification et financement

Une formation certifiée qualité

SKILLIA Academy est certifié Qualiopi au titre des actions de formation. Nos formations sont finançables via OPCO, CPF ou plan de développement des compétences.

Attestation de formation délivrée
Financement OPCO et CPF
Formateurs experts certifiés
Nos formateurs

Des experts terrain, praticiens de leur discipline

Chaque formation est animée par un consultant SKILLIA sélectionné pour son expertise sectorielle et sa pédagogie. Nos formateurs cumulent expérience opérationnelle et pratique régulière du transfert de compétences.

Praticiens en activité — Une expérience opérationnelle actuelle, mise au service de cas concrets.
Sélection exigeante — Expertise sectorielle et qualité pédagogique évaluées pour chaque intervenant.
Prix
2 100 € HT
Durée
3 jours