Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Manipulez des DataFrames Spark, écrivez des transformations distribuées, comprenez les mécanismes d'exécution (partitions, shuffle, plan d'exécution) et optimisez vos jobs PySpark avant d'écrire vers des formats analytiques comme Parquet.
from pyspark.sql import functions as F
df = spark.read.parquet("/data/ventes")
resultat = (
df.groupBy("region")
.agg(F.sum("montant").alias("total"))
.repartition(8, "region")
)
resultat.write.mode("overwrite").parquet("/data/agrege")Écrire du code PySpark qui fonctionne est simple ; écrire du code PySpark qui passe à l'échelle sans exploser en production l'est beaucoup moins. Cette formation construit une compréhension du moteur Spark — partitions, exécution distribuée, plans d'exécution (DAG) et shuffle — avant d'aborder la manipulation de DataFrames : sélections, jointures, agrégations, fonctions fenêtrées et UDF. Les stagiaires apprennent à diagnostiquer les problèmes de performance courants (asymétrie de données, shuffle excessif, partitionnement inadapté) et à écrire les résultats vers des formats comme Parquet ou Delta Lake. Des travaux pratiques sur des jeux de données volumineux permettent de manipuler un cluster Spark réel. Cette formation intermédiaire s'adresse aux ingénieurs données, développeurs, analystes techniques et ingénieurs décisionnels développant des traitements PySpark.
Les objectifs
Développer des traitements de données massives avec Spark et PySpark.
Public visé
Ingénieurs données, développeurs, analystes techniques, ingénieurs décisionnels.
Prérequis
Pratique de Python et connaissance du langage SQL.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.