Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Organisez votre lac de données en zones exploitables et choisissez les bons formats de fichiers et tables transactionnelles : Parquet, ORC, Delta Lake, Apache Iceberg, Apache Hudi, gouvernance des données et critères de sélection entre formats ouverts.
CREATE TABLE ventes (
id BIGINT,
client STRING,
montant DECIMAL(10,2),
date_vente DATE
)
USING DELTA
PARTITIONED BY (date_vente);
MERGE INTO ventes AS cible
USING maj AS source
ON cible.id = source.id
WHEN MATCHED THEN UPDATE SET *
WHEN NOT MATCHED THEN INSERT *;Un lac de données mal structuré devient rapidement un dépôt inexploitable où personne ne retrouve une donnée fiable. Cette formation aborde l'organisation d'un data lake en zones — brute, préparée, exploitable — et le choix des formats de fichiers colonnes comme Parquet et ORC pour l'analytique. Elle traite les tables transactionnelles en formats ouverts Delta Lake, Apache Iceberg et Apache Hudi : gestion des mises à jour et suppressions, du schéma et de ses évolutions, et critères concrets pour choisir entre ces formats selon l'écosystème de traitement (Spark, Trino, Flink). La gouvernance des données — catalogues, métadonnées, contrôle d'accès — est également couverte. Cette formation experte s'adresse aux architectes de données, ingénieurs données, responsables de plateformes analytiques et administrateurs de données concevant un lakehouse en production.
Les objectifs
Structurer un data lake ou un lakehouse et choisir les formats adaptés (Parquet, ORC, Iceberg, Delta).
Public visé
Architectes de données, ingénieurs données, responsables de plateformes analytiques, administrateurs de données.
Prérequis
Connaissance des architectures de données et du traitement distribué.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.