Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Organisez une plateforme Databricks en couches Bronze, Silver et Gold, mettez en œuvre Delta Lake, orchestrez vos pipelines, contrôlez la qualité des données et maîtrisez les coûts d'une plateforme facturée à la consommation.
CREATE OR REFRESH STREAMING TABLE silver_ventes
AS SELECT
id,
client,
montant,
date_vente
FROM STREAM(bronze_ventes)
WHERE montant > 0;
OPTIMIZE silver_ventes
ZORDER BY (client);Databricks facilite l'industrialisation des pipelines de données, mais une plateforme mal architecturée en devient le poste de coût le plus difficile à maîtriser. Cette formation aborde l'organisation d'une plateforme Databricks en couches Bronze, Silver et Gold, la création de tables transactionnelles avec Delta Lake (historisation, time travel, optimisation des fichiers), l'orchestration des traitements avec Databricks Workflows et l'intégration avec des outils externes. La qualité et la gouvernance des données sont traitées via Unity Catalog, et une part de la formation est consacrée à la maîtrise des coûts : dimensionnement des clusters, autoscaling, choix entre clusters interactifs et jobs. Elle s'adresse aux ingénieurs données, architectes de données, développeurs décisionnels et responsables de plateformes exploitant des pipelines sur Databricks.
Les objectifs
Construire des pipelines de données fiables sur la plateforme Databricks.
Public visé
Ingénieurs données, architectes de données, développeurs décisionnels, responsables de plateformes analytiques.
Prérequis
Pratique de Python ou du langage SQL et connaissance des principes du traitement distribué.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.