[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-data-engineering-pour-l-ia-pipelines-et-gestion-des-donnees":3,"highlight-bash-#!/usr/bin/env bash\n":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a8fcb-b343-11f1-a993-d8ca06000363","Data engineering pour l'IA : pipelines et gestion des données","data-engineering-pour-l-ia-pipelines-et-gestion-des-donnees",null,"Ingénieurs données, développeurs, architectes de données, ingénieurs IA.","-   Pratique du langage SQL et d'un langage de programmation. Connaissance des principes du traitement de données.","-   concevoir les pipelines de données alimentant un système d'IA\n-   mettre en place les contrôles de qualité et la traçabilité des données\n-   gérer les données sensibles et leur anonymisation\n-   industrialiser et superviser les traitements de données","--day1--\n\n## Données pour l'IA\n\n-   Besoins de données selon le type de système : apprentissage, recherche augmentée, agents\n-   Données structurées, semi-structurées et non structurées\n-   Sources internes : applications, documents, journaux, échanges\n-   Volumétrie, fraîcheur et cycle de vie des données\n-   Cartographie des sources et des droits associés\n-   Travaux pratiques : cartographie des données mobilisables pour un cas d'usage d'IA\n\n--break--\n\n## Pipelines d'ingestion\n\n-   Ingestion par lots et ingestion continue\n-   Extraction de contenu documentaire et normalisation\n-   Détection des changements et ingestion incrémentale\n-   Orchestration des traitements et gestion des dépendances\n-   Reprise sur erreur et idempotence\n-   Travaux pratiques : construction d'un pipeline d'ingestion documentaire incrémentale\n\n--day2--\n\n## Qualité et préparation\n\n-   Contrôles de qualité : complétude, cohérence, doublons, valeurs aberrantes\n-   Nettoyage et normalisation des contenus\n-   Enrichissement par métadonnées et classification automatique\n-   Gestion des documents obsolètes et contradictoires\n-   Rejets, quarantaine et traitement des anomalies\n-   Travaux pratiques : mise en place des contrôles de qualité sur le pipeline construit\n\n--break--\n\n## Données sensibles et conformité\n\n-   Détection des données personnelles dans les corpus\n-   Anonymisation et pseudonymisation des contenus\n-   Droits d'accès propagés jusqu'aux systèmes d'IA\n-   Durées de conservation et suppression effective\n-   Traçabilité et registre des traitements\n-   Travaux pratiques : mise en place de la détection et du traitement des données personnelles\n\n--day3--\n\n## Stockage et indexation\n\n-   Stockage des documents sources et des versions transformées\n-   Index vectoriels et synchronisation avec les sources\n-   Bases de données pour l'état et les métadonnées\n-   Coût de stockage et politiques de cycle de vie\n-   Sauvegarde et reconstruction des index\n-   Travaux pratiques : mise en place du stockage et de la synchronisation des index\n\n--break--\n\n## Industrialisation et supervision\n\n-   Ordonnancement et exécution planifiée des pipelines\n-   Supervision : volumétrie traitée, échecs, fraîcheur des données\n-   Alertes sur anomalies de chargement\n-   Traçabilité de bout en bout : d'une réponse d'IA jusqu'au document source\n-   Documentation et transfert à l'exploitation\n-   Travaux pratiques : industrialisation complète du pipeline et mise en place de la supervision","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","21.00","L2-ITE-15","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","2400.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Trois jours pour concevoir les pipelines de données alimentant un système d'IA, mettre en place les contrôles de qualité et la traçabilité, gérer les données sensibles et leur anonymisation, puis industrialiser et superviser les traitements.","La qualité d'un système d'IA est d'abord un problème de données, bien avant d'être un problème de modèle. Cette formation de trois jours conçoit les pipelines qui alimentent un système d'IA : ingestion de données structurées et non structurées, contrôles de qualité automatisés et traçabilité de bout en bout, condition d'une IA auditable. Les participants traitent la détection et l'anonymisation des données sensibles avant leur usage par un modèle, un point de conformité fréquemment négligé. La formation industrialise ensuite ces traitements : orchestration planifiée, journalisation, alerte en cas d'anomalie ou de dérive du volume de données. Elle s'adresse aux ingénieurs données, développeurs, architectes de données et ingénieurs IA pratiquant déjà le langage SQL, un langage de programmation et les principes du traitement de données.","#5F3DC4","mdi:database-cog","bash","#!/usr/bin/env bash\nset -euo pipefail\npython ingestion.py --source s3://corpus-brut --out staging/\npython controle_qualite.py staging/ --seuil-doublons 0.02 || exit 1\npython anonymisation.py staging/ --champs email,telephone,siret\npython charger_index.py staging/ --index corpus_ia_prod","Pipelines de données pour l'IA : ingestion, contrôles de qualité, traçabilité, anonymisation des données sensibles et supervision continue.","Structurez les pipelines de données qui alimentent vos systèmes d'IA : qualité, traçabilité, anonymisation et supervision industrialisée.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-bash\">\u003Cspan class=\"hljs-meta\">#!/usr/bin/env bash\u003C/span>\n\u003Cspan class=\"hljs-comment\"># Identifie les tables sans acces depuis plus de 12 mois\u003C/span>\npsql -t -c \u003Cspan class=\"hljs-string\">&quot;\n  SELECT relname, last_seq_scan, last_idx_scan\n  FROM pg_stat_user_tables\n  WHERE COALESCE(last_seq_scan, last_idx_scan) &lt; now() - interval &#x27;12 months&#x27;;\n&quot;\u003C/span> &gt; tables_candidates_purge.txt\n\n\u003Cspan class=\"hljs-built_in\">wc\u003C/span> -l tables_candidates_purge.txt\u003C/code>\u003C/pre>",1789740846652]