[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-llm-avances-entrainement-alignement-et-evaluation":3,"highlight-python-from trl import DPOT":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a8328-b343-11f1-a993-d8ca06000363","LLM avancés : entraînement, alignement et évaluation","llm-avances-entrainement-alignement-et-evaluation",null,"Ingénieurs IA, data scientists confirmés, ingénieurs de recherche, architectes de plateformes d'IA.","-   Maîtrise de l'apprentissage profond et pratique d'un cadre d'entraînement.","-   décrire les étapes de construction d'un modèle de langage\n-   mettre en œuvre les méthodes d'adaptation et d'alignement d'un modèle\n-   constituer des jeux de données d'entraînement et d'évaluation de qualité\n-   évaluer un modèle sur des critères de performance, de sûreté et de coût","--day1--\n\n## Chaîne de construction d'un modèle\n\n-   Étapes : pré-entraînement, adaptation supervisée, alignement, évaluation\n-   Données de pré-entraînement : volume, qualité, filtrage, questions juridiques\n-   Tokenisation et vocabulaire : effets sur les langues et les coûts\n-   Ordres de grandeur des ressources nécessaires à chaque étape\n-   Ce qui relève de la recherche et ce qui est accessible à une entreprise\n-   Travaux pratiques : analyse des choix de construction d'un modèle ouvert documenté\n\n--break--\n\n## Adaptation supervisée\n\n-   Constitution d'un jeu de données d'instructions de qualité\n-   Génération assistée de données d'entraînement et risques associés\n-   Affinage complet et méthodes économes en paramètres\n-   Hyperparamètres critiques et diagnostic d'un affinage raté\n-   Oubli catastrophique et préservation des capacités générales\n-   Travaux pratiques : affinage supervisé d'un modèle ouvert sur une tâche métier\n\n--day2--\n\n## Alignement sur des préférences\n\n-   Principe de l'alignement et objectifs poursuivis\n-   Apprentissage par renforcement à partir de retours humains : architecture et coût\n-   Méthodes directes d'optimisation de préférences\n-   Constitution de jeux de préférences et annotation\n-   Effets de l'alignement sur la qualité et sur la prudence excessive du modèle\n-   Travaux pratiques : mise en œuvre d'une optimisation directe de préférences et mesure de ses effets\n\n--break--\n\n## Capacités de raisonnement\n\n-   Décomposition du raisonnement et modèles entraînés à raisonner\n-   Calcul au moment de l'inférence et compromis coût-qualité\n-   Vérification et auto-correction des réponses\n-   Appel d'outils comme extension des capacités du modèle\n-   Limites persistantes sur le raisonnement long et le calcul exact\n-   Travaux pratiques : comparaison des performances d'un modèle avec et sans raisonnement explicite\n\n--day3--\n\n## Évaluation des modèles\n\n-   Bancs d'essai publics : périmètre, contamination des jeux de test, limites\n-   Construction d'un protocole d'évaluation interne représentatif\n-   Évaluation par modèle évaluateur et corrélation avec le jugement humain\n-   Évaluation des capacités spécifiques : code, raisonnement, langue métier\n-   Suivi des performances lors d'un changement de version\n-   Travaux pratiques : construction d'un protocole d'évaluation interne et application à deux modèles\n\n--break--\n\n## Sûreté et comportement\n\n-   Comportements indésirables : contenus dangereux, biais, fuites de données d'entraînement\n-   Tests adverses et mise à l'épreuve d'un modèle\n-   Garde-fous intégrés au modèle et garde-fous externes\n-   Documentation des limites et des usages déconseillés\n-   Obligations applicables aux fournisseurs de modèles\n-   Travaux pratiques : campagne de tests adverses sur un modèle affiné\n\n--day4--\n\n## Infrastructure d'entraînement\n\n-   Dimensionnement des ressources et parallélisme\n-   Gestion de la mémoire et techniques d'économie\n-   Points de reprise, suivi et reproductibilité des entraînements\n-   Coût complet d'un affinage et arbitrage avec les alternatives\n-   Empreinte environnementale et sobriété des entraînements\n-   Travaux pratiques : dimensionnement et chiffrage d'un projet d'affinage\n\n--break--\n\n## Déploiement et cycle de vie\n\n-   Service d'un modèle adapté : hébergement, adaptateurs, mutualisation\n-   Versionnement des modèles et traçabilité des données d'entraînement\n-   Réentraînement périodique et gestion de l'obsolescence\n-   Documentation du modèle destinée aux utilisateurs et aux auditeurs\n-   Décision de maintenir, de réentraîner ou d'abandonner un modèle adapté\n-   Travaux pratiques : mise en service du modèle affiné et rédaction de sa documentation","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","28.00","L2-EXP-05","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","3160.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Pré-entraînement, adaptation supervisée par fine-tuning, alignement sur des préférences (RLHF, DPO), constitution de jeux de données et évaluation de la performance, de la sûreté et du coût.","Cette formation couvre l'ensemble de la chaîne de construction d'un modèle de langage : pré-entraînement sur de larges corpus, adaptation supervisée par fine-tuning, alignement sur des préférences humaines par RLHF ou DPO, et constitution de jeux de données d'entraînement et d'évaluation de qualité. Une attention particulière est portée à l'évaluation multicritère des modèles obtenus — performance, sûreté, biais, coût d'inférence — pour arbitrer objectivement entre ce qui relève d'un service existant et ce qui justifie un entraînement interne. Les travaux pratiques utilisent Python et la bibliothèque transformers. Elle s'adresse aux ingénieurs IA, data scientists confirmés, ingénieurs de recherche et architectes de plateformes d'IA générative.","#4C1D95","mdi:robot-outline","python","from trl import DPOTrainer, DPOConfig\n\nconfig = DPOConfig(beta=0.1, learning_rate=5e-6)\ntrainer = DPOTrainer(\n    model=model,\n    args=config,\n    train_dataset=preference_dataset,\n)\ntrainer.train()","Formation experte sur la construction et l'alignement des modèles de langage : pré-entraînement, fine-tuning, RLHF/DPO et évaluation coût-sûreté-performance.","Pilotez la construction de modèles de langage, de leur pré-entraînement à leur alignement, pour savoir ce qui est réalisable en interne.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-python\">\u003Cspan class=\"hljs-keyword\">from\u003C/span> trl \u003Cspan class=\"hljs-keyword\">import\u003C/span> DPOTrainer, DPOConfig\n\nconfig = DPOConfig(beta=\u003Cspan class=\"hljs-number\">0.1\u003C/span>, learning_rate=\u003Cspan class=\"hljs-number\">5e-6\u003C/span>)\ntrainer = DPOTrainer(\n    model=model,\n    args=config,\n    train_dataset=preference_dataset,\n)\ntrainer.train()\u003C/code>\u003C/pre>",1789740844667]