[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-evaluer-les-systemes-d-ia-methodes-et-jeux-d-evaluation":3,"highlight-python-import evaluate\n\nmet":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a7f90-b343-11f1-a993-d8ca06000363","Évaluer les systèmes d'IA : méthodes et jeux d'évaluation","evaluer-les-systemes-d-ia-methodes-et-jeux-d-evaluation",null,"Data scientists, ingénieurs IA, testeurs, architectes, responsables qualité, chefs de projet IA.","-   Connaissance des systèmes d'IA générative et du développement d'applications.","-   définir des critères de réussite pour une tâche à sortie non déterministe\n-   constituer un jeu d'évaluation représentatif et le maintenir\n-   choisir et mettre en œuvre les métriques adaptées au système évalué\n-   automatiser l'évaluation et détecter les régressions\n-   intégrer l'évaluation dans le cycle de vie du système","--day1--\n\n## Construire un protocole d'évaluation\n\n-   Définir la réussite pour une tâche à sortie non déterministe\n-   Jeux d'évaluation : constitution, représentativité, taille, maintenance\n-   Cas nominaux, cas limites, cas adverses\n-   Métriques automatiques : ce qu'elles mesurent réellement et leurs angles morts\n-   Évaluation humaine : protocole, accord entre évaluateurs, coût\n-   Travaux pratiques : construction d'un jeu d'évaluation complet pour un système fourni\n\n--break--\n\n## Métriques et cas particuliers\n\n-   Métriques de similarité textuelle et leurs limites sur des sorties libres\n-   Évaluation des systèmes de recherche augmentée : pertinence, fidélité aux sources, complétude\n-   Évaluation des agents : réussite de la tâche, coût, nombre d'étapes, actions erronées\n-   Évaluation de la sécurité : contenus indésirables, injections, fuites\n-   Évaluation des biais et de l'équité par sous-population\n-   Travaux pratiques : choix et mise en œuvre des métriques adaptées à deux systèmes différents\n\n--day2--\n\n## Automatiser l'évaluation\n\n-   Évaluation par modèle évaluateur : mise en œuvre, calibration, biais connus\n-   Construction d'une grille d'évaluation exploitable par un modèle évaluateur\n-   Corrélation entre évaluation automatique et jugement humain\n-   Outillage d'évaluation disponible et critères de choix\n-   Coût et fréquence des campagnes d'évaluation\n-   Travaux pratiques : mise en place d'une évaluation automatisée sur le jeu de référence construit\n\n--break--\n\n## Intégrer dans le cycle de vie\n\n-   Détection des régressions lors d'un changement de modèle, de consigne ou de source\n-   Intégration de l'évaluation dans la chaîne de livraison et seuils bloquants\n-   Suivi en production : retours utilisateurs, échantillonnage, revue humaine\n-   Détection de dérive et déclenchement d'une réévaluation\n-   Gouvernance : qui décide qu'un système est suffisamment bon pour être déployé\n-   Travaux pratiques : détection d'une régression provoquée et construction du dispositif de suivi","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","14.00","L2-ART-07","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","1760.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Définition de critères de réussite pour des sorties non déterministes, constitution d'un jeu d'évaluation représentatif, choix des métriques adaptées, automatisation et suivi en production.","Sans évaluation, une amélioration n'est qu'une impression : cette formation construit des protocoles d'évaluation exploitables pour des systèmes d'IA à sortie non déterministe. Elle traite la définition de critères de réussite mesurables, la constitution d'un jeu d'évaluation représentatif et sa maintenance dans le temps, le choix et la mise en œuvre de métriques adaptées au système évalué (exactitude, pertinence, sûreté, coût), et l'automatisation de l'évaluation pour détecter les régressions dès leur apparition. L'intégration de l'évaluation dans le cycle de vie du système, du développement à la supervision en production, est traitée de bout en bout. Elle s'adresse aux data scientists, ingénieurs IA, testeurs, architectes, responsables qualité et chefs de projet IA.","#5B21B6","mdi:test-tube","python","import evaluate\n\nmetric = evaluate.load(\"rouge\")\nresults = metric.compute(\n    predictions=generated_answers,\n    references=reference_answers\n)\nassert results[\"rougeL\"] > seuil_regression","Formation experte pour construire des protocoles d'évaluation d'IA fiables : jeux de référence, métriques adaptées et détection automatisée des régressions.","Fiabilisez vos systèmes d'IA en construisant des protocoles d'évaluation automatisés qui détectent les régressions avant vos utilisateurs.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-python\">\u003Cspan class=\"hljs-keyword\">import\u003C/span> evaluate\n\nmetric = evaluate.load(\u003Cspan class=\"hljs-string\">&quot;rouge&quot;\u003C/span>)\nresults = metric.compute(\n    predictions=generated_answers,\n    references=reference_answers\n)\n\u003Cspan class=\"hljs-keyword\">assert\u003C/span> results[\u003Cspan class=\"hljs-string\">&quot;rougeL&quot;\u003C/span>] &gt; seuil_regression\u003C/code>\u003C/pre>",1789740844159]