Formation Évaluer les systèmes d'IA : méthodes et jeux d'évaluation

Fiabilisez vos systèmes d'IA en construisant des protocoles d'évaluation automatisés qui détectent les régressions avant vos utilisateurs.

Définition de critères de réussite pour des sorties non déterministes, constitution d'un jeu d'évaluation représentatif, choix des métriques adaptées, automatisation et suivi en production.

2 jours (14 h)
HYBRID
Inter : 1 760,00 € HT/pers
Intra : nous consulter

Description

Sans évaluation, une amélioration n'est qu'une impression : cette formation construit des protocoles d'évaluation exploitables pour des systèmes d'IA à sortie non déterministe. Elle traite la définition de critères de réussite mesurables, la constitution d'un jeu d'évaluation représentatif et sa maintenance dans le temps, le choix et la mise en œuvre de métriques adaptées au système évalué (exactitude, pertinence, sûreté, coût), et l'automatisation de l'évaluation pour détecter les régressions dès leur apparition. L'intégration de l'évaluation dans le cycle de vie du système, du développement à la supervision en production, est traitée de bout en bout. Elle s'adresse aux data scientists, ingénieurs IA, testeurs, architectes, responsables qualité et chefs de projet IA.

Les objectifs

  • définir des critères de réussite pour une tâche à sortie non déterministe

  • constituer un jeu d'évaluation représentatif et le maintenir

  • choisir et mettre en œuvre les métriques adaptées au système évalué

  • automatiser l'évaluation et détecter les régressions

  • intégrer l'évaluation dans le cycle de vie du système

Public visé

  • Data scientists, ingénieurs IA, testeurs, architectes, responsables qualité, chefs de projet IA.

Prérequis

  • Connaissance des systèmes d'IA générative et du développement d'applications.

Le programme

Jour 1
Matinée

1. Construire un protocole d'évaluation

  • Définir la réussite pour une tâche à sortie non déterministe
  • Jeux d'évaluation : constitution, représentativité, taille, maintenance
  • Cas nominaux, cas limites, cas adverses
  • Métriques automatiques : ce qu'elles mesurent réellement et leurs angles morts
  • Évaluation humaine : protocole, accord entre évaluateurs, coût
  • Travaux pratiques : construction d'un jeu d'évaluation complet pour un système fourni
Après-midi

2. Métriques et cas particuliers

  • Métriques de similarité textuelle et leurs limites sur des sorties libres
  • Évaluation des systèmes de recherche augmentée : pertinence, fidélité aux sources, complétude
  • Évaluation des agents : réussite de la tâche, coût, nombre d'étapes, actions erronées
  • Évaluation de la sécurité : contenus indésirables, injections, fuites
  • Évaluation des biais et de l'équité par sous-population
  • Travaux pratiques : choix et mise en œuvre des métriques adaptées à deux systèmes différents
Jour 2
Matinée

3. Automatiser l'évaluation

  • Évaluation par modèle évaluateur : mise en œuvre, calibration, biais connus
  • Construction d'une grille d'évaluation exploitable par un modèle évaluateur
  • Corrélation entre évaluation automatique et jugement humain
  • Outillage d'évaluation disponible et critères de choix
  • Coût et fréquence des campagnes d'évaluation
  • Travaux pratiques : mise en place d'une évaluation automatisée sur le jeu de référence construit
Après-midi

4. Intégrer dans le cycle de vie

  • Détection des régressions lors d'un changement de modèle, de consigne ou de source
  • Intégration de l'évaluation dans la chaîne de livraison et seuils bloquants
  • Suivi en production : retours utilisateurs, échantillonnage, revue humaine
  • Détection de dérive et déclenchement d'une réévaluation
  • Gouvernance : qui décide qu'un système est suffisamment bon pour être déployé
  • Travaux pratiques : détection d'une régression provoquée et construction du dispositif de suivi
Dernière mise à jour : 18 septembre 2026

En présentiel ou à distance : à vous de choisir

Dans vos locaux

Pour ancrer les apprentissages et encourager la dynamique collective.

En classe virtuelle

Pour allier flexibilité et interactions en temps réel avec le formateur.

Dans nos locaux

Pour favoriser la concentration, les échanges et le confort des apprenants.

Les modalités de formation

Suivi et évaluation :

  • Recueil des besoins en amont pour identifier les attentes du stagiaire
  • Évaluation continue : études de cas et travaux pratiques pendant la formation
  • Évaluation finale : questionnaire d'auto-évaluation

Format et encadrement :

  • Formation équilibrée alliant théorie et pratique (minimum 50%)
  • Sessions en petits groupes (2 à 9 participants) pour un suivi personnalisé
  • Émargement par demi-journée et remise d'une attestation de formation

Moyens pédagogiques et techniques :

  • Méthodes interactives et suivi des acquis : travaux pratiques, projet fil rouge, mises en situation, démonstrations, QCM…
  • Les stagiaires doivent être équipés de leur matériel informatique pour suivre la formation, que ce soit dans nos locaux ou sur site externe.
  • Les prérequis techniques seront communiqués aux apprenants en amont de la formation, lors de l'analyse des besoins, en fonction des spécificités de chaque client.
  • Accessibilité: nous informons l'ensemble de nos clients et stagiaires que nous sommes dans la capacité d'adapter les sessions en cas de situations spécifiques. Nous nous engageons à répondre à toutes les demandes dans un délai de 48h ouvré.

Conditions et délais d'accès :

  • Si l'une de nos formations vous intéresse, contactez-nous au +33 04 93 65 34 24 ou à l'adresse mail contact@le-code.dev. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d'adapter la formation et ses modules, puis nous vous adresserons un devis. Les dates de la formation seront à convenir sous 30 jours maximum.
  • Concernant les formations Actions Collectives, l'inscription est possible jusqu'à 24h ouvrées avant le début de la formation.