Formation Optimisation des modèles : quantification et distillation

Optimisez le coût et la latence d'inférence de vos modèles par quantification, distillation et élagage sans dégradation inacceptable.

Quantification en int8 et int4, distillation vers un modèle compact, élagage et compilation, mesure de l'effet sur la qualité, arbitrage entre coût, latence et empreinte environnementale.

3 jours (21 h)
HYBRID
Inter : 2 530,00 € HT/pers
Intra : nous consulter

Description

Cette formation traite les techniques qui réduisent fortement le coût et la latence d'inférence d'un modèle : quantification en int8 et int4 et mesure de son effet sur la qualité des prédictions, distillation vers un modèle élève plus compact, élagage des paramètres superflus et compilation pour l'accélérateur cible. Chaque technique est appliquée avec PyTorch sur un modèle réel puis mesurée sur des critères concrets de qualité, de coût et de latence, afin d'arbitrer objectivement plutôt que d'empiler les optimisations. L'empreinte environnementale du service d'inférence est également prise en compte dans les arbitrages proposés. Elle s'adresse aux ingénieurs IA, ingénieurs d'infrastructure, architectes et responsables de plateformes d'inférence.

Les objectifs

  • appliquer les techniques de quantification et mesurer leur effet sur la qualité

  • mettre en œuvre une distillation vers un modèle plus compact

  • optimiser le coût et la latence d'inférence d'un modèle

  • arbitrer entre qualité, coût et empreinte environnementale

Public visé

  • Ingénieurs IA, ingénieurs d'infrastructure, architectes, responsables de plateformes d'inférence.

Prérequis

  • Connaissance de l'apprentissage profond et pratique du déploiement de modèles.

Le programme

Jour 1
Matinée

1. Coût d'inférence et leviers

  • Décomposition du coût d'inférence : mémoire, calcul, bande passante
  • Goulots réels selon la phase : remplissage du contexte et génération
  • Mesure de référence : latence, débit, empreinte mémoire, coût par jeton
  • Panorama des leviers d'optimisation et gains attendus
  • Compromis qualité, coût et latence à formaliser avant d'optimiser
  • Travaux pratiques : mesure de référence complète d'un modèle sur du matériel donné
Après-midi

2. Quantification

  • Formats numériques et précision réduite
  • Quantification après entraînement : méthodes et jeux de calibration
  • Quantification tenant compte de l'entraînement
  • Effets mesurés sur la qualité selon le niveau de quantification
  • Support matériel et compatibilité des formats
  • Travaux pratiques : quantification d'un modèle à plusieurs niveaux et mesure de la dégradation
Jour 2
Matinée

3. Distillation et élagage

  • Distillation de connaissances : principe, données, mise en œuvre
  • Constitution du jeu de distillation à partir d'un modèle plus grand
  • Élagage structuré et non structuré
  • Combinaison distillation, élagage et quantification
  • Coût de l'opération rapporté au gain obtenu
  • Travaux pratiques : distillation d'un modèle vers une version compacte et évaluation
Après-midi

4. Optimisation du service d'inférence

  • Traitement par lots continu et parallélisme des requêtes
  • Cache de clés-valeurs et réutilisation de préfixes
  • Décodage spéculatif et autres accélérations
  • Compilation et moteurs d'inférence optimisés
  • Choix du matériel et coût par requête
  • Travaux pratiques : configuration d'un serveur d'inférence optimisé et mesure du débit
Jour 3
Matinée

5. Évaluer la dégradation

  • Protocole de comparaison entre modèle d'origine et modèle optimisé
  • Tâches sensibles à la quantification et détection des régressions
  • Évaluation sur des cas métier plutôt que sur des bancs d'essai généraux
  • Seuil de dégradation acceptable défini avec le métier
  • Décision de mise en service
  • Travaux pratiques : évaluation comparée complète et décision argumentée
Après-midi

6. Sobriété et exploitation

  • Empreinte énergétique de l'inférence et leviers de réduction
  • Dimensionnement au juste besoin et arrêt des ressources inutilisées
  • Mutualisation des modèles entre applications
  • Suivi des coûts et des performances dans la durée
  • Mise à jour d'un modèle optimisé lors d'un changement de version
  • Travaux pratiques : construction du tableau de bord de suivi du service d'inférence
Dernière mise à jour : 18 septembre 2026

En présentiel ou à distance : à vous de choisir

Dans vos locaux

Pour ancrer les apprentissages et encourager la dynamique collective.

En classe virtuelle

Pour allier flexibilité et interactions en temps réel avec le formateur.

Dans nos locaux

Pour favoriser la concentration, les échanges et le confort des apprenants.

Les modalités de formation

Suivi et évaluation :

  • Recueil des besoins en amont pour identifier les attentes du stagiaire
  • Évaluation continue : études de cas et travaux pratiques pendant la formation
  • Évaluation finale : questionnaire d'auto-évaluation

Format et encadrement :

  • Formation équilibrée alliant théorie et pratique (minimum 50%)
  • Sessions en petits groupes (2 à 9 participants) pour un suivi personnalisé
  • Émargement par demi-journée et remise d'une attestation de formation

Moyens pédagogiques et techniques :

  • Méthodes interactives et suivi des acquis : travaux pratiques, projet fil rouge, mises en situation, démonstrations, QCM…
  • Les stagiaires doivent être équipés de leur matériel informatique pour suivre la formation, que ce soit dans nos locaux ou sur site externe.
  • Les prérequis techniques seront communiqués aux apprenants en amont de la formation, lors de l'analyse des besoins, en fonction des spécificités de chaque client.
  • Accessibilité: nous informons l'ensemble de nos clients et stagiaires que nous sommes dans la capacité d'adapter les sessions en cas de situations spécifiques. Nous nous engageons à répondre à toutes les demandes dans un délai de 48h ouvré.

Conditions et délais d'accès :

  • Si l'une de nos formations vous intéresse, contactez-nous au +33 04 93 65 34 24 ou à l'adresse mail contact@le-code.dev. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d'adapter la formation et ses modules, puis nous vous adresserons un devis. Les dates de la formation seront à convenir sous 30 jours maximum.
  • Concernant les formations Actions Collectives, l'inscription est possible jusqu'à 24h ouvrées avant le début de la formation.