[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-optimisation-des-modeles-quantification-et-distillation":3,"highlight-python-import torch\nfrom to":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a842b-b343-11f1-a993-d8ca06000363","Optimisation des modèles : quantification et distillation","optimisation-des-modeles-quantification-et-distillation",null,"Ingénieurs IA, ingénieurs d'infrastructure, architectes, responsables de plateformes d'inférence.","-   Connaissance de l'apprentissage profond et pratique du déploiement de modèles.","-   appliquer les techniques de quantification et mesurer leur effet sur la qualité\n-   mettre en œuvre une distillation vers un modèle plus compact\n-   optimiser le coût et la latence d'inférence d'un modèle\n-   arbitrer entre qualité, coût et empreinte environnementale","--day1--\n\n## Coût d'inférence et leviers\n\n-   Décomposition du coût d'inférence : mémoire, calcul, bande passante\n-   Goulots réels selon la phase : remplissage du contexte et génération\n-   Mesure de référence : latence, débit, empreinte mémoire, coût par jeton\n-   Panorama des leviers d'optimisation et gains attendus\n-   Compromis qualité, coût et latence à formaliser avant d'optimiser\n-   Travaux pratiques : mesure de référence complète d'un modèle sur du matériel donné\n\n--break--\n\n## Quantification\n\n-   Formats numériques et précision réduite\n-   Quantification après entraînement : méthodes et jeux de calibration\n-   Quantification tenant compte de l'entraînement\n-   Effets mesurés sur la qualité selon le niveau de quantification\n-   Support matériel et compatibilité des formats\n-   Travaux pratiques : quantification d'un modèle à plusieurs niveaux et mesure de la dégradation\n\n--day2--\n\n## Distillation et élagage\n\n-   Distillation de connaissances : principe, données, mise en œuvre\n-   Constitution du jeu de distillation à partir d'un modèle plus grand\n-   Élagage structuré et non structuré\n-   Combinaison distillation, élagage et quantification\n-   Coût de l'opération rapporté au gain obtenu\n-   Travaux pratiques : distillation d'un modèle vers une version compacte et évaluation\n\n--break--\n\n## Optimisation du service d'inférence\n\n-   Traitement par lots continu et parallélisme des requêtes\n-   Cache de clés-valeurs et réutilisation de préfixes\n-   Décodage spéculatif et autres accélérations\n-   Compilation et moteurs d'inférence optimisés\n-   Choix du matériel et coût par requête\n-   Travaux pratiques : configuration d'un serveur d'inférence optimisé et mesure du débit\n\n--day3--\n\n## Évaluer la dégradation\n\n-   Protocole de comparaison entre modèle d'origine et modèle optimisé\n-   Tâches sensibles à la quantification et détection des régressions\n-   Évaluation sur des cas métier plutôt que sur des bancs d'essai généraux\n-   Seuil de dégradation acceptable défini avec le métier\n-   Décision de mise en service\n-   Travaux pratiques : évaluation comparée complète et décision argumentée\n\n--break--\n\n## Sobriété et exploitation\n\n-   Empreinte énergétique de l'inférence et leviers de réduction\n-   Dimensionnement au juste besoin et arrêt des ressources inutilisées\n-   Mutualisation des modèles entre applications\n-   Suivi des coûts et des performances dans la durée\n-   Mise à jour d'un modèle optimisé lors d'un changement de version\n-   Travaux pratiques : construction du tableau de bord de suivi du service d'inférence","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","21.00","L2-EXP-07","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","2530.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Quantification en int8 et int4, distillation vers un modèle compact, élagage et compilation, mesure de l'effet sur la qualité, arbitrage entre coût, latence et empreinte environnementale.","Cette formation traite les techniques qui réduisent fortement le coût et la latence d'inférence d'un modèle : quantification en int8 et int4 et mesure de son effet sur la qualité des prédictions, distillation vers un modèle élève plus compact, élagage des paramètres superflus et compilation pour l'accélérateur cible. Chaque technique est appliquée avec PyTorch sur un modèle réel puis mesurée sur des critères concrets de qualité, de coût et de latence, afin d'arbitrer objectivement plutôt que d'empiler les optimisations. L'empreinte environnementale du service d'inférence est également prise en compte dans les arbitrages proposés. Elle s'adresse aux ingénieurs IA, ingénieurs d'infrastructure, architectes et responsables de plateformes d'inférence.","#0D9488","mdi:auto-fix","python","import torch\nfrom torch.quantization import quantize_dynamic\n\nmodel_int8 = quantize_dynamic(\n    model,\n    {torch.nn.Linear},\n    dtype=torch.qint8\n)\ntorch.save(model_int8.state_dict(), 'model_int8.pt')","Formation experte pour réduire le coût et la latence d'inférence des modèles par quantification, distillation, élagage et compilation, mesures à l'appui.","Optimisez le coût et la latence d'inférence de vos modèles par quantification, distillation et élagage sans dégradation inacceptable.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-python\">\u003Cspan class=\"hljs-keyword\">import\u003C/span> torch\n\u003Cspan class=\"hljs-keyword\">from\u003C/span> torch.quantization \u003Cspan class=\"hljs-keyword\">import\u003C/span> quantize_dynamic\n\nmodel_int8 = quantize_dynamic(\n    model,\n    {torch.nn.Linear},\n    dtype=torch.qint8\n)\ntorch.save(model_int8.state_dict(), \u003Cspan class=\"hljs-string\">&#x27;model_int8.pt&#x27;\u003C/span>)\u003C/code>\u003C/pre>",1789740844895]