Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Quantification en int8 et int4, distillation vers un modèle compact, élagage et compilation, mesure de l'effet sur la qualité, arbitrage entre coût, latence et empreinte environnementale.
import torch
from torch.quantization import quantize_dynamic
model_int8 = quantize_dynamic(
model,
{torch.nn.Linear},
dtype=torch.qint8
)
torch.save(model_int8.state_dict(), 'model_int8.pt')Cette formation traite les techniques qui réduisent fortement le coût et la latence d'inférence d'un modèle : quantification en int8 et int4 et mesure de son effet sur la qualité des prédictions, distillation vers un modèle élève plus compact, élagage des paramètres superflus et compilation pour l'accélérateur cible. Chaque technique est appliquée avec PyTorch sur un modèle réel puis mesurée sur des critères concrets de qualité, de coût et de latence, afin d'arbitrer objectivement plutôt que d'empiler les optimisations. L'empreinte environnementale du service d'inférence est également prise en compte dans les arbitrages proposés. Elle s'adresse aux ingénieurs IA, ingénieurs d'infrastructure, architectes et responsables de plateformes d'inférence.
Les objectifs
appliquer les techniques de quantification et mesurer leur effet sur la qualité
mettre en œuvre une distillation vers un modèle plus compact
optimiser le coût et la latence d'inférence d'un modèle
arbitrer entre qualité, coût et empreinte environnementale
Public visé
Ingénieurs IA, ingénieurs d'infrastructure, architectes, responsables de plateformes d'inférence.
Prérequis
Connaissance de l'apprentissage profond et pratique du déploiement de modèles.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.