Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Dimensionnement de l'infrastructure d'inférence, choix des accélérateurs, service de modèles, répartition du trafic, montée en charge, haute disponibilité et supervision des coûts.
resource "kubernetes_deployment" "inference" {
metadata { name = "llm-inference" }
spec {
replicas = 4
template {
spec {
container {
name = "model-server"
image = "vllm/vllm-openai:latest"
resources { limits = { "nvidia.com/gpu" = 1 } }
}
}
}
}
}Cette formation traite l'infrastructure qui supporte l'IA en production : dimensionnement de la capacité d'inférence, choix et partage des accélérateurs matériels, mise en œuvre d'un service de modèles performant avec des outils comme Triton ou vLLM, répartition du trafic entre instances et montée en charge automatique. Elle couvre également la haute disponibilité du service, la gestion des déploiements sur Kubernetes et l'infrastructure as code avec Terraform, ainsi que la supervision des performances et des coûts en production, sur site comme dans le cloud. Elle s'adresse aux ingénieurs d'infrastructure, ingénieurs IA, architectes, ingénieurs DevOps et responsables de plateformes qui opèrent des services d'inférence à grande échelle.
Les objectifs
dimensionner l'infrastructure d'inférence d'un modèle
mettre en œuvre un service de modèles performant et disponible
gérer la montée en charge et la répartition du trafic
superviser les performances et les coûts d'un service d'inférence
Public visé
Ingénieurs d'infrastructure, ingénieurs IA, architectes, ingénieurs DevOps, responsables de plateformes.
Prérequis
Connaissance de l'administration système, de la conteneurisation et des principes de l'inférence.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.