Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Identification des tâches adaptées à un modèle compact, déploiement local dans une application, spécialisation sur une tâche métier et mesure des gains en coût, latence et confidentialité.
from llama_cpp import Llama
model = Llama(
model_path="phi-3-mini-q4.gguf",
n_ctx=4096,
n_gpu_layers=0
)
response = model("Resume ce ticket client :")
print(response["choices"][0]["text"])Cette formation traite les modèles compacts qui rendent possibles des usages locaux, rapides et confidentiels, souvent suffisants là où l'on déploie par réflexe un grand modèle : identification des tâches sur lesquelles un modèle compact atteint une qualité suffisante, déploiement d'un modèle exécuté localement dans une application avec des outils comme llama.cpp ou ONNX Runtime, spécialisation par fine-tuning léger sur une tâche métier précise, et mesure objective des gains en coût, en latence et en confidentialité par rapport à un appel à un service distant. Elle s'adresse aux architectes, développeurs, ingénieurs d'infrastructure, référents IA et responsables de la sobriété numérique.
Les objectifs
identifier les tâches sur lesquelles un modèle compact suffit
déployer un modèle exécuté localement dans une application
spécialiser un petit modèle sur une tâche métier
mesurer les gains en coût, en latence et en confidentialité
Public visé
Architectes, développeurs, ingénieurs d'infrastructure, référents IA, responsables de la sobriété numérique.
Prérequis
Connaissance des principes de l'IA générative et du développement d'applications.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.