Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Mécanisme d'attention, architecture transformer complète, alternatives émergentes (state-space models, mixture of experts), compromis de calcul et de mémoire, lecture critique d'une publication.
graph LR
A[Entree] --> B[Embedding + Position]
B --> C[Self-Attention multi-tetes]
C --> D[Normalisation]
D --> E[Feed-Forward]
E --> F[Sortie]
C -.residuel.-> DCette formation détaille le fonctionnement interne des architectures qui fondent les modèles actuels : mécanisme d'attention et self-attention multi-têtes, encodage positionnel, architecture transformer complète, puis alternatives émergentes comme les modèles à espace d'états (state-space models) et les architectures à mélange d'experts (mixture of experts). Chaque architecture est analysée sous l'angle de ses compromis réels de calcul, de mémoire et de latence, avec une comparaison chiffrée plutôt qu'une lecture superficielle des annonces. Les participants s'exercent à lire une publication technique et à en extraire les éléments décisifs. Elle s'adresse aux ingénieurs IA, data scientists confirmés et architectes techniques qui doivent choisir ou justifier une architecture de modèle.
Les objectifs
expliquer en détail le fonctionnement d'une architecture à base d'attention
comparer les architectures actuelles et leurs compromis
analyser l'impact des choix d'architecture sur le coût et les performances
lire et exploiter une publication technique décrivant un nouveau modèle
Public visé
Ingénieurs IA, data scientists confirmés, architectes techniques, ingénieurs de recherche.
Prérequis
Connaissance de l'apprentissage profond et pratique d'un cadre d'entraînement.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.