[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-architectures-de-modeles-transformers-et-alternatives":3,"highlight-mermaid-graph LR\n    A[Entre":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a829d-b343-11f1-a993-d8ca06000363","Architectures de modèles : transformers et alternatives","architectures-de-modeles-transformers-et-alternatives",null,"Ingénieurs IA, data scientists confirmés, architectes techniques, ingénieurs de recherche.","-   Connaissance de l'apprentissage profond et pratique d'un cadre d'entraînement.","-   expliquer en détail le fonctionnement d'une architecture à base d'attention\n-   comparer les architectures actuelles et leurs compromis\n-   analyser l'impact des choix d'architecture sur le coût et les performances\n-   lire et exploiter une publication technique décrivant un nouveau modèle","--day1--\n\n## L'architecture à base d'attention\n\n-   Attention multi-tête : formulation, intuition, implémentation\n-   Blocs encodeur et décodeur, variantes selon les usages\n-   Normalisation, connexions résiduelles et stabilité\n-   Représentations positionnelles et leurs évolutions\n-   Complexité quadratique et conséquences sur le contexte long\n-   Travaux pratiques : implémentation d'un bloc transformeur complet à partir de zéro\n\n--break--\n\n## Optimisations d'attention et de mémoire\n\n-   Attention efficace en mémoire et gains mesurés\n-   Partage de clés et de valeurs entre têtes\n-   Cache de clés-valeurs et coût de l'inférence longue\n-   Attention parcimonieuse et fenêtres glissantes\n-   Extension du contexte : méthodes et limites réelles\n-   Travaux pratiques : mesure de l'empreinte mémoire d'une inférence et effet des optimisations\n\n--day2--\n\n## Variantes et architectures spécialisées\n\n-   Modèles à mélange d'experts : principe, routage, coût d'entraînement\n-   Architectures multimodales et fusion des modalités\n-   Modèles d'espace d'états et alternatives à l'attention\n-   Modèles de diffusion pour la génération d'images\n-   Architectures compactes conçues pour l'embarqué\n-   Travaux pratiques : comparaison expérimentale de deux architectures sur une même tâche\n\n--break--\n\n## Lois d'échelle et entraînement\n\n-   Relation entre taille du modèle, volume de données et performance\n-   Budget de calcul optimal et compromis observés\n-   Capacités émergentes : réalité et controverses\n-   Étapes d'entraînement d'un grand modèle et coûts associés\n-   Ce qui est reproductible en entreprise et ce qui ne l'est pas\n-   Travaux pratiques : analyse des choix d'architecture et d'entraînement d'un modèle récent documenté\n\n--day3--\n\n## Évaluer une architecture\n\n-   Critères techniques : qualité, latence, mémoire, coût par jeton\n-   Bancs d'essai publics : ce qu'ils mesurent et leurs biais\n-   Évaluation sur des tâches représentatives de son contexte\n-   Contraintes de licence et d'usage commercial\n-   Grille de sélection d'un modèle pour un usage donné\n-   Travaux pratiques : évaluation comparée de trois modèles sur un jeu de tâches métier\n\n--break--\n\n## Veille technique et perspectives\n\n-   Lecture d'un rapport technique de modèle et informations réellement fournies\n-   Signaux distinguant une avancée réelle d'un effet d'annonce\n-   Tendances en cours et leur maturité\n-   Conséquences des évolutions d'architecture sur les applications existantes\n-   Construction d'une capacité d'évaluation interne\n-   Travaux pratiques : rédaction d'une note d'évaluation technique d'un modèle récent","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","21.00","L2-EXP-04","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","2530.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Mécanisme d'attention, architecture transformer complète, alternatives émergentes (state-space models, mixture of experts), compromis de calcul et de mémoire, lecture critique d'une publication.","Cette formation détaille le fonctionnement interne des architectures qui fondent les modèles actuels : mécanisme d'attention et self-attention multi-têtes, encodage positionnel, architecture transformer complète, puis alternatives émergentes comme les modèles à espace d'états (state-space models) et les architectures à mélange d'experts (mixture of experts). Chaque architecture est analysée sous l'angle de ses compromis réels de calcul, de mémoire et de latence, avec une comparaison chiffrée plutôt qu'une lecture superficielle des annonces. Les participants s'exercent à lire une publication technique et à en extraire les éléments décisifs. Elle s'adresse aux ingénieurs IA, data scientists confirmés et architectes techniques qui doivent choisir ou justifier une architecture de modèle.","#8B5CF6","mdi:sitemap-outline","mermaid","graph LR\n    A[Entree] --> B[Embedding + Position]\n    B --> C[Self-Attention multi-tetes]\n    C --> D[Normalisation]\n    D --> E[Feed-Forward]\n    E --> F[Sortie]\n    C -.residuel.-> D","Formation experte sur les architectures à base d'attention et leurs alternatives, pour évaluer techniquement un nouveau modèle plutôt que ses annonces.","Décryptez le fonctionnement des architectures à base d'attention et comparez leurs alternatives pour évaluer techniquement un nouveau modèle.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-mermaid\">graph LR\n    A[Entree] --&gt; B[Embedding + Position]\n    B --&gt; C[Self-Attention multi-tetes]\n    C --&gt; D[Normalisation]\n    D --&gt; E[Feed-Forward]\n    E --&gt; F[Sortie]\n    C -.residuel.-&gt; D\u003C/code>\u003C/pre>",1789740844614]