Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Architectures de fusion texte-image-audio, encodeurs partagés et attention croisée, adaptation à un domaine métier, évaluation des performances et industrialisation en production.
graph TD
T[Texte] --> E1[Encodeur texte]
I[Image] --> E2[Encodeur image]
E1 --> F[Espace de fusion]
E2 --> F
F --> A[Attention croisee]
A --> S[Sortie multimodale]Cette formation traite les modèles combinant plusieurs modalités — texte, image, audio — sous l'angle des architectures de fusion (encodeurs partagés, projection dans un espace commun, attention croisée) et de leur adaptation à un cas d'usage métier réel. Elle aborde également l'évaluation des performances et des limites d'un système multimodal, ainsi que son industrialisation en production : pipelines d'inférence, gestion de la latence par modalité et supervision de la qualité. Les cas traités distinguent les situations où le multimodal apporte un gain réel de celles où il ajoute surtout de la complexité. Elle s'adresse aux ingénieurs IA, data scientists confirmés, architectes et ingénieurs de recherche qui conçoivent ou déploient des systèmes multimodaux.
Les objectifs
expliquer les architectures combinant plusieurs modalités
adapter un modèle multimodal à un cas d'usage métier
évaluer les performances et les limites d'un système multimodal
industrialiser un traitement multimodal en production
Public visé
Ingénieurs IA, data scientists confirmés, architectes, ingénieurs de recherche.
Prérequis
Maîtrise de l'apprentissage profond et connaissance des architectures de modèles de langage.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.