[{"data":1,"prerenderedAt":45},["ShallowReactive",2],{"course-ia-multimodale-texte-image-audio":3,"highlight-python-analyse = client.cha":44},{"id":4,"name":5,"slug":6,"location":7,"targetAudienceFormatMarkdown":8,"prerequisitesFormatMarkdown":9,"objectivesFormatMarkdown":10,"descriptionFormatMarkdown":11,"teachingMethodsFormatMarkdown":12,"teachingResourcesFormatMarkdown":13,"evaluationMethodsFormatMarkdown":14,"accessibilityFormatMarkdown":15,"accessMethodsFormatMarkdown":16,"minimumParticipants":7,"maximumParticipants":7,"duration":17,"reference":18,"trainerType":7,"updated_at":19,"created_at":20,"price":21,"organizationMode":22,"theme":25,"code":29,"tags":34,"metadata":35},"/api/courses/bc8a911f-b343-11f1-a993-d8ca06000363","IA multimodale : texte, image, audio","ia-multimodale-texte-image-audio",null,"Développeurs, ingénieurs IA, architectes, chefs de projet techniques.","-   Expérience de l'intégration de modèles de langage.","-   identifier les cas d'usage pertinents des modèles multimodaux\n-   intégrer des capacités de vision, de transcription et de synthèse vocale\n-   évaluer la qualité et les limites des traitements multimodaux\n-   maîtriser les coûts et les contraintes de confidentialité associés","--day1--\n\n## Vision et documents\n\n-   Modèles multimodaux : capacités actuelles et limites\n-   Analyse d'images : description, extraction d'informations, classification\n-   Traitement documentaire : extraction structurée depuis des documents scannés\n-   Comparaison avec les solutions spécialisées de reconnaissance de caractères\n-   Coût et latence du traitement d'images\n-   Travaux pratiques : extraction structurée d'informations depuis un lot de documents scannés\n\n--break--\n\n## Audio et voix\n\n-   Transcription automatique : qualité, langues, diarisation des locuteurs\n-   Traitement des enregistrements de réunions et exploitation des transcriptions\n-   Synthèse vocale : usages, qualité, contraintes\n-   Assistants vocaux : architecture et latence\n-   Enjeux de consentement et de conformité sur les enregistrements\n-   Travaux pratiques : chaîne complète de transcription et de synthèse d'une réunion\n\n--day2--\n\n## Génération et traitement d'images\n\n-   Génération d'images : usages professionnels et limites\n-   Modification et retouche assistée\n-   Droits, licences et mentions applicables aux contenus générés\n-   Détection de contenus générés et marquage\n-   Intégration dans des flux de production de contenus\n-   Travaux pratiques : intégration d'une génération d'images dans une application\n\n--break--\n\n## Intégration et exploitation\n\n-   Architecture d'un traitement multimodal et gestion des fichiers volumineux\n-   Traitements asynchrones et files d'attente\n-   Stockage et cycle de vie des médias traités\n-   Évaluation de la qualité des traitements multimodaux\n-   Coûts comparés et arbitrage entre modèles\n-   Travaux pratiques : mise en production d'un traitement multimodal asynchrone","Présentiel, distanciel, hybride","Les supports pédagogiques sont remis aux stagiaires sous format numérique et/ou papier selon les modalités de la formation.\n\nIls comprennent des supports de cours, des présentations, des fiches pratiques, des études de cas, des exercices applicatifs ainsi que des QCM d’entraînement selon la formation. (adapté au choix du formateur)\n\nLes formations s’appuient sur des moyens techniques adaptés : ordinateurs, logiciels professionnels, connexion internet, écran ou vidéoprojecteur, ainsi que des outils collaboratifs et de visioconférence pour les formations à distance.\n\nL’ensemble des supports pédagogiques est accessible pendant et après la formation afin de favoriser l’appropriation et la mise en pratique des compétences acquises.","En amont de la formation, un recueil des besoins permet de récolter des informations sur le stagiaire et ses attentes. L’évaluation se fait en cours de formation, par des études de cas ou des travaux pratiques. En fin de formation, par un questionnaire d’auto-évaluation et/ou un examen.\n\nUn suivi de qualité est effectué grâce à nos sessions en groupe restreint (entre 2 et 9 participants maximum). Le stagiaire émargera par demi-journée et recevra une attestation de formation.","Nous informons l’ensemble de nos clients et stagiaires que nous sommes dans la capacité d’adapter les sessions selon les handicaps et les situations spécifiques. Nous nous engageons à répondre à toutes vos demandes sous un délai de 48h ouvré.","Si l’une de nos formations vous intéresse, contactez-nous au +33 4 93 65 34 24 ou à l’adresse mail contact@m2g-intellect.fr. Selon votre besoin et vos attentes, nous organiserons un échange téléphonique avec le formateur pressenti afin d’adapter la formation et ses modules, puis nous vous adresserons un devis.\n\nLes dates de la formation seront à convenir sous 30 jours maximum.","14.00","L2-ITE-18","2026-09-18T11:42:27+00:00","2026-09-18T11:31:33+00:00","1660.00",{"id":23,"name":24},"/api/organization_mode_types/6","HYBRID",{"id":26,"name":27,"slug":28},"/api/themes/1bfd6e41-c2b0-4813-a29b-c9e1c486b5d0","Intelligence Artificielle","intelligence-artificielle",{"id":30,"label":31,"domain":32},"/api/training_specialities/163","326 - Informatique, traitement de l’information, réseaux de transmission des données",{"label":33},"32 - Communication et information",[],{"desc-accroche":36,"Description":37,"icon-color":38,"icon-name":39,"code-langage":40,"code-snippet":41,"courte-description":42,"titre-accroche":43},"Deux jours pour identifier les cas d'usage pertinents des modèles multimodaux, intégrer des capacités de vision, de transcription et de synthèse vocale, évaluer la qualité des traitements obtenus et maîtriser coûts et confidentialité.","Les modèles capables de traiter autre chose que du texte ouvrent des usages concrets : analyse de documents scannés, description d'images, transcription de réunions, synthèse vocale. Cette formation de deux jours identifie les cas d'usage réellement exploitables, en écartant les démonstrations spectaculaires mais peu fiables. Les participants intègrent des capacités de vision pour l'analyse d'images, de transcription audio et de synthèse vocale, en combinant si besoin plusieurs modèles spécialisés. La formation traite l'évaluation de la qualité et des limites de ces traitements — hallucinations visuelles, erreurs de transcription en environnement bruité — ainsi que la maîtrise des coûts et des contraintes de confidentialité propres à l'image et à l'audio. Elle s'adresse aux développeurs, ingénieurs IA, architectes et chefs de projet techniques ayant intégré des modèles de langage.","#4C6EF5","mdi:image-multiple-outline","python","analyse = client.chat.completions.create(\n    model=\"gpt-4o\",\n    messages=[{\n        \"role\": \"user\",\n        \"content\": [\n            {\"type\": \"text\", \"text\": \"Extrais le montant total de cette facture.\"},\n            {\"type\": \"image_url\", \"image_url\": {\"url\": url_facture}},\n        ],\n    }],\n)\ntranscription = client.audio.transcriptions.create(model=\"whisper-1\", file=fichier_audio)","IA multimodale : intégration de la vision, de la transcription et de la synthèse vocale, évaluation des résultats et maîtrise des coûts.","Exploitez les modèles multimodaux pour traiter texte, image et audio, en maîtrisant leurs coûts et leurs limites réelles.","\u003Cpre class=\"hljs\">\u003Ccode class=\"language-python\">analyse = client.chat.completions.create(\n    model=\u003Cspan class=\"hljs-string\">&quot;gpt-4o&quot;\u003C/span>,\n    messages=[{\n        \u003Cspan class=\"hljs-string\">&quot;role&quot;\u003C/span>: \u003Cspan class=\"hljs-string\">&quot;user&quot;\u003C/span>,\n        \u003Cspan class=\"hljs-string\">&quot;content&quot;\u003C/span>: [\n            {\u003Cspan class=\"hljs-string\">&quot;type&quot;\u003C/span>: \u003Cspan class=\"hljs-string\">&quot;text&quot;\u003C/span>, \u003Cspan class=\"hljs-string\">&quot;text&quot;\u003C/span>: \u003Cspan class=\"hljs-string\">&quot;Extrais le montant total de cette facture.&quot;\u003C/span>},\n            {\u003Cspan class=\"hljs-string\">&quot;type&quot;\u003C/span>: \u003Cspan class=\"hljs-string\">&quot;image_url&quot;\u003C/span>, \u003Cspan class=\"hljs-string\">&quot;image_url&quot;\u003C/span>: {\u003Cspan class=\"hljs-string\">&quot;url&quot;\u003C/span>: url_facture}},\n        ],\n    }],\n)\ntranscription = client.audio.transcriptions.create(model=\u003Cspan class=\"hljs-string\">&quot;whisper-1&quot;\u003C/span>, file=fichier_audio)\u003C/code>\u003C/pre>",1789740846904]