Dans vos locaux
Pour ancrer les apprentissages et encourager la dynamique collective.
Deux jours pour identifier les cas d'usage pertinents des modèles multimodaux, intégrer des capacités de vision, de transcription et de synthèse vocale, évaluer la qualité des traitements obtenus et maîtriser coûts et confidentialité.
analyse = client.chat.completions.create(
model="gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extrais le montant total de cette facture."},
{"type": "image_url", "image_url": {"url": url_facture}},
],
}],
)
transcription = client.audio.transcriptions.create(model="whisper-1", file=fichier_audio)Les modèles capables de traiter autre chose que du texte ouvrent des usages concrets : analyse de documents scannés, description d'images, transcription de réunions, synthèse vocale. Cette formation de deux jours identifie les cas d'usage réellement exploitables, en écartant les démonstrations spectaculaires mais peu fiables. Les participants intègrent des capacités de vision pour l'analyse d'images, de transcription audio et de synthèse vocale, en combinant si besoin plusieurs modèles spécialisés. La formation traite l'évaluation de la qualité et des limites de ces traitements — hallucinations visuelles, erreurs de transcription en environnement bruité — ainsi que la maîtrise des coûts et des contraintes de confidentialité propres à l'image et à l'audio. Elle s'adresse aux développeurs, ingénieurs IA, architectes et chefs de projet techniques ayant intégré des modèles de langage.
Les objectifs
identifier les cas d'usage pertinents des modèles multimodaux
intégrer des capacités de vision, de transcription et de synthèse vocale
évaluer la qualité et les limites des traitements multimodaux
maîtriser les coûts et les contraintes de confidentialité associés
Public visé
Développeurs, ingénieurs IA, architectes, chefs de projet techniques.
Prérequis
Expérience de l'intégration de modèles de langage.
Pour ancrer les apprentissages et encourager la dynamique collective.
Pour allier flexibilité et interactions en temps réel avec le formateur.
Pour favoriser la concentration, les échanges et le confort des apprenants.