Concevoir des modèles multimodaux

Concevoir des modèles multimodaux

NEOPOLIS AKADEMY

Concevoir des modèles multimodaux

Exploration pratique des modèles multimodaux centrés sur vision, audio, vidéo et génération d’images. Approche axée sur intégration de flux de données multimodales et architectures compatibles, bibliothèques open-source et étapes d’assemblage modèle-pipeline.

Découvrir cette formation sur Akademy ↗

Les inscriptions et les modalités pratiques sont disponibles sur Neopolis Akademy.

Concevoir des modèles multimodaux

Ce que vous allez découvrir

Présentation des types de modèles multimodaux et de leurs cas d’usage concrets.

Traitement et fusion de signaux vision, audio et vidéo pour alimenter des modèles uniques.

Méthodes de génération d’images conditionnées et de post-traitement des sorties.

Architecture de pipeline : prétraitement, encodage multimodal, fusion et décodage.

Exemples d’outils et de composants pratiques pour expérimentation et prototypage.

PAS À PAS

Le programme de la formation

01Concevoir des modèles multimodaux

Concevez des modèles multimodaux en exploitant les modèles et datasets disponibles, les prétraitements pour chaque modalité et des approches pour classification, VQA et retouche d’images. Le module inclut vision, audio, texte et génération multimodale.

Accéder aux ressources : navigation des modèles et jeux de données, repérage des modèles texte‑vers‑image et préparation des données multimodales.

Modèles unimodaux : techniques pour vision, audio et texte, incluant classification d’images, détection d’objets et suppression d’arrière‑plan.

Modèles multimodaux pour la classification : méthodes zero‑shot (CLIP), évaluation automatique de légendes et analyse de sentiment multimodale.

Génération multimodale : Visual Question Answering (VQA) avec ViLT et LayoutLM, et retouche d’images via modèles de diffusion.

Voir ce module sur Akademy ↗

Source du programme : Neopolis Akademy. Fiche d’origine