2026-07-21

Qu'est-ce que l'IA multimodale ? (Et pourquoi cela désigne rarement un seul modèle)

Multimodal veut dire deux choses. Un modèle qui lit plusieurs types d'entrée n'est pas celui qui les produit — et presque aucun ne fait les deux.

Qu'est-ce que l'IA multimodale ? (Et pourquoi cela désigne rarement un seul modèle)

« Multimodal » sert à désigner deux choses différentes, et les confondre mène à une vraie déception.

Un sens : un modèle capable de lire plus d'un type d'entrée — texte, images, audio, vidéo. L'autre : un système capable de produire plus d'un type de sortie. Presque aucun modèle ne fait les deux, et l'écart entre ces deux faits explique pourquoi « construire une app multimodale » revient généralement à câbler plusieurs modèles ensemble.

Chiffres vérifiés pour la dernière fois le 26 août 2026.

Ce qu'est une modalité

Une modalité est un type de données : texte, image, audio, vidéo. Un modèle est multimodal quand il en gère plus d'un.

La question utile n'est jamais « est-il multimodal » mais « quelles modalités, dans quel sens » — parce que lire et écrire sont des capacités entièrement différentes.

Ce que les grands modèles acceptent réellement aujourd'hui

Lis en travers, pas vers le bas. Tous ceux-là ne produisent que du texte.

Famille de modèlesLitÉcrit
Gemini 2.5 / 3.xtexte, image, fichier, audio, vidéotexte
Claude Opus 5 / Sonnet 5 / Haiku 4.5texte, image, fichiertexte
Famille GPT-5texte, image, fichiertexte
DeepSeek V4 Protextetexte

Deux choses sautent aux yeux.

Gemini lit l'audio et la vidéo ; Claude et GPT non. C'est actuellement la différence de capacité la plus nette entre les grandes familles, et ce n'est pas un jugement de qualité — c'est une liste de types d'entrée acceptés. Si ton entrée est une réunion enregistrée ou un clip vidéo, cette différence décide de ton modèle avant toute autre considération.

Toutes les familles de ce tableau écrivent du texte et rien d'autre. Gemini peut regarder une vidéo et la décrire. Il ne peut pas en fabriquer une.

Alors qui fabrique les images et les vidéos ?

Des modèles entièrement différents. Rien que dans le catalogue d'Atlas Cloud, la répartition est :

TypeModèles avec un prix publié
Vidéo196
Texte136
Image121
Audio20

Presque tous ces modèles d'image et de vidéo font un seul travail : du texte entre, un type de média sort. Ils ne conversent pas, ne lisent pas de documents, et ce ne sont pas les modèles du tableau ci-dessus.

Voilà la forme concrète de l'IA multimodale en 2026 : un modèle de texte capable de lire plusieurs types d'entrée, plus des générateurs spécialisés pour chaque type de sortie, reliés par ton code. Pas un seul modèle qui ferait tout.

Tu peux voir la répartition sur l'index des modèleschat, image et vidéo sont des listes séparées parce que ce sont des familles de modèles séparées.

Ce que coûte réellement l'entrée multimodale

Lire des images et des documents n'est pas gratuit. Ils sont convertis en tokens comme tout le reste, et Anthropic publie les comptes :

Une requête avec vingt captures d'écran coûte donc environ 20 000 tokens d'entrée avant ton prompt. Sur Claude Sonnet 5 à 2,00 $ le million, cela fait quatre centimes par requête — dérisoire une fois, réel à cinquante mille requêtes par mois.

La vidéo pèse plus lourd encore, ce qui explique en partie pourquoi moins de fournisseurs l'acceptent.

Là où le multimodal gagne vraiment sa place

Là où non

Comment choisir

  1. Écris le sens. Ce qui entre, ce qui sort. Deux listes.
  2. Choisis le lecteur selon le type d'entrée. Si l'audio ou la vidéo figure dans la liste d'entrée, la famille Gemini est actuellement la réponse parmi les trois grands.
  3. Choisis chaque générateur séparément. Les modèles image, vidéo et audio se choisissent sur leurs propres mérites et leurs propres prix.
  4. Budgète les entrées. Mille tokens par image, deux mille par PDF, multipliés par ton volume réel de requêtes.

En bref

Explorer plus loin sur ElliSekiz

Voir les familles côte à côte. L'index des modèles sépare chat, image, vidéo et audio, chacun avec ses prix actuels.

Comparer les lecteurs sur le prix. Les tarifs par token de chaque modèle de texte sont sur la page de comparaison, dans l'unité que chaque fournisseur facture.

Sources

Tous les articles