« Multimodal » sert à désigner deux choses différentes, et les confondre mène à une vraie déception.
Un sens : un modèle capable de lire plus d'un type d'entrée — texte, images, audio, vidéo. L'autre : un système capable de produire plus d'un type de sortie. Presque aucun modèle ne fait les deux, et l'écart entre ces deux faits explique pourquoi « construire une app multimodale » revient généralement à câbler plusieurs modèles ensemble.
Chiffres vérifiés pour la dernière fois le 26 août 2026.
Ce qu'est une modalité
Une modalité est un type de données : texte, image, audio, vidéo. Un modèle est multimodal quand il en gère plus d'un.
La question utile n'est jamais « est-il multimodal » mais « quelles modalités, dans quel sens » — parce que lire et écrire sont des capacités entièrement différentes.
Ce que les grands modèles acceptent réellement aujourd'hui
Lis en travers, pas vers le bas. Tous ceux-là ne produisent que du texte.
| Famille de modèles | Lit | Écrit |
|---|---|---|
| Gemini 2.5 / 3.x | texte, image, fichier, audio, vidéo | texte |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | texte, image, fichier | texte |
| Famille GPT-5 | texte, image, fichier | texte |
| DeepSeek V4 Pro | texte | texte |
Deux choses sautent aux yeux.
Gemini lit l'audio et la vidéo ; Claude et GPT non. C'est actuellement la différence de capacité la plus nette entre les grandes familles, et ce n'est pas un jugement de qualité — c'est une liste de types d'entrée acceptés. Si ton entrée est une réunion enregistrée ou un clip vidéo, cette différence décide de ton modèle avant toute autre considération.
Toutes les familles de ce tableau écrivent du texte et rien d'autre. Gemini peut regarder une vidéo et la décrire. Il ne peut pas en fabriquer une.
Alors qui fabrique les images et les vidéos ?
Des modèles entièrement différents. Rien que dans le catalogue d'Atlas Cloud, la répartition est :
| Type | Modèles avec un prix publié |
|---|---|
| Vidéo | 196 |
| Texte | 136 |
| Image | 121 |
| Audio | 20 |
Presque tous ces modèles d'image et de vidéo font un seul travail : du texte entre, un type de média sort. Ils ne conversent pas, ne lisent pas de documents, et ce ne sont pas les modèles du tableau ci-dessus.
Voilà la forme concrète de l'IA multimodale en 2026 : un modèle de texte capable de lire plusieurs types d'entrée, plus des générateurs spécialisés pour chaque type de sortie, reliés par ton code. Pas un seul modèle qui ferait tout.
Tu peux voir la répartition sur l'index des modèles — chat, image et vidéo sont des listes séparées parce que ce sont des familles de modèles séparées.
Ce que coûte réellement l'entrée multimodale
Lire des images et des documents n'est pas gratuit. Ils sont convertis en tokens comme tout le reste, et Anthropic publie les comptes :
- Une image plus une instruction courte : 1 028 tokens d'entrée
- Un PDF plus une instruction courte : 2 188 tokens d'entrée
Une requête avec vingt captures d'écran coûte donc environ 20 000 tokens d'entrée avant ton prompt. Sur Claude Sonnet 5 à 2,00 $ le million, cela fait quatre centimes par requête — dérisoire une fois, réel à cinquante mille requêtes par mois.
La vidéo pèse plus lourd encore, ce qui explique en partie pourquoi moins de fournisseurs l'acceptent.
Là où le multimodal gagne vraiment sa place
- Lire des documents qui sont des images. Scans, captures d'écran, reçus, formulaires manuscrits. Un modèle de texte doté de vision remplace une chaîne d'OCR et se débrouille avec des mises en page pour lesquelles il n'a jamais été entraîné.
- Compréhension de l'audio et de la vidéo. Comptes rendus de réunion, analyse d'appels, description de clips. Aujourd'hui cela pointe vers Gemini, parce que c'est la famille qui accepte ces entrées.
- Génération ancrée. Montre à un modèle tes photos de marque et demande-lui des textes qui s'y accordent.
- Travail d'interface. Donne à un modèle la capture d'une page cassée et demande ce qui cloche.
Là où non
- Quand il te faut du média en sortie. Va chercher un générateur spécialisé. C'est à cela que servent les 196 modèles vidéo et les 121 modèles image.
- Quand du texte simple aurait suffi. Un modèle de vision qui lit un PDF que tu aurais pu parser, ce sont mille tokens que tu n'avais pas besoin de dépenser.
- Quand « multimodal » fait du travail de marketing. Un modèle qui lit des images n'est pas automatiquement meilleur en texte. Vérifie la liste des modalités, pas l'adjectif.
Comment choisir
- Écris le sens. Ce qui entre, ce qui sort. Deux listes.
- Choisis le lecteur selon le type d'entrée. Si l'audio ou la vidéo figure dans la liste d'entrée, la famille Gemini est actuellement la réponse parmi les trois grands.
- Choisis chaque générateur séparément. Les modèles image, vidéo et audio se choisissent sur leurs propres mérites et leurs propres prix.
- Budgète les entrées. Mille tokens par image, deux mille par PDF, multipliés par ton volume réel de requêtes.
En bref
- Multimodal décrit ce qu'un modèle lit, ce qu'il écrit, ou les deux — demande toujours lequel.
- Gemini lit l'audio et la vidéo. Claude et GPT lisent texte, images et fichiers. Tous n'écrivent que du texte.
- Les médias sont produits par des modèles spécialisés distincts : 196 vidéo, 121 image et 20 audio chez un seul fournisseur.
- Une vraie application multimodale, c'est généralement un lecteur plus un ou plusieurs générateurs, reliés par ton code.
- Images et PDF coûtent environ 1 000 et 2 000 tokens d'entrée respectivement. Multiplie par ton volume avant de concevoir autour d'eux.
Explorer plus loin sur ElliSekiz
Voir les familles côte à côte. L'index des modèles sépare chat, image, vidéo et audio, chacun avec ses prix actuels.
Comparer les lecteurs sur le prix. Les tarifs par token de chaque modèle de texte sont sur la page de comparaison, dans l'unité que chaque fournisseur facture.
Sources
- API des modèles OpenRouter,
https://openrouter.ai/api/v1/models(modalités d'entrée et de sortie, consultée le 26/08/2026) - API du catalogue de modèles Atlas Cloud,
https://api.atlascloud.ai/api/v1/models(nombres par type de modèle) - Anthropic — Token counting (comptes de tokens pour image et PDF)
