"Multimodaal" wordt voor twee verschillende dingen gebruikt, en ze verwarren leidt tot echte teleurstelling.
De ene betekenis is een model dat meer dan één soort invoer kan lezen — tekst, beelden, audio, video. De andere is een systeem dat meer dan één soort uitvoer kan produceren. Vrijwel geen enkel model doet allebei, en het gat tussen die twee feiten verklaart waarom "een multimodale app bouwen" meestal betekent dat je meerdere modellen aan elkaar knoopt.
Cijfers voor het laatst gecontroleerd op 26 augustus 2026.
Wat een modaliteit is
Een modaliteit is een gegevenstype: tekst, beeld, audio, video. Een model is multimodaal wanneer het er meer dan één aankan.
De nuttige vraag is nooit "is het multimodaal" maar "welke modaliteiten, in welke richting" — want lezen en schrijven zijn totaal verschillende vaardigheden.
Wat de grote modellen vandaag werkelijk accepteren
Lees in de breedte, niet naar beneden. Elk van deze produceert alleen tekst.
| Modelfamilie | Leest | Schrijft |
|---|---|---|
| Gemini 2.5 / 3.x | tekst, beeld, bestand, audio, video | tekst |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | tekst, beeld, bestand | tekst |
| GPT-5-familie | tekst, beeld, bestand | tekst |
| DeepSeek V4 Pro | tekst | tekst |
Twee dingen springen eruit.
Gemini leest audio en video; Claude en GPT niet. Dat is op dit moment het duidelijkste verschil in mogelijkheden tussen de grote families, en het is geen kwaliteitsoordeel — het is een lijst geaccepteerde invoertypen. Als je invoer een opgenomen vergadering of een videofragment is, beslist dat verschil je model nog voordat iets anders dat doet.
Elke familie in die tabel schrijft tekst en verder niets. Gemini kan een video bekijken en beschrijven. Maken kan het er geen.
Wie maakt de beelden en video's dan?
Volstrekt andere modellen. Alleen al in de catalogus van Atlas Cloud is de verdeling:
| Type | Modellen met gepubliceerde prijs |
|---|---|
| Video | 196 |
| Tekst | 136 |
| Beeld | 121 |
| Audio | 20 |
Vrijwel al die beeld- en videomodellen doen één ding: tekst erin, één soort media eruit. Ze converseren niet, ze lezen geen documenten, en het zijn niet de modellen uit de tabel hierboven.
Dit is de praktische vorm van multimodale AI in 2026: een tekstmodel dat meerdere invoertypen kan lezen, plus gespecialiseerde generatoren voor elk uitvoertype, verbonden door jouw code. Niet één model dat alles doet.
Je ziet de verdeling in de modellenindex — chat, beeld en video zijn aparte lijsten omdat het aparte modelfamilies zijn.
Wat multimodale invoer werkelijk kost
Beelden en documenten lezen is niet gratis. Ze worden net als al het andere in tokens omgezet, en Anthropic publiceert de aantallen:
- Eén afbeelding plus een korte instructie: 1.028 invoertokens
- Eén PDF plus een korte instructie: 2.188 invoertokens
Een verzoek met twintig schermafbeeldingen kost dus zo'n 20.000 invoertokens vóór je prompt. Op Claude Sonnet 5 tegen $2,00 per miljoen is dat vier cent per verzoek — verwaarloosbaar één keer, echt bij vijftigduizend verzoeken per maand.
Video weegt nog zwaarder, wat mede verklaart waarom minder aanbieders het accepteren.
Waar multimodaal zijn plaats echt verdient
- Documenten lezen die beelden zijn. Scans, schermafbeeldingen, bonnetjes, handgeschreven formulieren. Een tekstmodel met zicht vervangt een OCR-pijplijn en gaat om met opmaak waarop het nooit is getraind.
- Audio- en videobegrip. Vergadersamenvattingen, gespreksanalyse, fragmenten beschrijven. Vandaag wijst dat naar Gemini, omdat dat de familie is die zulke invoer accepteert.
- Verankerde generatie. Laat een model je merkfoto's zien en vraag om teksten die erbij passen.
- Interfacewerk. Geef een model een schermafbeelding van een kapotte pagina en vraag wat er mis is.
Waar niet
- Als je media als uitvoer nodig hebt. Grijp naar een gespecialiseerde generator. Daar zijn die 196 video- en 121 beeldmodellen voor.
- Als gewone tekst had volstaan. Een vision-model dat een PDF leest die je had kunnen parseren is duizend tokens die je niet had hoeven uitgeven.
- Als "multimodaal" marketingwerk doet. Een model dat beelden leest is niet automatisch beter in tekst. Controleer de modaliteitenlijst, niet het bijvoeglijk naamwoord.
Hoe kies je
- Schrijf de richting op. Wat gaat erin, wat komt eruit. Twee lijstjes.
- Kies de lezer op invoertype. Staat audio of video op de invoerlijst, dan is de Gemini-familie momenteel het antwoord onder de grote drie.
- Kies elke generator apart. Beeld-, video- en audiomodellen kies je op hun eigen verdiensten en hun eigen prijzen.
- Begroot de invoer. Duizend tokens per afbeelding, tweeduizend per PDF, vermenigvuldigd met je echte verzoekvolume.
De korte versie
- Multimodaal beschrijft wat een model leest, wat het schrijft, of allebei — vraag altijd welke.
- Gemini leest audio en video. Claude en GPT lezen tekst, beelden en bestanden. Ze schrijven allemaal alleen tekst.
- Media worden gemaakt door aparte gespecialiseerde modellen: 196 video-, 121 beeld- en 20 audiomodellen bij één aanbieder alleen al.
- Een echte multimodale toepassing is meestal één lezer plus een of meer generatoren, verbonden door jouw code.
- Afbeeldingen en PDF's kosten ongeveer 1.000 respectievelijk 2.000 invoertokens. Vermenigvuldig met je volume voordat je eromheen ontwerpt.
Verder kijken op ElliSekiz
Zie de families naast elkaar. De modellenindex splitst chat, beeld, video en audio, elk met actuele prijzen.
Vergelijk de lezers op prijs. Tokentarieven voor elk tekstmodel staan op de vergelijkpagina, in de eenheid waarin elke aanbieder rekent.
Bronnen
- OpenRouter models API,
https://openrouter.ai/api/v1/models(invoer- en uitvoermodaliteiten, geraadpleegd op 26-08-2026) - Atlas Cloud modelcatalogus-API,
https://api.atlascloud.ai/api/v1/models(aantallen per modeltype) - Anthropic — Token counting (tokenaantallen voor beeld en PDF)
