2026-07-21

Wat is multimodale AI? (En waarom het zelden één model betekent)

Multimodaal betekent twee dingen. Een model dat veel invoertypen leest is niet hetzelfde als een dat ze maakt — en vrijwel geen enkel model doet allebei.

Wat is multimodale AI? (En waarom het zelden één model betekent)

"Multimodaal" wordt voor twee verschillende dingen gebruikt, en ze verwarren leidt tot echte teleurstelling.

De ene betekenis is een model dat meer dan één soort invoer kan lezen — tekst, beelden, audio, video. De andere is een systeem dat meer dan één soort uitvoer kan produceren. Vrijwel geen enkel model doet allebei, en het gat tussen die twee feiten verklaart waarom "een multimodale app bouwen" meestal betekent dat je meerdere modellen aan elkaar knoopt.

Cijfers voor het laatst gecontroleerd op 26 augustus 2026.

Wat een modaliteit is

Een modaliteit is een gegevenstype: tekst, beeld, audio, video. Een model is multimodaal wanneer het er meer dan één aankan.

De nuttige vraag is nooit "is het multimodaal" maar "welke modaliteiten, in welke richting" — want lezen en schrijven zijn totaal verschillende vaardigheden.

Wat de grote modellen vandaag werkelijk accepteren

Lees in de breedte, niet naar beneden. Elk van deze produceert alleen tekst.

ModelfamilieLeestSchrijft
Gemini 2.5 / 3.xtekst, beeld, bestand, audio, videotekst
Claude Opus 5 / Sonnet 5 / Haiku 4.5tekst, beeld, bestandtekst
GPT-5-familietekst, beeld, bestandtekst
DeepSeek V4 Proteksttekst

Twee dingen springen eruit.

Gemini leest audio en video; Claude en GPT niet. Dat is op dit moment het duidelijkste verschil in mogelijkheden tussen de grote families, en het is geen kwaliteitsoordeel — het is een lijst geaccepteerde invoertypen. Als je invoer een opgenomen vergadering of een videofragment is, beslist dat verschil je model nog voordat iets anders dat doet.

Elke familie in die tabel schrijft tekst en verder niets. Gemini kan een video bekijken en beschrijven. Maken kan het er geen.

Wie maakt de beelden en video's dan?

Volstrekt andere modellen. Alleen al in de catalogus van Atlas Cloud is de verdeling:

TypeModellen met gepubliceerde prijs
Video196
Tekst136
Beeld121
Audio20

Vrijwel al die beeld- en videomodellen doen één ding: tekst erin, één soort media eruit. Ze converseren niet, ze lezen geen documenten, en het zijn niet de modellen uit de tabel hierboven.

Dit is de praktische vorm van multimodale AI in 2026: een tekstmodel dat meerdere invoertypen kan lezen, plus gespecialiseerde generatoren voor elk uitvoertype, verbonden door jouw code. Niet één model dat alles doet.

Je ziet de verdeling in de modellenindexchat, beeld en video zijn aparte lijsten omdat het aparte modelfamilies zijn.

Wat multimodale invoer werkelijk kost

Beelden en documenten lezen is niet gratis. Ze worden net als al het andere in tokens omgezet, en Anthropic publiceert de aantallen:

Een verzoek met twintig schermafbeeldingen kost dus zo'n 20.000 invoertokens vóór je prompt. Op Claude Sonnet 5 tegen $2,00 per miljoen is dat vier cent per verzoek — verwaarloosbaar één keer, echt bij vijftigduizend verzoeken per maand.

Video weegt nog zwaarder, wat mede verklaart waarom minder aanbieders het accepteren.

Waar multimodaal zijn plaats echt verdient

Waar niet

Hoe kies je

  1. Schrijf de richting op. Wat gaat erin, wat komt eruit. Twee lijstjes.
  2. Kies de lezer op invoertype. Staat audio of video op de invoerlijst, dan is de Gemini-familie momenteel het antwoord onder de grote drie.
  3. Kies elke generator apart. Beeld-, video- en audiomodellen kies je op hun eigen verdiensten en hun eigen prijzen.
  4. Begroot de invoer. Duizend tokens per afbeelding, tweeduizend per PDF, vermenigvuldigd met je echte verzoekvolume.

De korte versie

Verder kijken op ElliSekiz

Zie de families naast elkaar. De modellenindex splitst chat, beeld, video en audio, elk met actuele prijzen.

Vergelijk de lezers op prijs. Tokentarieven voor elk tekstmodel staan op de vergelijkpagina, in de eenheid waarin elke aanbieder rekent.

Bronnen

Alle berichten