"Multimodal" används om två olika saker, och att blanda ihop dem leder till verklig besvikelse.
Den ena betydelsen är en modell som kan läsa mer än en sorts indata — text, bilder, ljud, video. Den andra är ett system som kan producera mer än en sorts utdata. Nästan ingen enskild modell gör bådadera, och glappet mellan de två fakta förklarar varför "bygga en multimodal app" oftast betyder att koppla ihop flera modeller.
Siffrorna kontrollerades senast den 26 augusti 2026.
Vad en modalitet är
En modalitet är en datatyp: text, bild, ljud, video. En modell är multimodal när den hanterar mer än en.
Den användbara frågan är aldrig "är den multimodal" utan "vilka modaliteter, i vilken riktning" — eftersom att läsa och att skriva är helt olika förmågor.
Vad dagens stora modeller faktiskt tar emot
Läs på tvären, inte nedåt. Var och en av dessa producerar enbart text.
| Modellfamilj | Läser | Skriver |
|---|---|---|
| Gemini 2.5 / 3.x | text, bild, fil, ljud, video | text |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | text, bild, fil | text |
| GPT-5-familjen | text, bild, fil | text |
| DeepSeek V4 Pro | text | text |
Två saker sticker ut.
Gemini läser ljud och video; Claude och GPT gör det inte. Det är just nu den tydligaste förmågeskillnaden mellan de stora familjerna, och det är inget kvalitetsomdöme — det är en lista över accepterade indatatyper. Om din indata är ett inspelat möte eller ett videoklipp avgör den skillnaden din modell innan något annat hinner göra det.
Varje familj i den tabellen skriver text och inget annat. Gemini kan titta på en video och beskriva den. Den kan inte göra en.
Vem gör då bilderna och videorna?
Helt andra modeller. Bara i Atlas Clouds katalog ser fördelningen ut så här:
| Typ | Modeller med publicerat pris |
|---|---|
| Video | 196 |
| Text | 136 |
| Bild | 121 |
| Ljud | 20 |
Nästan alla de bild- och videomodellerna gör ett enda jobb: text in, en sorts media ut. De för inga samtal, de läser inga dokument, och de är inte modellerna i tabellen ovan.
Detta är den praktiska formen av multimodal AI 2026: en textmodell som kan läsa flera indatatyper, plus specialiserade generatorer för varje utdatatyp, sammanfogade av din kod. Inte en modell som gör allt.
Du ser uppdelningen i modellregistret — chatt, bild och video är separata listor eftersom de är separata modellfamiljer.
Vad multimodal indata faktiskt kostar
Att läsa bilder och dokument är inte gratis. De omvandlas till tokens som allt annat, och Anthropic publicerar antalen:
- En bild plus en kort instruktion: 1 028 indatatokens
- En PDF plus en kort instruktion: 2 188 indatatokens
En förfrågan med tjugo skärmbilder kostar alltså omkring 20 000 indatatokens innan din prompt. På Claude Sonnet 5 till $2,00 per miljon blir det fyra cent per förfrågan — försumbart en gång, verkligt vid femtiotusen förfrågningar i månaden.
Video väger ännu tyngre, vilket är en del av förklaringen till att färre leverantörer tar emot det.
Där multimodalitet verkligen förtjänar sin plats
- Läsa dokument som är bilder. Skanningar, skärmbilder, kvitton, handskrivna formulär. En textmodell med syn ersätter en OCR-kedja och klarar layouter den aldrig tränats på.
- Ljud- och videoförståelse. Mötessammanfattningar, samtalsanalys, beskriva klipp. I dag pekar det på Gemini, eftersom det är familjen som tar emot sådan indata.
- Förankrad generering. Visa en modell dina varumärkesbilder och be om text som passar dem.
- Gränssnittsarbete. Ge en modell en skärmbild av en trasig sida och fråga vad som är fel.
Där inte
- När du behöver media som utdata. Sträck dig efter en specialiserad generator. Det är vad de 196 video- och 121 bildmodellerna är till för.
- När vanlig text hade räckt. En vision-modell som läser en PDF du kunde ha parsat är tusen tokens du inte behövde göra av med.
- När "multimodal" gör marknadsföringsarbete. En modell som läser bilder är inte automatiskt bättre på text. Kontrollera modalitetslistan, inte adjektivet.
Hur du väljer
- Skriv ner riktningen. Vad går in, vad kommer ut. Två listor.
- Välj läsaren efter indatatyp. Står ljud eller video på indatalistan är Gemini-familjen för närvarande svaret bland de tre stora.
- Välj varje generator för sig. Bild-, video- och ljudmodeller väljs på sina egna meriter och sina egna priser.
- Budgetera indatan. Tusen tokens per bild, tvåtusen per PDF, multiplicerat med din verkliga förfrågningsvolym.
Kortversionen
- Multimodal beskriver vad en modell läser, vad den skriver, eller båda — fråga alltid vilket.
- Gemini läser ljud och video. Claude och GPT läser text, bilder och filer. Alla skriver bara text.
- Media produceras av separata specialiserade modeller: 196 video-, 121 bild- och 20 ljudmodeller hos en enda leverantör.
- En riktig multimodal tillämpning är oftast en läsare plus en eller flera generatorer, sammanfogade av din kod.
- Bilder och PDF:er kostar ungefär 1 000 respektive 2 000 indatatokens. Multiplicera med din volym innan du designar runt dem.
Utforska mer på ElliSekiz
Se familjerna sida vid sida. Modellregistret delar upp chatt, bild, video och ljud, var och en med aktuella priser.
Jämför läsarna på pris. Tokentaxor för varje textmodell finns på jämförelsesidan, i den enhet varje leverantör debiterar i.
Källor
- OpenRouter models API,
https://openrouter.ai/api/v1/models(in- och utdatamodaliteter, läst 2026-08-26) - Atlas Cloud modellkatalog-API,
https://api.atlascloud.ai/api/v1/models(antal per modelltyp) - Anthropic — Token counting (tokenantal för bild och PDF)
