2026-07-21

Vad är multimodal AI? (Och varför det sällan betyder en modell)

Multimodal betyder två olika saker. En modell som läser många indatatyper är inte densamma som en som producerar dem — och nästan ingen gör bådadera.

Vad är multimodal AI? (Och varför det sällan betyder en modell)

"Multimodal" används om två olika saker, och att blanda ihop dem leder till verklig besvikelse.

Den ena betydelsen är en modell som kan läsa mer än en sorts indata — text, bilder, ljud, video. Den andra är ett system som kan producera mer än en sorts utdata. Nästan ingen enskild modell gör bådadera, och glappet mellan de två fakta förklarar varför "bygga en multimodal app" oftast betyder att koppla ihop flera modeller.

Siffrorna kontrollerades senast den 26 augusti 2026.

Vad en modalitet är

En modalitet är en datatyp: text, bild, ljud, video. En modell är multimodal när den hanterar mer än en.

Den användbara frågan är aldrig "är den multimodal" utan "vilka modaliteter, i vilken riktning" — eftersom att läsa och att skriva är helt olika förmågor.

Vad dagens stora modeller faktiskt tar emot

Läs på tvären, inte nedåt. Var och en av dessa producerar enbart text.

ModellfamiljLäserSkriver
Gemini 2.5 / 3.xtext, bild, fil, ljud, videotext
Claude Opus 5 / Sonnet 5 / Haiku 4.5text, bild, filtext
GPT-5-familjentext, bild, filtext
DeepSeek V4 Protexttext

Två saker sticker ut.

Gemini läser ljud och video; Claude och GPT gör det inte. Det är just nu den tydligaste förmågeskillnaden mellan de stora familjerna, och det är inget kvalitetsomdöme — det är en lista över accepterade indatatyper. Om din indata är ett inspelat möte eller ett videoklipp avgör den skillnaden din modell innan något annat hinner göra det.

Varje familj i den tabellen skriver text och inget annat. Gemini kan titta på en video och beskriva den. Den kan inte göra en.

Vem gör då bilderna och videorna?

Helt andra modeller. Bara i Atlas Clouds katalog ser fördelningen ut så här:

TypModeller med publicerat pris
Video196
Text136
Bild121
Ljud20

Nästan alla de bild- och videomodellerna gör ett enda jobb: text in, en sorts media ut. De för inga samtal, de läser inga dokument, och de är inte modellerna i tabellen ovan.

Detta är den praktiska formen av multimodal AI 2026: en textmodell som kan läsa flera indatatyper, plus specialiserade generatorer för varje utdatatyp, sammanfogade av din kod. Inte en modell som gör allt.

Du ser uppdelningen i modellregistretchatt, bild och video är separata listor eftersom de är separata modellfamiljer.

Vad multimodal indata faktiskt kostar

Att läsa bilder och dokument är inte gratis. De omvandlas till tokens som allt annat, och Anthropic publicerar antalen:

En förfrågan med tjugo skärmbilder kostar alltså omkring 20 000 indatatokens innan din prompt. På Claude Sonnet 5 till $2,00 per miljon blir det fyra cent per förfrågan — försumbart en gång, verkligt vid femtiotusen förfrågningar i månaden.

Video väger ännu tyngre, vilket är en del av förklaringen till att färre leverantörer tar emot det.

Där multimodalitet verkligen förtjänar sin plats

Där inte

Hur du väljer

  1. Skriv ner riktningen. Vad går in, vad kommer ut. Två listor.
  2. Välj läsaren efter indatatyp. Står ljud eller video på indatalistan är Gemini-familjen för närvarande svaret bland de tre stora.
  3. Välj varje generator för sig. Bild-, video- och ljudmodeller väljs på sina egna meriter och sina egna priser.
  4. Budgetera indatan. Tusen tokens per bild, tvåtusen per PDF, multiplicerat med din verkliga förfrågningsvolym.

Kortversionen

Utforska mer på ElliSekiz

Se familjerna sida vid sida. Modellregistret delar upp chatt, bild, video och ljud, var och en med aktuella priser.

Jämför läsarna på pris. Tokentaxor för varje textmodell finns på jämförelsesidan, i den enhet varje leverantör debiterar i.

Källor

Alla inlägg