2026-07-21

O que é a IA multimodal? (E porque raramente significa um só modelo)

Multimodal quer dizer duas coisas. Um modelo que lê vários tipos de entrada não é o mesmo que os produz — e quase nenhum faz as duas coisas.

O que é a IA multimodal? (E porque raramente significa um só modelo)

«Multimodal» é usado para duas coisas diferentes, e confundi-las leva a uma desilusão a sério.

Um sentido é um modelo capaz de ler mais do que um tipo de entrada — texto, imagens, áudio, vídeo. O outro é um sistema capaz de produzir mais do que um tipo de saída. Quase nenhum modelo faz as duas coisas, e a distância entre esses dois factos explica por que razão construir uma «app multimodal» costuma significar ligar vários modelos entre si.

Valores verificados pela última vez a 26 de agosto de 2026.

O que é uma modalidade

Uma modalidade é um tipo de dado: texto, imagem, áudio, vídeo. Um modelo é multimodal quando lida com mais do que um.

A pergunta útil nunca é «é multimodal?» mas «que modalidades, e em que direção?» — porque ler e escrever são capacidades completamente diferentes.

O que os grandes modelos de hoje realmente aceitam

Lê na horizontal, não na vertical. Todos eles produzem apenas texto.

Família de modelosEscreve
Gemini 2.5 / 3.xtexto, imagem, ficheiro, áudio, vídeotexto
Claude Opus 5 / Sonnet 5 / Haiku 4.5texto, imagem, ficheirotexto
Família GPT-5texto, imagem, ficheirotexto
DeepSeek V4 Protextotexto

Duas coisas saltam à vista.

O Gemini lê áudio e vídeo; o Claude e o GPT não. É neste momento a diferença de capacidade mais clara entre as grandes famílias, e não é um juízo de qualidade — é uma lista de tipos de entrada aceites. Se a tua entrada for uma reunião gravada ou um clipe de vídeo, essa diferença decide o teu modelo antes de qualquer outra coisa.

Todas as famílias dessa tabela escrevem texto e mais nada. O Gemini consegue ver um vídeo e descrevê-lo. Não consegue fazer um.

Então quem faz as imagens e os vídeos?

Modelos completamente diferentes. Só no catálogo da Atlas Cloud, a divisão é:

TipoModelos com preço publicado
Vídeo196
Texto136
Imagem121
Áudio20

Quase todos esses modelos de imagem e vídeo fazem um só trabalho: entra texto, sai um tipo de média. Não conversam, não leem documentos, e não são os modelos da tabela acima.

Esta é a forma prática da IA multimodal em 2026: um modelo de texto capaz de ler vários tipos de entrada, mais geradores especializados para cada tipo de saída, unidos pelo teu código. Não um modelo que faça tudo.

Podes ver a divisão no índice de modeloschat, imagem e vídeo são listas separadas porque são famílias de modelos separadas.

Quanto custa mesmo a entrada multimodal

Ler imagens e documentos não é grátis. São convertidos em tokens como tudo o resto, e a Anthropic publica as contagens:

Portanto um pedido com vinte capturas de ecrã custa cerca de 20.000 tokens de entrada antes do teu prompt. No Claude Sonnet 5, a 2,00 $ por milhão, isso são quatro cêntimos por pedido — insignificante uma vez, real a cinquenta mil pedidos por mês.

O vídeo pesa ainda mais, o que ajuda a explicar por que menos fornecedores o aceitam.

Onde o multimodal ganha mesmo o seu lugar

Onde não

Como escolher

  1. Escreve a direção. O que entra, o que sai. Duas listas.
  2. Escolhe o leitor pelo tipo de entrada. Se houver áudio ou vídeo na lista de entrada, a família Gemini é hoje a resposta entre os três grandes.
  3. Escolhe cada gerador em separado. Os modelos de imagem, vídeo e áudio escolhem-se pelos seus próprios méritos e preços.
  4. Orçamenta as entradas. Mil tokens por imagem, dois mil por PDF, multiplicados pelo teu volume real de pedidos.

Versão curta

Explora mais na ElliSekiz

Vê as famílias lado a lado. O índice de modelos separa chat, imagem, vídeo e áudio, cada um com preços atuais.

Compara os leitores pelo preço. As tarifas por token de cada modelo de texto estão na página de comparação, na unidade em que cada fornecedor cobra.

Fontes

Todos os posts