2026-07-21

¿Qué es la IA multimodal? (Y por qué rara vez significa un solo modelo)

Multimodal significa dos cosas distintas. Un modelo que lee muchos tipos de entrada no es lo mismo que uno que los produce, y casi ninguno hace ambas cosas.

¿Qué es la IA multimodal? (Y por qué rara vez significa un solo modelo)

«Multimodal» se usa para dos cosas distintas, y confundirlas lleva a una decepción real.

Un significado es un modelo capaz de leer más de un tipo de entrada — texto, imágenes, audio, vídeo. El otro es un sistema capaz de producir más de un tipo de salida. Casi ningún modelo hace las dos cosas, y la distancia entre esos dos hechos explica por qué construir una «app multimodal» normalmente significa conectar varios modelos entre sí.

Cifras comprobadas por última vez: 26 de agosto de 2026.

Qué es una modalidad

Una modalidad es un tipo de dato: texto, imagen, audio, vídeo. Un modelo es multimodal cuando maneja más de uno.

La pregunta útil nunca es «¿es multimodal?» sino «¿qué modalidades, y en qué dirección?» — porque leer y escribir son capacidades completamente distintas.

Qué aceptan realmente los grandes modelos de hoy

Lee en horizontal, no en vertical. Todos ellos producen solo texto.

Familia de modelosLeeEscribe
Gemini 2.5 / 3.xtexto, imagen, archivo, audio, vídeotexto
Claude Opus 5 / Sonnet 5 / Haiku 4.5texto, imagen, archivotexto
Familia GPT-5texto, imagen, archivotexto
DeepSeek V4 Protextotexto

Dos cosas saltan a la vista.

Gemini lee audio y vídeo; Claude y GPT no. Es ahora mismo la diferencia de capacidad más clara entre las grandes familias, y no es un juicio de calidad: es una lista de tipos de entrada aceptados. Si tu entrada es una reunión grabada o un clip de vídeo, esa diferencia decide tu modelo antes que cualquier otra cosa.

Todas las familias de esa tabla escriben texto y nada más. Gemini puede ver un vídeo y describirlo. No puede hacer uno.

Entonces, ¿quién hace las imágenes y los vídeos?

Modelos completamente distintos. Solo en el catálogo de Atlas Cloud, el reparto es:

TipoModelos con precio publicado
Vídeo196
Texto136
Imagen121
Audio20

Casi todos esos modelos de imagen y vídeo hacen un único trabajo: entra texto, sale un tipo de medio. No conversan, no leen documentos, y no son los modelos de la tabla anterior.

Esta es la forma práctica de la IA multimodal en 2026: un modelo de texto que puede leer varios tipos de entrada, más generadores especializados para cada tipo de salida, unidos por tu código. No un modelo que lo haga todo.

Puedes ver el reparto en el índice de modeloschat, imagen y vídeo son listas separadas porque son familias de modelos separadas.

Cuánto cuesta de verdad la entrada multimodal

Leer imágenes y documentos no es gratis. Se convierten en tokens como todo lo demás, y Anthropic publica las cifras:

Así que una petición con veinte capturas de pantalla cuesta unos 20.000 tokens de entrada antes de tu prompt. En Claude Sonnet 5, a 2,00 $ por millón, son cuatro céntimos por petición: trivial una vez, real con cincuenta mil peticiones al mes.

El vídeo pesa aún más, lo que explica en parte por qué menos proveedores lo aceptan.

Dónde la multimodalidad se gana su sitio

Dónde no

Cómo elegir

  1. Anota la dirección. Qué entra, qué sale. Dos listas.
  2. Elige el lector por el tipo de entrada. Si hay audio o vídeo en la lista de entrada, la familia Gemini es hoy la respuesta entre los tres grandes.
  3. Elige cada generador por separado. Los modelos de imagen, vídeo y audio se eligen por sus propios méritos y sus propios precios.
  4. Presupuesta las entradas. Mil tokens por imagen, dos mil por PDF, multiplicado por tu volumen real de peticiones.

La versión corta

Explora más en ElliSekiz

Ve las familias una al lado de otra. El índice de modelos separa chat, imagen, vídeo y audio, cada uno con precios actuales.

Compara los lectores por precio. Las tarifas por token de cada modelo de texto están en la página de comparación, en la unidad en que factura cada proveedor.

Fuentes

Todas las entradas