«Multimodal» se usa para dos cosas distintas, y confundirlas lleva a una decepción real.
Un significado es un modelo capaz de leer más de un tipo de entrada — texto, imágenes, audio, vídeo. El otro es un sistema capaz de producir más de un tipo de salida. Casi ningún modelo hace las dos cosas, y la distancia entre esos dos hechos explica por qué construir una «app multimodal» normalmente significa conectar varios modelos entre sí.
Cifras comprobadas por última vez: 26 de agosto de 2026.
Qué es una modalidad
Una modalidad es un tipo de dato: texto, imagen, audio, vídeo. Un modelo es multimodal cuando maneja más de uno.
La pregunta útil nunca es «¿es multimodal?» sino «¿qué modalidades, y en qué dirección?» — porque leer y escribir son capacidades completamente distintas.
Qué aceptan realmente los grandes modelos de hoy
Lee en horizontal, no en vertical. Todos ellos producen solo texto.
| Familia de modelos | Lee | Escribe |
|---|---|---|
| Gemini 2.5 / 3.x | texto, imagen, archivo, audio, vídeo | texto |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | texto, imagen, archivo | texto |
| Familia GPT-5 | texto, imagen, archivo | texto |
| DeepSeek V4 Pro | texto | texto |
Dos cosas saltan a la vista.
Gemini lee audio y vídeo; Claude y GPT no. Es ahora mismo la diferencia de capacidad más clara entre las grandes familias, y no es un juicio de calidad: es una lista de tipos de entrada aceptados. Si tu entrada es una reunión grabada o un clip de vídeo, esa diferencia decide tu modelo antes que cualquier otra cosa.
Todas las familias de esa tabla escriben texto y nada más. Gemini puede ver un vídeo y describirlo. No puede hacer uno.
Entonces, ¿quién hace las imágenes y los vídeos?
Modelos completamente distintos. Solo en el catálogo de Atlas Cloud, el reparto es:
| Tipo | Modelos con precio publicado |
|---|---|
| Vídeo | 196 |
| Texto | 136 |
| Imagen | 121 |
| Audio | 20 |
Casi todos esos modelos de imagen y vídeo hacen un único trabajo: entra texto, sale un tipo de medio. No conversan, no leen documentos, y no son los modelos de la tabla anterior.
Esta es la forma práctica de la IA multimodal en 2026: un modelo de texto que puede leer varios tipos de entrada, más generadores especializados para cada tipo de salida, unidos por tu código. No un modelo que lo haga todo.
Puedes ver el reparto en el índice de modelos — chat, imagen y vídeo son listas separadas porque son familias de modelos separadas.
Cuánto cuesta de verdad la entrada multimodal
Leer imágenes y documentos no es gratis. Se convierten en tokens como todo lo demás, y Anthropic publica las cifras:
- Una imagen más una instrucción breve: 1.028 tokens de entrada
- Un PDF más una instrucción breve: 2.188 tokens de entrada
Así que una petición con veinte capturas de pantalla cuesta unos 20.000 tokens de entrada antes de tu prompt. En Claude Sonnet 5, a 2,00 $ por millón, son cuatro céntimos por petición: trivial una vez, real con cincuenta mil peticiones al mes.
El vídeo pesa aún más, lo que explica en parte por qué menos proveedores lo aceptan.
Dónde la multimodalidad se gana su sitio
- Leer documentos que son imágenes. Escaneos, capturas, recibos, formularios manuscritos. Un modelo de texto con visión sustituye una tubería de OCR y se maneja con maquetaciones para las que nunca fue entrenado.
- Comprensión de audio y vídeo. Resúmenes de reuniones, análisis de llamadas, describir clips. Hoy esto apunta a Gemini, porque es la familia que acepta esas entradas.
- Generación anclada. Enséñale a un modelo tus fotos de marca y pídele textos que encajen con ellas.
- Trabajo de interfaz. Dale a un modelo la captura de una página rota y pregúntale qué falla.
Dónde no
- Cuando necesitas medios de salida. Recurre a un generador especializado. Para eso están los 196 modelos de vídeo y los 121 de imagen.
- Cuando bastaba con texto plano. Un modelo de visión leyendo un PDF que podrías haber parseado son mil tokens que no hacía falta gastar.
- Cuando «multimodal» está haciendo labor de marketing. Un modelo que lee imágenes no es automáticamente mejor en texto. Mira la lista de modalidades, no el adjetivo.
Cómo elegir
- Anota la dirección. Qué entra, qué sale. Dos listas.
- Elige el lector por el tipo de entrada. Si hay audio o vídeo en la lista de entrada, la familia Gemini es hoy la respuesta entre los tres grandes.
- Elige cada generador por separado. Los modelos de imagen, vídeo y audio se eligen por sus propios méritos y sus propios precios.
- Presupuesta las entradas. Mil tokens por imagen, dos mil por PDF, multiplicado por tu volumen real de peticiones.
La versión corta
- Multimodal describe lo que un modelo lee, lo que escribe, o ambas cosas — pregunta siempre cuál.
- Gemini lee audio y vídeo. Claude y GPT leen texto, imágenes y archivos. Todos escriben solo texto.
- Los medios los producen modelos especializados aparte: 196 de vídeo, 121 de imagen y 20 de audio en un solo proveedor.
- Una aplicación multimodal real suele ser un lector más uno o varios generadores, unidos por tu código.
- Imágenes y PDF cuestan unos 1.000 y 2.000 tokens de entrada respectivamente. Multiplica por tu volumen antes de diseñar alrededor de ellos.
Explora más en ElliSekiz
Ve las familias una al lado de otra. El índice de modelos separa chat, imagen, vídeo y audio, cada uno con precios actuales.
Compara los lectores por precio. Las tarifas por token de cada modelo de texto están en la página de comparación, en la unidad en que factura cada proveedor.
Fuentes
- API de modelos de OpenRouter,
https://openrouter.ai/api/v1/models(modalidades de entrada y salida, consultada el 26-08-2026) - API del catálogo de modelos de Atlas Cloud,
https://api.atlascloud.ai/api/v1/models(recuentos por tipo de modelo) - Anthropic — Token counting (recuentos de tokens de imagen y PDF)
