«Мультимодальный» употребляют в двух разных смыслах, и путаница между ними приводит к настоящему разочарованию.
Один смысл — модель, способная читать больше одного типа входа: текст, изображения, аудио, видео. Другой — система, способная производить больше одного типа выхода. Почти ни одна отдельная модель не делает и то и другое, и разрыв между этими двумя фактами объясняет, почему «собрать мультимодальное приложение» обычно означает соединить несколько моделей.
Цифры проверены 26 августа 2026 года.
Что такое модальность
Модальность — это тип данных: текст, изображение, аудио, видео. Модель мультимодальна, когда работает больше чем с одним.
Полезный вопрос — никогда не «мультимодальная ли она», а «какие модальности и в какую сторону», потому что читать и писать — совершенно разные способности.
Что сегодняшние большие модели действительно принимают
Читайте поперёк, не вниз. Каждая из них выдаёт только текст.
| Семейство моделей | Читает | Пишет |
|---|---|---|
| Gemini 2.5 / 3.x | текст, изображение, файл, аудио, видео | текст |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | текст, изображение, файл | текст |
| Семейство GPT-5 | текст, изображение, файл | текст |
| DeepSeek V4 Pro | текст | текст |
Бросаются в глаза две вещи.
Gemini читает аудио и видео; Claude и GPT — нет. Это сейчас самое отчётливое различие в возможностях между большими семействами, и это не суждение о качестве — это список принимаемых типов входа. Если ваш вход — запись совещания или видеоклип, это различие решает вопрос о модели раньше всего остального.
Каждое семейство в этой таблице пишет текст и больше ничего. Gemini может посмотреть видео и описать его. Сделать видео он не может.
Тогда кто делает картинки и видео?
Совсем другие модели. Только в каталоге Atlas Cloud расклад такой:
| Тип | Моделей с опубликованной ценой |
|---|---|
| Видео | 196 |
| Текст | 136 |
| Изображение | 121 |
| Аудио | 20 |
Почти все эти модели изображений и видео делают одну работу: текст на входе, один вид медиа на выходе. Они не ведут беседу, не читают документы и не являются моделями из таблицы выше.
Вот практическая форма мультимодального ИИ в 2026 году: текстовая модель, умеющая читать несколько типов входа, плюс специализированные генераторы для каждого типа выхода, соединённые вашим кодом. Не одна модель, делающая всё.
Разделение видно в указателе моделей — чат, изображения и видео — отдельные списки, потому что это отдельные семейства моделей.
Во что на самом деле обходится мультимодальный вход
Читать изображения и документы не бесплатно. Они превращаются в токены, как и всё остальное, и Anthropic публикует числа:
- Одно изображение плюс короткая инструкция: 1 028 входных токенов
- Один PDF плюс короткая инструкция: 2 188 входных токенов
Значит, запрос с двадцатью скриншотами стоит около 20 000 входных токенов ещё до вашего промпта. На Claude Sonnet 5 по 2,00 $ за миллион это четыре цента за запрос — пустяк однажды, реальная сумма при пятидесяти тысячах запросов в месяц.
Видео весит ещё больше, и отчасти поэтому его принимает меньше поставщиков.
Где мультимодальность действительно оправдывает себя
- Чтение документов, которые являются изображениями. Сканы, скриншоты, чеки, рукописные формы. Текстовая модель со зрением заменяет OCR-конвейер и справляется с вёрсткой, на которой её никогда не учили.
- Понимание аудио и видео. Резюме совещаний, разбор звонков, описание клипов. Сегодня это указывает на Gemini, потому что именно это семейство принимает такие входы.
- Привязанная генерация. Покажите модели фотографии вашего бренда и попросите текст, который им соответствует.
- Работа с интерфейсом. Дайте модели скриншот сломанной страницы и спросите, что не так.
Где нет
- Когда нужен медиавыход. Берите специализированный генератор. Для этого и существуют те 196 видео- и 121 графическая модель.
- Когда хватило бы простого текста. Модель со зрением, читающая PDF, который вы могли бы распарсить, — это тысяча токенов, которые не нужно было тратить.
- Когда «мультимодальный» работает на маркетинг. Модель, читающая изображения, автоматически не лучше в тексте. Смотрите список модальностей, а не прилагательное.
Как выбирать
- Запишите направление. Что на входе, что на выходе. Два списка.
- Выбирайте читателя по типу входа. Если в списке входов есть аудио или видео, среди большой тройки сегодня ответ — семейство Gemini.
- Каждый генератор выбирайте отдельно. Модели изображений, видео и аудио выбираются по собственным достоинствам и собственным ценам.
- Заложите входы в бюджет. Тысяча токенов на изображение, две тысячи на PDF, умноженные на ваш реальный объём запросов.
Коротко
- Мультимодальность описывает то, что модель читает, то, что она пишет, или и то и другое — всегда уточняйте, что именно.
- Gemini читает аудио и видео. Claude и GPT читают текст, изображения и файлы. Все они пишут только текст.
- Медиа производят отдельные специализированные модели: 196 видео, 121 графическая и 20 аудио — у одного только поставщика.
- Настоящее мультимодальное приложение — обычно один читатель плюс один или несколько генераторов, соединённых вашим кодом.
- Изображения и PDF стоят около 1 000 и 2 000 входных токенов соответственно. Умножьте на свой объём, прежде чем проектировать вокруг них.
Что посмотреть дальше на ElliSekiz
Посмотрите семейства рядом. Указатель моделей разделяет чат, изображения, видео и аудио, каждый с текущими ценами.
Сравните читателей по цене. Ставки за токены для каждой текстовой модели — на странице сравнения, в той единице, в которой считает каждый поставщик.
Источники
- API моделей OpenRouter,
https://openrouter.ai/api/v1/models(входные и выходные модальности, прочитано 26.08.2026) - API каталога моделей Atlas Cloud,
https://api.atlascloud.ai/api/v1/models(количество по типам моделей) - Anthropic — Token counting (число токенов для изображения и PDF)
