2026-07-21

Что такое мультимодальный ИИ? (И почему это редко одна модель)

Мультимодальность значит две разные вещи. Модель, читающая много типов входа, — не та же, что их производит, и почти ни одна не делает и то и другое.

Что такое мультимодальный ИИ? (И почему это редко одна модель)

«Мультимодальный» употребляют в двух разных смыслах, и путаница между ними приводит к настоящему разочарованию.

Один смысл — модель, способная читать больше одного типа входа: текст, изображения, аудио, видео. Другой — система, способная производить больше одного типа выхода. Почти ни одна отдельная модель не делает и то и другое, и разрыв между этими двумя фактами объясняет, почему «собрать мультимодальное приложение» обычно означает соединить несколько моделей.

Цифры проверены 26 августа 2026 года.

Что такое модальность

Модальность — это тип данных: текст, изображение, аудио, видео. Модель мультимодальна, когда работает больше чем с одним.

Полезный вопрос — никогда не «мультимодальная ли она», а «какие модальности и в какую сторону», потому что читать и писать — совершенно разные способности.

Что сегодняшние большие модели действительно принимают

Читайте поперёк, не вниз. Каждая из них выдаёт только текст.

Семейство моделейЧитаетПишет
Gemini 2.5 / 3.xтекст, изображение, файл, аудио, видеотекст
Claude Opus 5 / Sonnet 5 / Haiku 4.5текст, изображение, файлтекст
Семейство GPT-5текст, изображение, файлтекст
DeepSeek V4 Proтексттекст

Бросаются в глаза две вещи.

Gemini читает аудио и видео; Claude и GPT — нет. Это сейчас самое отчётливое различие в возможностях между большими семействами, и это не суждение о качестве — это список принимаемых типов входа. Если ваш вход — запись совещания или видеоклип, это различие решает вопрос о модели раньше всего остального.

Каждое семейство в этой таблице пишет текст и больше ничего. Gemini может посмотреть видео и описать его. Сделать видео он не может.

Тогда кто делает картинки и видео?

Совсем другие модели. Только в каталоге Atlas Cloud расклад такой:

ТипМоделей с опубликованной ценой
Видео196
Текст136
Изображение121
Аудио20

Почти все эти модели изображений и видео делают одну работу: текст на входе, один вид медиа на выходе. Они не ведут беседу, не читают документы и не являются моделями из таблицы выше.

Вот практическая форма мультимодального ИИ в 2026 году: текстовая модель, умеющая читать несколько типов входа, плюс специализированные генераторы для каждого типа выхода, соединённые вашим кодом. Не одна модель, делающая всё.

Разделение видно в указателе моделейчат, изображения и видео — отдельные списки, потому что это отдельные семейства моделей.

Во что на самом деле обходится мультимодальный вход

Читать изображения и документы не бесплатно. Они превращаются в токены, как и всё остальное, и Anthropic публикует числа:

Значит, запрос с двадцатью скриншотами стоит около 20 000 входных токенов ещё до вашего промпта. На Claude Sonnet 5 по 2,00 $ за миллион это четыре цента за запрос — пустяк однажды, реальная сумма при пятидесяти тысячах запросов в месяц.

Видео весит ещё больше, и отчасти поэтому его принимает меньше поставщиков.

Где мультимодальность действительно оправдывает себя

Где нет

Как выбирать

  1. Запишите направление. Что на входе, что на выходе. Два списка.
  2. Выбирайте читателя по типу входа. Если в списке входов есть аудио или видео, среди большой тройки сегодня ответ — семейство Gemini.
  3. Каждый генератор выбирайте отдельно. Модели изображений, видео и аудио выбираются по собственным достоинствам и собственным ценам.
  4. Заложите входы в бюджет. Тысяча токенов на изображение, две тысячи на PDF, умноженные на ваш реальный объём запросов.

Коротко

Что посмотреть дальше на ElliSekiz

Посмотрите семейства рядом. Указатель моделей разделяет чат, изображения, видео и аудио, каждый с текущими ценами.

Сравните читателей по цене. Ставки за токены для каждой текстовой модели — на странице сравнения, в той единице, в которой считает каждый поставщик.

Источники

Все записи