2026-07-21

Що таке мультимодальний ШІ? (І чому це рідко одна модель)

Мультимодальність означає дві різні речі. Модель, що читає багато типів входу, — не та сама, що їх виробляє, і майже жодна не робить і те, і те.

Що таке мультимодальний ШІ? (І чому це рідко одна модель)

«Мультимодальний» вживають у двох різних значеннях, і плутанина між ними призводить до справжнього розчарування.

Одне значення — модель, здатна читати більше одного типу входу: текст, зображення, аудіо, відео. Інше — система, здатна виробляти більше одного типу виходу. Майже жодна окрема модель не робить і те, і те, а розрив між цими двома фактами пояснює, чому «зібрати мультимодальний застосунок» зазвичай означає з'єднати кілька моделей.

Цифри востаннє перевірено 26 серпня 2026 року.

Що таке модальність

Модальність — це тип даних: текст, зображення, аудіо, відео. Модель мультимодальна, коли працює більш ніж з одним.

Корисне питання — ніколи не «чи вона мультимодальна», а «які модальності і в який бік», бо читати й писати — цілком різні здатності.

Що сьогоднішні великі моделі справді приймають

Читайте впоперек, не вниз. Кожна з них видає лише текст.

Родина моделейЧитаєПише
Gemini 2.5 / 3.xтекст, зображення, файл, аудіо, відеотекст
Claude Opus 5 / Sonnet 5 / Haiku 4.5текст, зображення, файлтекст
Родина GPT-5текст, зображення, файлтекст
DeepSeek V4 Proтексттекст

Дві речі впадають в око.

Gemini читає аудіо та відео; Claude і GPT — ні. Це зараз найвиразніша різниця в можливостях між великими родинами, і це не судження про якість — це перелік прийнятних типів входу. Якщо ваш вхід — запис наради або відеокліп, ця різниця вирішує питання моделі раніше за все інше.

Кожна родина в цій таблиці пише текст і більше нічого. Gemini може подивитися відео й описати його. Зробити відео він не може.

То хто ж робить зображення й відео?

Зовсім інші моделі. Лише в каталозі Atlas Cloud розклад такий:

ТипМоделей з опублікованою ціною
Відео196
Текст136
Зображення121
Аудіо20

Майже всі ці моделі зображень і відео роблять одну роботу: текст на вході, один вид медіа на виході. Вони не ведуть бесіди, не читають документів і не є моделями з таблиці вище.

Ось практична форма мультимодального ШІ у 2026 році: текстова модель, що вміє читати кілька типів входу, плюс спеціалізовані генератори для кожного типу виходу, з'єднані вашим кодом. Не одна модель, що робить усе.

Поділ видно в покажчику моделейчат, зображення і відео — окремі списки, бо це окремі родини моделей.

У що насправді обходиться мультимодальний вхід

Читати зображення й документи не безкоштовно. Вони перетворюються на токени, як і все інше, і Anthropic публікує числа:

Отже, запит із двадцятьма знімками екрана коштує близько 20 000 вхідних токенів ще до вашого промпту. На Claude Sonnet 5 по 2,00 $ за мільйон це чотири центи за запит — дрібниця одного разу, справжня сума при п'ятдесяти тисячах запитів на місяць.

Відео важить іще більше, і почасти тому його приймає менше постачальників.

Де мультимодальність справді виправдовує себе

Де ні

Як обирати

  1. Запишіть напрямок. Що на вході, що на виході. Два списки.
  2. Обирайте читача за типом входу. Якщо в переліку входів є аудіо або відео, серед великої трійки сьогодні відповідь — родина Gemini.
  3. Кожен генератор обирайте окремо. Моделі зображень, відео та аудіо обирають за власними перевагами і власними цінами.
  4. Закладіть входи в бюджет. Тисяча токенів на зображення, дві тисячі на PDF, помножені на ваш реальний обсяг запитів.

Коротко

Що подивитися далі на ElliSekiz

Подивіться родини поруч. Покажчик моделей розділяє чат, зображення, відео та аудіо, кожен із поточними цінами.

Порівняйте читачів за ціною. Ставки за токени для кожної текстової моделі — на сторінці порівняння, у тій одиниці, в якій рахує кожен постачальник.

Джерела

Усі записи