«Мультимодальний» вживають у двох різних значеннях, і плутанина між ними призводить до справжнього розчарування.
Одне значення — модель, здатна читати більше одного типу входу: текст, зображення, аудіо, відео. Інше — система, здатна виробляти більше одного типу виходу. Майже жодна окрема модель не робить і те, і те, а розрив між цими двома фактами пояснює, чому «зібрати мультимодальний застосунок» зазвичай означає з'єднати кілька моделей.
Цифри востаннє перевірено 26 серпня 2026 року.
Що таке модальність
Модальність — це тип даних: текст, зображення, аудіо, відео. Модель мультимодальна, коли працює більш ніж з одним.
Корисне питання — ніколи не «чи вона мультимодальна», а «які модальності і в який бік», бо читати й писати — цілком різні здатності.
Що сьогоднішні великі моделі справді приймають
Читайте впоперек, не вниз. Кожна з них видає лише текст.
| Родина моделей | Читає | Пише |
|---|---|---|
| Gemini 2.5 / 3.x | текст, зображення, файл, аудіо, відео | текст |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | текст, зображення, файл | текст |
| Родина GPT-5 | текст, зображення, файл | текст |
| DeepSeek V4 Pro | текст | текст |
Дві речі впадають в око.
Gemini читає аудіо та відео; Claude і GPT — ні. Це зараз найвиразніша різниця в можливостях між великими родинами, і це не судження про якість — це перелік прийнятних типів входу. Якщо ваш вхід — запис наради або відеокліп, ця різниця вирішує питання моделі раніше за все інше.
Кожна родина в цій таблиці пише текст і більше нічого. Gemini може подивитися відео й описати його. Зробити відео він не може.
То хто ж робить зображення й відео?
Зовсім інші моделі. Лише в каталозі Atlas Cloud розклад такий:
| Тип | Моделей з опублікованою ціною |
|---|---|
| Відео | 196 |
| Текст | 136 |
| Зображення | 121 |
| Аудіо | 20 |
Майже всі ці моделі зображень і відео роблять одну роботу: текст на вході, один вид медіа на виході. Вони не ведуть бесіди, не читають документів і не є моделями з таблиці вище.
Ось практична форма мультимодального ШІ у 2026 році: текстова модель, що вміє читати кілька типів входу, плюс спеціалізовані генератори для кожного типу виходу, з'єднані вашим кодом. Не одна модель, що робить усе.
Поділ видно в покажчику моделей — чат, зображення і відео — окремі списки, бо це окремі родини моделей.
У що насправді обходиться мультимодальний вхід
Читати зображення й документи не безкоштовно. Вони перетворюються на токени, як і все інше, і Anthropic публікує числа:
- Одне зображення плюс коротка інструкція: 1 028 вхідних токенів
- Один PDF плюс коротка інструкція: 2 188 вхідних токенів
Отже, запит із двадцятьма знімками екрана коштує близько 20 000 вхідних токенів ще до вашого промпту. На Claude Sonnet 5 по 2,00 $ за мільйон це чотири центи за запит — дрібниця одного разу, справжня сума при п'ятдесяти тисячах запитів на місяць.
Відео важить іще більше, і почасти тому його приймає менше постачальників.
Де мультимодальність справді виправдовує себе
- Читання документів, які є зображеннями. Скани, знімки екрана, чеки, рукописні форми. Текстова модель із зором замінює OCR-конвеєр і дає раду з версткою, на якій її ніколи не вчили.
- Розуміння аудіо та відео. Підсумки нарад, розбір дзвінків, опис кліпів. Сьогодні це вказує на Gemini, бо саме ця родина приймає такі входи.
- Прив'язана генерація. Покажіть моделі фотографії вашого бренду й попросіть текст, що їм відповідає.
- Робота з інтерфейсом. Дайте моделі знімок зламаної сторінки і спитайте, що не так.
Де ні
- Коли потрібен медіавихід. Беріть спеціалізований генератор. Для цього й існують ті 196 відео- і 121 графічна модель.
- Коли вистачило б простого тексту. Модель із зором, що читає PDF, який ви могли б розпарсити, — це тисяча токенів, які не треба було витрачати.
- Коли «мультимодальний» працює на маркетинг. Модель, що читає зображення, автоматично не краща в тексті. Дивіться перелік модальностей, а не прикметник.
Як обирати
- Запишіть напрямок. Що на вході, що на виході. Два списки.
- Обирайте читача за типом входу. Якщо в переліку входів є аудіо або відео, серед великої трійки сьогодні відповідь — родина Gemini.
- Кожен генератор обирайте окремо. Моделі зображень, відео та аудіо обирають за власними перевагами і власними цінами.
- Закладіть входи в бюджет. Тисяча токенів на зображення, дві тисячі на PDF, помножені на ваш реальний обсяг запитів.
Коротко
- Мультимодальність описує те, що модель читає, те, що вона пише, або й те й те — завжди уточнюйте, що саме.
- Gemini читає аудіо та відео. Claude і GPT читають текст, зображення та файли. Усі вони пишуть лише текст.
- Медіа виробляють окремі спеціалізовані моделі: 196 відео, 121 графічна і 20 аудіо — в одного лише постачальника.
- Справжній мультимодальний застосунок — зазвичай один читач плюс один чи кілька генераторів, з'єднаних вашим кодом.
- Зображення та PDF коштують близько 1 000 і 2 000 вхідних токенів відповідно. Помножте на свій обсяг, перш ніж проєктувати навколо них.
Що подивитися далі на ElliSekiz
Подивіться родини поруч. Покажчик моделей розділяє чат, зображення, відео та аудіо, кожен із поточними цінами.
Порівняйте читачів за ціною. Ставки за токени для кожної текстової моделі — на сторінці порівняння, у тій одиниці, в якій рахує кожен постачальник.
Джерела
- API моделей OpenRouter,
https://openrouter.ai/api/v1/models(вхідні та вихідні модальності, прочитано 26.08.2026) - API каталогу моделей Atlas Cloud,
https://api.atlascloud.ai/api/v1/models(кількість за типами моделей) - Anthropic — Token counting (кількість токенів для зображення та PDF)
