„Multimodalny" bywa używany w dwóch różnych znaczeniach, a ich pomylenie prowadzi do prawdziwego rozczarowania.
Pierwsze znaczenie to model, który potrafi czytać więcej niż jeden rodzaj wejścia — tekst, obrazy, dźwięk, wideo. Drugie to system, który potrafi wytwarzać więcej niż jeden rodzaj wyjścia. Prawie żaden pojedynczy model nie robi obu rzeczy, a przepaść między tymi faktami tłumaczy, dlaczego zbudowanie „aplikacji multimodalnej" zwykle oznacza połączenie kilku modeli ze sobą.
Dane sprawdzone ostatnio 26 sierpnia 2026.
Czym jest modalność
Modalność to typ danych: tekst, obraz, dźwięk, wideo. Model jest multimodalny, gdy obsługuje więcej niż jeden.
Użyteczne pytanie nigdy nie brzmi „czy jest multimodalny", tylko „jakie modalności i w którą stronę" — bo czytanie i pisanie to zupełnie różne zdolności.
Co dzisiejsze duże modele naprawdę przyjmują
Czytaj w poprzek, nie w dół. Każdy z nich wypisuje wyłącznie tekst.
| Rodzina modeli | Czyta | Pisze |
|---|---|---|
| Gemini 2.5 / 3.x | tekst, obraz, plik, dźwięk, wideo | tekst |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | tekst, obraz, plik | tekst |
| Rodzina GPT-5 | tekst, obraz, plik | tekst |
| DeepSeek V4 Pro | tekst | tekst |
Dwie rzeczy rzucają się w oczy.
Gemini czyta dźwięk i wideo; Claude i GPT nie. To w tej chwili najwyraźniejsza różnica możliwości między dużymi rodzinami i nie jest to ocena jakości — to lista przyjmowanych typów wejścia. Jeśli twoim wejściem jest nagrane spotkanie albo klip wideo, ta różnica przesądza o modelu, zanim cokolwiek innego zdąży.
Każda rodzina w tej tabeli pisze tekst i nic poza tym. Gemini potrafi obejrzeć wideo i je opisać. Nie potrafi go zrobić.
Kto więc robi obrazy i wideo?
Zupełnie inne modele. Już w samym katalogu Atlas Cloud podział wygląda tak:
| Typ | Modele z opublikowaną ceną |
|---|---|
| Wideo | 196 |
| Tekst | 136 |
| Obraz | 121 |
| Dźwięk | 20 |
Niemal wszystkie te modele obrazu i wideo robią jedną rzecz: tekst na wejściu, jeden rodzaj mediów na wyjściu. Nie prowadzą rozmowy, nie czytają dokumentów i nie są modelami z tabeli powyżej.
Taki jest praktyczny kształt multimodalnej AI w 2026: model tekstowy zdolny czytać kilka typów wejścia plus wyspecjalizowane generatory dla każdego typu wyjścia, spięte twoim kodem. Nie jeden model, który robi wszystko.
Podział widać w indeksie modeli — czat, obraz i wideo to osobne listy, bo to osobne rodziny modeli.
Ile naprawdę kosztuje wejście multimodalne
Czytanie obrazów i dokumentów nie jest darmowe. Zamieniają się w tokeny jak wszystko inne, a Anthropic publikuje liczby:
- Jeden obraz plus krótka instrukcja: 1 028 tokenów wejściowych
- Jeden PDF plus krótka instrukcja: 2 188 tokenów wejściowych
Zapytanie z dwudziestoma zrzutami ekranu kosztuje więc około 20 000 tokenów wejściowych, zanim zacznie się twój prompt. Na Claude Sonnet 5 po 2,00 $ za milion to cztery centy za zapytanie — nieistotne raz, realne przy pięćdziesięciu tysiącach zapytań miesięcznie.
Wideo waży jeszcze więcej, co po części tłumaczy, dlaczego przyjmuje je mniej dostawców.
Gdzie multimodalność naprawdę zarabia na swoje miejsce
- Czytanie dokumentów, które są obrazami. Skany, zrzuty ekranu, paragony, formularze pisane ręcznie. Model tekstowy z widzeniem zastępuje pipeline OCR i radzi sobie z układami, na których nigdy go nie trenowano.
- Rozumienie dźwięku i wideo. Podsumowania spotkań, analiza rozmów, opisywanie klipów. Dziś wskazuje to na Gemini, bo to ta rodzina przyjmuje takie wejścia.
- Generowanie osadzone. Pokaż modelowi zdjęcia swojej marki i poproś o teksty, które do nich pasują.
- Praca nad interfejsem. Daj modelowi zrzut zepsutej strony i zapytaj, co jest nie tak.
Gdzie nie
- Gdy potrzebujesz mediów na wyjściu. Sięgnij po wyspecjalizowany generator. Po to są te 196 modeli wideo i 121 modeli obrazu.
- Gdy wystarczyłby zwykły tekst. Model wizyjny czytający PDF, który mogłeś sparsować, to tysiąc tokenów, których nie musiałeś wydać.
- Gdy „multimodalny" pracuje na marketing. Model, który czyta obrazy, nie jest automatycznie lepszy w tekście. Sprawdź listę modalności, nie przymiotnik.
Jak wybierać
- Zapisz kierunek. Co wchodzi, co wychodzi. Dwie listy.
- Wybierz czytelnika po typie wejścia. Jeśli na liście wejść jest dźwięk albo wideo, rodzina Gemini jest obecnie odpowiedzią wśród wielkiej trójki.
- Wybierz każdy generator osobno. Modele obrazu, wideo i dźwięku wybiera się po ich własnych zaletach i własnych cenach.
- Zaplanuj budżet wejść. Tysiąc tokenów na obraz, dwa tysiące na PDF, pomnożone przez twój realny wolumen zapytań.
Krótka wersja
- Multimodalny opisuje to, co model czyta, to, co pisze, albo jedno i drugie — zawsze pytaj które.
- Gemini czyta dźwięk i wideo. Claude i GPT czytają tekst, obrazy i pliki. Wszystkie piszą wyłącznie tekst.
- Media wytwarzają osobne wyspecjalizowane modele: 196 wideo, 121 obrazu i 20 dźwięku u jednego tylko dostawcy.
- Prawdziwa aplikacja multimodalna to zwykle jeden czytelnik plus jeden lub kilka generatorów, spiętych twoim kodem.
- Obrazy i pliki PDF kosztują odpowiednio około 1 000 i 2 000 tokenów wejściowych. Pomnóż przez swój wolumen, zanim zaprojektujesz coś wokół nich.
Zobacz więcej na ElliSekiz
Zobacz rodziny obok siebie. Indeks modeli rozdziela czat, obraz, wideo i dźwięk, każdy z aktualnymi cenami.
Porównaj czytelników po cenie. Stawki za tokeny dla każdego modelu tekstowego są na stronie porównania, w jednostce, w której rozlicza każdy dostawca.
Źródła
- API modeli OpenRouter,
https://openrouter.ai/api/v1/models(modalności wejścia i wyjścia, odczytane 26.08.2026) - API katalogu modeli Atlas Cloud,
https://api.atlascloud.ai/api/v1/models(liczby według typu modelu) - Anthropic — Token counting (liczby tokenów obrazu i PDF)
