"Multimodal" dipakai untuk dua hal yang berbeda, dan mencampuradukkannya berujung pada kekecewaan sungguhan.
Makna pertama adalah model yang bisa membaca lebih dari satu jenis masukan — teks, gambar, audio, video. Makna kedua adalah sistem yang bisa menghasilkan lebih dari satu jenis keluaran. Nyaris tidak ada satu model pun yang melakukan keduanya, dan jurang di antara dua kenyataan itulah yang menjelaskan kenapa membangun "aplikasi multimodal" biasanya berarti merangkai beberapa model.
Angka terakhir diperiksa: 26 Agustus 2026.
Apa itu modalitas
Modalitas adalah jenis data: teks, gambar, audio, video. Sebuah model disebut multimodal ketika ia menangani lebih dari satu.
Pertanyaan yang berguna tidak pernah "apakah ini multimodal" melainkan "modalitas apa saja, ke arah mana" — karena membaca dan menulis adalah kemampuan yang sama sekali berbeda.
Apa yang sebenarnya diterima model-model besar hari ini
Baca melintang, bukan ke bawah. Setiap model di sini hanya mengeluarkan teks.
| Keluarga model | Membaca | Menulis |
|---|---|---|
| Gemini 2.5 / 3.x | teks, gambar, berkas, audio, video | teks |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | teks, gambar, berkas | teks |
| Keluarga GPT-5 | teks, gambar, berkas | teks |
| DeepSeek V4 Pro | teks | teks |
Dua hal langsung menonjol.
Gemini membaca audio dan video; Claude dan GPT tidak. Itu perbedaan kemampuan paling jelas antar keluarga besar saat ini, dan itu bukan penilaian mutu — itu daftar jenis masukan yang diterima. Kalau masukanmu adalah rapat yang terekam atau klip video, perbedaan itu menentukan modelmu sebelum apa pun yang lain.
Setiap keluarga di tabel itu menulis teks dan tidak lebih. Gemini bisa menonton video dan menggambarkannya. Ia tidak bisa membuatnya.
Lalu siapa yang membuat gambar dan videonya?
Model yang sama sekali lain. Di katalog Atlas Cloud saja, pembagiannya:
| Jenis | Model dengan harga terbit |
|---|---|
| Video | 196 |
| Teks | 136 |
| Gambar | 121 |
| Audio | 20 |
Hampir semua model gambar dan video itu mengerjakan satu tugas: teks masuk, satu jenis media keluar. Mereka tidak bercakap-cakap, tidak membaca dokumen, dan bukan model yang ada di tabel di atas.
Inilah bentuk praktis AI multimodal pada 2026: sebuah model teks yang bisa membaca beberapa jenis masukan, ditambah generator khusus untuk tiap jenis keluaran, disambung oleh kodemu. Bukan satu model yang mengerjakan semuanya.
Pembagiannya bisa kamu lihat di indeks model — obrolan, gambar dan video adalah daftar terpisah karena memang keluarga model yang terpisah.
Berapa sebenarnya biaya masukan multimodal
Membaca gambar dan dokumen tidak gratis. Semuanya diubah menjadi token seperti yang lain, dan Anthropic menerbitkan angkanya:
- Satu gambar plus satu instruksi pendek: 1.028 token masukan
- Satu PDF plus satu instruksi pendek: 2.188 token masukan
Jadi permintaan dengan dua puluh tangkapan layar memakan sekitar 20.000 token masukan sebelum prompt-mu dimulai. Di Claude Sonnet 5 dengan $2,00 per juta, itu empat sen per permintaan — remeh sekali jalan, nyata pada lima puluh ribu permintaan sebulan.
Video lebih berat lagi, dan itu sebagian alasan kenapa lebih sedikit penyedia yang menerimanya.
Di mana multimodal benar-benar layak
- Membaca dokumen yang sebenarnya gambar. Pindaian, tangkapan layar, struk, formulir tulisan tangan. Model teks yang bisa melihat menggantikan pipeline OCR dan sanggup menangani tata letak yang tak pernah dilatihkan padanya.
- Memahami audio dan video. Ringkasan rapat, analisis panggilan, mendeskripsikan klip. Hari ini itu mengarah ke Gemini, karena keluarga itulah yang menerima masukan tersebut.
- Generasi berlandas. Tunjukkan foto merekmu pada model dan minta teks yang serasi dengannya.
- Pekerjaan antarmuka. Beri model tangkapan layar halaman yang rusak dan tanyakan apa yang salah.
Di mana tidak
- Ketika kamu butuh media sebagai keluaran. Pakailah generator khusus. Untuk itulah 196 model video dan 121 model gambar itu ada.
- Ketika teks biasa sudah cukup. Model penglihatan yang membaca PDF yang bisa kamu parse sendiri adalah seribu token yang tak perlu kamu keluarkan.
- Ketika "multimodal" sedang bekerja untuk pemasaran. Model yang membaca gambar tidak otomatis lebih baik pada teks. Periksa daftar modalitasnya, bukan kata sifatnya.
Cara memilih
- Tuliskan arahnya. Apa yang masuk, apa yang keluar. Dua daftar.
- Pilih pembacanya berdasarkan jenis masukan. Kalau ada audio atau video di daftar masukan, keluarga Gemini saat ini adalah jawabannya di antara tiga besar.
- Pilih tiap generator secara terpisah. Model gambar, video dan audio dipilih atas kelebihannya sendiri dan harganya sendiri.
- Anggarkan masukannya. Seribu token per gambar, dua ribu per PDF, dikalikan volume permintaanmu yang sebenarnya.
Versi singkat
- Multimodal menggambarkan apa yang dibaca sebuah model, apa yang ditulisnya, atau keduanya — selalu tanyakan yang mana.
- Gemini membaca audio dan video. Claude dan GPT membaca teks, gambar dan berkas. Semuanya hanya menulis teks.
- Media dihasilkan oleh model khusus yang terpisah: 196 video, 121 gambar dan 20 audio di satu penyedia saja.
- Aplikasi multimodal yang sungguhan biasanya satu pembaca ditambah satu atau lebih generator, disambung oleh kodemu.
- Gambar dan PDF memakan sekitar 1.000 dan 2.000 token masukan. Kalikan dengan volumemu sebelum merancang di sekitarnya.
Jelajahi lebih jauh di ElliSekiz
Lihat keluarganya berdampingan. Indeks model memisahkan obrolan, gambar, video dan audio, masing-masing dengan harga terkini.
Bandingkan para pembaca dari harganya. Tarif token setiap model teks ada di halaman perbandingan, dalam satuan yang dipakai tiap penyedia untuk menagih.
Sumber
- OpenRouter models API,
https://openrouter.ai/api/v1/models(modalitas masukan dan keluaran, dibaca 26-08-2026) - Atlas Cloud model catalogue API,
https://api.atlascloud.ai/api/v1/models(jumlah menurut jenis model) - Anthropic — Token counting (jumlah token gambar dan PDF)
