2026-07-21

Apa itu AI multimodal? (Dan kenapa itu jarang berarti satu model)

Multimodal berarti dua hal berbeda. Model yang membaca banyak jenis masukan bukanlah yang menghasilkannya, dan nyaris tak ada yang melakukan keduanya.

Apa itu AI multimodal? (Dan kenapa itu jarang berarti satu model)

"Multimodal" dipakai untuk dua hal yang berbeda, dan mencampuradukkannya berujung pada kekecewaan sungguhan.

Makna pertama adalah model yang bisa membaca lebih dari satu jenis masukan — teks, gambar, audio, video. Makna kedua adalah sistem yang bisa menghasilkan lebih dari satu jenis keluaran. Nyaris tidak ada satu model pun yang melakukan keduanya, dan jurang di antara dua kenyataan itulah yang menjelaskan kenapa membangun "aplikasi multimodal" biasanya berarti merangkai beberapa model.

Angka terakhir diperiksa: 26 Agustus 2026.

Apa itu modalitas

Modalitas adalah jenis data: teks, gambar, audio, video. Sebuah model disebut multimodal ketika ia menangani lebih dari satu.

Pertanyaan yang berguna tidak pernah "apakah ini multimodal" melainkan "modalitas apa saja, ke arah mana" — karena membaca dan menulis adalah kemampuan yang sama sekali berbeda.

Apa yang sebenarnya diterima model-model besar hari ini

Baca melintang, bukan ke bawah. Setiap model di sini hanya mengeluarkan teks.

Keluarga modelMembacaMenulis
Gemini 2.5 / 3.xteks, gambar, berkas, audio, videoteks
Claude Opus 5 / Sonnet 5 / Haiku 4.5teks, gambar, berkasteks
Keluarga GPT-5teks, gambar, berkasteks
DeepSeek V4 Proteksteks

Dua hal langsung menonjol.

Gemini membaca audio dan video; Claude dan GPT tidak. Itu perbedaan kemampuan paling jelas antar keluarga besar saat ini, dan itu bukan penilaian mutu — itu daftar jenis masukan yang diterima. Kalau masukanmu adalah rapat yang terekam atau klip video, perbedaan itu menentukan modelmu sebelum apa pun yang lain.

Setiap keluarga di tabel itu menulis teks dan tidak lebih. Gemini bisa menonton video dan menggambarkannya. Ia tidak bisa membuatnya.

Lalu siapa yang membuat gambar dan videonya?

Model yang sama sekali lain. Di katalog Atlas Cloud saja, pembagiannya:

JenisModel dengan harga terbit
Video196
Teks136
Gambar121
Audio20

Hampir semua model gambar dan video itu mengerjakan satu tugas: teks masuk, satu jenis media keluar. Mereka tidak bercakap-cakap, tidak membaca dokumen, dan bukan model yang ada di tabel di atas.

Inilah bentuk praktis AI multimodal pada 2026: sebuah model teks yang bisa membaca beberapa jenis masukan, ditambah generator khusus untuk tiap jenis keluaran, disambung oleh kodemu. Bukan satu model yang mengerjakan semuanya.

Pembagiannya bisa kamu lihat di indeks modelobrolan, gambar dan video adalah daftar terpisah karena memang keluarga model yang terpisah.

Berapa sebenarnya biaya masukan multimodal

Membaca gambar dan dokumen tidak gratis. Semuanya diubah menjadi token seperti yang lain, dan Anthropic menerbitkan angkanya:

Jadi permintaan dengan dua puluh tangkapan layar memakan sekitar 20.000 token masukan sebelum prompt-mu dimulai. Di Claude Sonnet 5 dengan $2,00 per juta, itu empat sen per permintaan — remeh sekali jalan, nyata pada lima puluh ribu permintaan sebulan.

Video lebih berat lagi, dan itu sebagian alasan kenapa lebih sedikit penyedia yang menerimanya.

Di mana multimodal benar-benar layak

Di mana tidak

Cara memilih

  1. Tuliskan arahnya. Apa yang masuk, apa yang keluar. Dua daftar.
  2. Pilih pembacanya berdasarkan jenis masukan. Kalau ada audio atau video di daftar masukan, keluarga Gemini saat ini adalah jawabannya di antara tiga besar.
  3. Pilih tiap generator secara terpisah. Model gambar, video dan audio dipilih atas kelebihannya sendiri dan harganya sendiri.
  4. Anggarkan masukannya. Seribu token per gambar, dua ribu per PDF, dikalikan volume permintaanmu yang sebenarnya.

Versi singkat

Jelajahi lebih jauh di ElliSekiz

Lihat keluarganya berdampingan. Indeks model memisahkan obrolan, gambar, video dan audio, masing-masing dengan harga terkini.

Bandingkan para pembaca dari harganya. Tarif token setiap model teks ada di halaman perbandingan, dalam satuan yang dipakai tiap penyedia untuk menagih.

Sumber

Semua tulisan