2026-07-21

マルチモーダル AI とは? (そしてなぜ一つのモデルを指すことは稀なのか)

マルチモーダルには二つの意味があります。多くの入力形式を読めるモデルと、それらを作れるモデルは別物で、両方こなすものはほとんどありません。

マルチモーダル AI とは? (そしてなぜ一つのモデルを指すことは稀なのか)

「マルチモーダル」は二つの別のことを指して使われ、混同すると本当に落胆します。

ひとつは、複数の種類の入力を 読める モデルという意味——テキスト、画像、音声、動画。もうひとつは、複数の種類の出力を 作れる システムという意味です。両方をこなす単一のモデルはほとんどなく、この二つの事実のあいだの隔たりが、「マルチモーダルなアプリを作る」がたいてい複数のモデルを結線することを意味する理由です。

数値の最終確認: 2026年8月26日。

モダリティとは何か

モダリティとはデータの種類です。テキスト、画像、音声、動画。モデルがそのうち二つ以上を扱えるとき、そのモデルはマルチモーダルです。

役に立つ問いは「マルチモーダルかどうか」ではなく、つねに 「どのモダリティを、どちら向きに」 です——読むことと書くことはまったく別の能力だからです。

今日の大規模モデルが実際に受け取るもの

縦ではなく横に読んでください。ここに挙げたどれもが、出力はテキストだけです。

モデルファミリー読む書く
Gemini 2.5 / 3.xテキスト、画像、ファイル、音声、動画テキスト
Claude Opus 5 / Sonnet 5 / Haiku 4.5テキスト、画像、ファイルテキスト
GPT-5 ファミリーテキスト、画像、ファイルテキスト
DeepSeek V4 Proテキストテキスト

二つのことが目を引きます。

Gemini は音声と動画を読む。Claude と GPT は読まない。 これが現時点で大手ファミリー間の最も明快な能力差であり、品質の評価ではありません——受け付ける入力形式の一覧です。あなたの入力が録音された会議や動画クリップなら、この違いが何よりも先にモデルを決めてしまいます。

この表のどのファミリーも、書くのはテキストだけです。 Gemini は動画を見て説明できます。作ることはできません。

では画像や動画は誰が作るのか

まったく別のモデルです。Atlas Cloud のカタログだけでも、内訳はこうなります:

種類価格が公開されているモデル数
動画196
テキスト136
画像121
音声20

これら画像・動画モデルのほとんどは仕事がひとつです。テキストを入れ、一種類のメディアを出す。会話はせず、文書も読まず、上の表のモデルとは別物です。

これが 2026 年におけるマルチモーダル AI の実務上の姿です: 複数の入力形式を読めるテキストモデルに、出力形式ごとの専用ジェネレーターを足し、あなたのコードでつなぐ。何でもこなす一つのモデルではありません。

その分かれ方は モデル一覧 で見られます——チャット画像動画 が別々のリストなのは、別々のモデルファミリーだからです。

マルチモーダル入力の実際のコスト

画像や文書を読むのは無料ではありません。ほかのすべてと同じくトークンに変換され、Anthropic はその数を公開しています:

スクリーンショット 20 枚を含むリクエストは、あなたのプロンプトが始まる前に約 20,000 入力トークンかかる計算です。Claude Sonnet 5 の 100 万あたり 2.00 ドルなら、1 リクエストで 4 セント——一度なら些細でも、月 5 万リクエストなら現実の額です。

動画はさらに重く、受け付けるプロバイダーが少ない理由の一端でもあります。

マルチモーダルが本当に値打ちを出す場面

値打ちを出さない場面

選び方

  1. 向きを書き出す。 何が入り、何が出るか。二つのリスト。
  2. 読み手は入力形式で選ぶ。 入力リストに音声か動画があるなら、大手三社のなかでは今のところ Gemini ファミリーが答えです。
  3. ジェネレーターは個別に選ぶ。 画像・動画・音声のモデルは、それぞれの長所とそれぞれの価格で選びます。
  4. 入力を予算に入れる。 画像 1 枚につき千トークン、PDF 1 つにつき二千トークン。実際のリクエスト量を掛けてください。

短くまとめると

ElliSekiz でさらに見る

ファミリーを並べて見る。 モデル一覧チャット画像動画、音声に分かれ、それぞれ現在の価格つきです。

読み手を価格で比べる。 すべてのテキストモデルのトークン単価は 比較ページ に、各プロバイダーが課金する単位のまま載っています。

出典

すべての記事