2026-07-21

什么是多模态 AI?(以及为什么它很少指一个模型)

多模态有两种不同含义。能读多种输入的模型,不等于能产出它们的模型,而几乎没有哪个两者兼备。

什么是多模态 AI?(以及为什么它很少指一个模型)

"多模态"这个词被用来指两件不同的事,混淆它们会带来真实的失望。

一种意思是:能多种输入的模型——文本、图片、音频、视频。另一种意思是:能产出多种输出的系统。几乎没有哪个单一模型两者兼备,而这两件事之间的落差,正解释了为什么"做一个多模态应用"通常意味着把好几个模型接在一起。

数字最后核对日期:2026 年 8 月 26 日。

什么是模态

模态就是数据的一种类型:文本、图片、音频、视频。当一个模型能处理不止一种时,它就是多模态的。

有用的问题从来不是"它是不是多模态",而是"哪些模态,往哪个方向"——因为读和写是完全不同的能力。

今天的大模型实际接受什么

横着读,别竖着读。这里的每一个,输出都只有文本。

模型家族
Gemini 2.5 / 3.x文本、图片、文件、音频、视频文本
Claude Opus 5 / Sonnet 5 / Haiku 4.5文本、图片、文件文本
GPT-5 家族文本、图片、文件文本
DeepSeek V4 Pro文本文本

有两点很扎眼。

Gemini 能读音频和视频;Claude 和 GPT 不能。 这是眼下几大家族之间最清晰的能力差别,而且不是质量评价——它是一份可接受输入类型的清单。如果你的输入是一段会议录音或一段视频,这个差别会比任何其他因素更早地决定你的模型。

那张表里的每一个家族都只写文本,没有别的。 Gemini 能看一段视频并描述它。它做不出一段视频。

那么图片和视频是谁做的

完全是另一批模型。仅在 Atlas Cloud 的目录里,分布就是:

类型有公开价格的模型数
视频196
文本136
图片121
音频20

那些图片和视频模型几乎都只干一件事:文本进去,一种媒体出来。它们不对话,不读文档,也不是上面那张表里的模型。

这就是 2026 年多模态 AI 的实际形态: 一个能读多种输入类型的文本模型,加上每种输出类型各自的专用生成器,由你的代码把它们串起来。不是一个什么都能干的模型。

这种分工可以在模型索引上看到——聊天图片视频是分开的列表,因为它们本来就是分开的模型家族。

多模态输入到底要花多少钱

读图片和文档不是免费的。它们和别的东西一样会被转成 token,Anthropic 公布了数字:

所以一个带二十张截图的请求,在你的提示词开始之前就已经花掉约 20,000 个输入 token。在 Claude Sonnet 5 上按每百万 2.00 美元算,这是每次请求四美分——单次微不足道,每月五万次请求就是真金白银。

视频还要更重,这也是接受它的厂商更少的部分原因。

多模态真正配得上自己位置的地方

不适合的地方

怎么选

  1. 把方向写下来。 什么进去,什么出来。两份清单。
  2. 按输入类型选读的那个。 如果输入清单里有音频或视频,在三巨头里目前的答案是 Gemini 家族。
  3. 每个生成器单独选。 图片、视频、音频模型各按自己的长处和自己的价格来选。
  4. 把输入算进预算。 每张图片一千 token,每个 PDF 两千,乘以你真实的请求量。

简版

在 ElliSekiz 上继续了解

把各家族并排看。 模型索引聊天图片视频和音频分开,各自附当前价格。

按价格比较这些读者。 每个文本模型的 token 费率都在对比页,按各厂商自己的计费单位列出。

来源

全部文章