"多模态"这个词被用来指两件不同的事,混淆它们会带来真实的失望。
一种意思是:能读多种输入的模型——文本、图片、音频、视频。另一种意思是:能产出多种输出的系统。几乎没有哪个单一模型两者兼备,而这两件事之间的落差,正解释了为什么"做一个多模态应用"通常意味着把好几个模型接在一起。
数字最后核对日期:2026 年 8 月 26 日。
什么是模态
模态就是数据的一种类型:文本、图片、音频、视频。当一个模型能处理不止一种时,它就是多模态的。
有用的问题从来不是"它是不是多模态",而是"哪些模态,往哪个方向"——因为读和写是完全不同的能力。
今天的大模型实际接受什么
横着读,别竖着读。这里的每一个,输出都只有文本。
| 模型家族 | 读 | 写 |
|---|---|---|
| Gemini 2.5 / 3.x | 文本、图片、文件、音频、视频 | 文本 |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | 文本、图片、文件 | 文本 |
| GPT-5 家族 | 文本、图片、文件 | 文本 |
| DeepSeek V4 Pro | 文本 | 文本 |
有两点很扎眼。
Gemini 能读音频和视频;Claude 和 GPT 不能。 这是眼下几大家族之间最清晰的能力差别,而且不是质量评价——它是一份可接受输入类型的清单。如果你的输入是一段会议录音或一段视频,这个差别会比任何其他因素更早地决定你的模型。
那张表里的每一个家族都只写文本,没有别的。 Gemini 能看一段视频并描述它。它做不出一段视频。
那么图片和视频是谁做的
完全是另一批模型。仅在 Atlas Cloud 的目录里,分布就是:
| 类型 | 有公开价格的模型数 |
|---|---|
| 视频 | 196 |
| 文本 | 136 |
| 图片 | 121 |
| 音频 | 20 |
那些图片和视频模型几乎都只干一件事:文本进去,一种媒体出来。它们不对话,不读文档,也不是上面那张表里的模型。
这就是 2026 年多模态 AI 的实际形态: 一个能读多种输入类型的文本模型,加上每种输出类型各自的专用生成器,由你的代码把它们串起来。不是一个什么都能干的模型。
这种分工可以在模型索引上看到——聊天、图片和视频是分开的列表,因为它们本来就是分开的模型家族。
多模态输入到底要花多少钱
读图片和文档不是免费的。它们和别的东西一样会被转成 token,Anthropic 公布了数字:
- 一张图片加一条简短指令:1,028 个输入 token
- 一个 PDF 加一条简短指令:2,188 个输入 token
所以一个带二十张截图的请求,在你的提示词开始之前就已经花掉约 20,000 个输入 token。在 Claude Sonnet 5 上按每百万 2.00 美元算,这是每次请求四美分——单次微不足道,每月五万次请求就是真金白银。
视频还要更重,这也是接受它的厂商更少的部分原因。
多模态真正配得上自己位置的地方
- 读那些本身就是图片的文档。 扫描件、截图、收据、手写表格。一个有视觉的文本模型可以取代整条 OCR 流水线,还能应付它从未训练过的版式。
- 音频和视频理解。 会议纪要、通话分析、描述片段。今天这指向 Gemini,因为它是接受这类输入的那个家族。
- 有依据的生成。 把你的品牌照片给模型看,让它写出与之相配的文案。
- 界面工作。 给模型一张出问题页面的截图,问它哪里不对。
不适合的地方
- 当你需要媒体作为输出时。 去找专用生成器。那 196 个视频模型和 121 个图片模型就是干这个的。
- 当纯文本本来就够用时。 让视觉模型去读一个你本可以解析的 PDF,是你本不必花的一千个 token。
- 当"多模态"在替市场部干活时。 能读图片的模型不会自动在文本上更强。看模态清单,别看形容词。
怎么选
- 把方向写下来。 什么进去,什么出来。两份清单。
- 按输入类型选读的那个。 如果输入清单里有音频或视频,在三巨头里目前的答案是 Gemini 家族。
- 每个生成器单独选。 图片、视频、音频模型各按自己的长处和自己的价格来选。
- 把输入算进预算。 每张图片一千 token,每个 PDF 两千,乘以你真实的请求量。
简版
- 多模态描述的是模型读什么、写什么,或者两者兼有——永远要问清是哪一种。
- Gemini 读音频和视频。Claude 和 GPT 读文本、图片和文件。它们全都只写文本。
- 媒体由单独的专用模型产出:仅一家厂商就有 196 个视频、121 个图片和 20 个音频模型。
- 真正的多模态应用,通常是一个读者加一个或多个生成器,由你的代码串起来。
- 图片和 PDF 分别约需 1,000 和 2,000 个输入 token。在围绕它们做设计之前,先乘以你的量。
在 ElliSekiz 上继续了解
把各家族并排看。 模型索引把聊天、图片、视频和音频分开,各自附当前价格。
按价格比较这些读者。 每个文本模型的 token 费率都在对比页,按各厂商自己的计费单位列出。
来源
- OpenRouter models API,
https://openrouter.ai/api/v1/models(输入与输出模态,读取于 2026-08-26) - Atlas Cloud 模型目录 API,
https://api.atlascloud.ai/api/v1/models(各类型模型数量) - Anthropic — Token counting(图片与 PDF 的 token 数)
