"Đa phương thức" được dùng cho hai chuyện khác nhau, và nhầm lẫn giữa chúng dẫn tới thất vọng thật sự.
Nghĩa thứ nhất là một mô hình có thể đọc nhiều hơn một loại đầu vào — văn bản, hình ảnh, âm thanh, video. Nghĩa thứ hai là một hệ thống có thể tạo ra nhiều hơn một loại đầu ra. Gần như không mô hình đơn lẻ nào làm được cả hai, và khoảng cách giữa hai sự thật đó giải thích vì sao "xây một ứng dụng đa phương thức" thường có nghĩa là nối vài mô hình lại với nhau.
Số liệu kiểm tra lần cuối ngày 26 tháng 8 năm 2026.
Phương thức là gì
Phương thức là một loại dữ liệu: văn bản, hình ảnh, âm thanh, video. Một mô hình là đa phương thức khi nó xử lý nhiều hơn một loại.
Câu hỏi hữu ích không bao giờ là "nó có đa phương thức không" mà là "những phương thức nào, theo chiều nào" — vì đọc và viết là hai năng lực hoàn toàn khác nhau.
Các mô hình lớn hôm nay thực sự nhận những gì
Hãy đọc theo hàng ngang, đừng đọc dọc. Mọi mô hình ở đây đều chỉ xuất ra văn bản.
| Họ mô hình | Đọc | Viết |
|---|---|---|
| Gemini 2.5 / 3.x | văn bản, hình ảnh, tệp, âm thanh, video | văn bản |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | văn bản, hình ảnh, tệp | văn bản |
| Họ GPT-5 | văn bản, hình ảnh, tệp | văn bản |
| DeepSeek V4 Pro | văn bản | văn bản |
Hai điều đập vào mắt.
Gemini đọc âm thanh và video; Claude và GPT thì không. Đó là khác biệt năng lực rõ ràng nhất giữa các họ lớn hiện nay, và nó không phải một đánh giá chất lượng — nó là danh sách các loại đầu vào được chấp nhận. Nếu đầu vào của bạn là một cuộc họp đã ghi âm hay một đoạn video, khác biệt ấy quyết định mô hình của bạn trước mọi thứ khác.
Mọi họ trong bảng đó đều viết ra văn bản và không gì khác. Gemini có thể xem một video và mô tả nó. Nó không thể làm ra một video.
Vậy ai làm ra hình ảnh và video?
Những mô hình hoàn toàn khác. Chỉ riêng trong danh mục của Atlas Cloud, tỷ lệ là:
| Loại | Mô hình có giá công bố |
|---|---|
| Video | 196 |
| Văn bản | 136 |
| Hình ảnh | 121 |
| Âm thanh | 20 |
Gần như tất cả những mô hình hình ảnh và video ấy làm một việc: văn bản vào, một loại phương tiện ra. Chúng không trò chuyện, không đọc tài liệu, và không phải các mô hình trong bảng phía trên.
Đây là hình hài thực tế của AI đa phương thức năm 2026: một mô hình văn bản đọc được nhiều loại đầu vào, cộng với các bộ sinh chuyên biệt cho từng loại đầu ra, nối lại bằng mã của bạn. Không phải một mô hình làm tất cả.
Bạn có thể thấy sự phân tách ấy ở danh mục mô hình — trò chuyện, hình ảnh và video là những danh sách riêng vì chúng là những họ mô hình riêng.
Đầu vào đa phương thức thực sự tốn bao nhiêu
Đọc hình ảnh và tài liệu không miễn phí. Chúng được chuyển thành token như mọi thứ khác, và Anthropic công bố các con số:
- Một ảnh cộng một chỉ dẫn ngắn: 1.028 token đầu vào
- Một PDF cộng một chỉ dẫn ngắn: 2.188 token đầu vào
Vậy một yêu cầu có hai mươi ảnh chụp màn hình tốn khoảng 20.000 token đầu vào trước cả prompt của bạn. Trên Claude Sonnet 5 ở mức 2,00 $ mỗi triệu, đó là bốn xu mỗi yêu cầu — không đáng gì một lần, nhưng có thật ở năm mươi nghìn yêu cầu mỗi tháng.
Video còn nặng hơn, và đó là một phần lý do ít nhà cung cấp chấp nhận nó.
Nơi đa phương thức thật sự xứng đáng
- Đọc những tài liệu vốn là hình ảnh. Bản quét, ảnh chụp màn hình, hoá đơn, biểu mẫu viết tay. Một mô hình văn bản có thị giác thay thế cả một pipeline OCR và xoay xở được với những bố cục nó chưa từng được huấn luyện.
- Hiểu âm thanh và video. Tóm tắt cuộc họp, phân tích cuộc gọi, mô tả clip. Hôm nay việc này chỉ về Gemini, vì đó là họ chấp nhận những đầu vào ấy.
- Sinh nội dung có neo. Cho mô hình xem ảnh thương hiệu của bạn và yêu cầu lời văn hợp với chúng.
- Việc giao diện. Đưa cho mô hình ảnh chụp một trang bị hỏng và hỏi xem sai ở đâu.
Nơi thì không
- Khi bạn cần phương tiện ở đầu ra. Hãy dùng một bộ sinh chuyên biệt. 196 mô hình video và 121 mô hình hình ảnh là để cho việc đó.
- Khi văn bản thuần đã đủ. Một mô hình thị giác đọc bản PDF mà bạn có thể tự phân tích là một nghìn token bạn đã không cần tiêu.
- Khi "đa phương thức" đang làm việc tiếp thị. Một mô hình đọc được hình ảnh không tự nhiên giỏi hơn về văn bản. Hãy xem danh sách phương thức, đừng xem tính từ.
Chọn thế nào
- Viết ra chiều. Cái gì vào, cái gì ra. Hai danh sách.
- Chọn bên đọc theo loại đầu vào. Nếu trong danh sách đầu vào có âm thanh hoặc video, giữa ba ông lớn thì hiện nay câu trả lời là họ Gemini.
- Chọn từng bộ sinh riêng. Mô hình hình ảnh, video và âm thanh được chọn theo ưu điểm riêng và giá riêng của chúng.
- Đưa đầu vào vào ngân sách. Một nghìn token mỗi ảnh, hai nghìn mỗi PDF, nhân với lượng yêu cầu thật của bạn.
Bản ngắn
- Đa phương thức mô tả cái mà mô hình đọc, cái mà nó viết, hoặc cả hai — luôn hỏi rõ là cái nào.
- Gemini đọc âm thanh và video. Claude và GPT đọc văn bản, hình ảnh và tệp. Tất cả đều chỉ viết ra văn bản.
- Phương tiện do các mô hình chuyên biệt riêng tạo ra: 196 video, 121 hình ảnh và 20 âm thanh chỉ ở một nhà cung cấp.
- Một ứng dụng đa phương thức thật sự thường là một bên đọc cộng một hay nhiều bộ sinh, nối lại bằng mã của bạn.
- Ảnh và PDF tốn lần lượt khoảng 1.000 và 2.000 token đầu vào. Hãy nhân với lượng của bạn trước khi thiết kế quanh chúng.
Khám phá thêm trên ElliSekiz
Xem các họ cạnh nhau. Danh mục mô hình tách trò chuyện, hình ảnh, video và âm thanh, mỗi mục kèm giá hiện tại.
So sánh bên đọc theo giá. Mức giá token của mọi mô hình văn bản nằm ở trang so sánh, theo đúng đơn vị mà từng nhà cung cấp tính tiền.
Nguồn
- OpenRouter models API,
https://openrouter.ai/api/v1/models(phương thức đầu vào và đầu ra, đọc ngày 26-08-2026) - Atlas Cloud model catalogue API,
https://api.atlascloud.ai/api/v1/models(số lượng theo loại mô hình) - Anthropic — Token counting (số token của ảnh và PDF)
