2026-07-21

AI đa phương thức là gì? (Và vì sao nó hiếm khi có nghĩa là một mô hình)

Đa phương thức mang hai nghĩa khác nhau. Mô hình đọc được nhiều loại đầu vào không phải là mô hình tạo ra chúng, và gần như không cái nào làm cả hai.

AI đa phương thức là gì? (Và vì sao nó hiếm khi có nghĩa là một mô hình)

"Đa phương thức" được dùng cho hai chuyện khác nhau, và nhầm lẫn giữa chúng dẫn tới thất vọng thật sự.

Nghĩa thứ nhất là một mô hình có thể đọc nhiều hơn một loại đầu vào — văn bản, hình ảnh, âm thanh, video. Nghĩa thứ hai là một hệ thống có thể tạo ra nhiều hơn một loại đầu ra. Gần như không mô hình đơn lẻ nào làm được cả hai, và khoảng cách giữa hai sự thật đó giải thích vì sao "xây một ứng dụng đa phương thức" thường có nghĩa là nối vài mô hình lại với nhau.

Số liệu kiểm tra lần cuối ngày 26 tháng 8 năm 2026.

Phương thức là gì

Phương thức là một loại dữ liệu: văn bản, hình ảnh, âm thanh, video. Một mô hình là đa phương thức khi nó xử lý nhiều hơn một loại.

Câu hỏi hữu ích không bao giờ là "nó có đa phương thức không" mà là "những phương thức nào, theo chiều nào" — vì đọc và viết là hai năng lực hoàn toàn khác nhau.

Các mô hình lớn hôm nay thực sự nhận những gì

Hãy đọc theo hàng ngang, đừng đọc dọc. Mọi mô hình ở đây đều chỉ xuất ra văn bản.

Họ mô hìnhĐọcViết
Gemini 2.5 / 3.xvăn bản, hình ảnh, tệp, âm thanh, videovăn bản
Claude Opus 5 / Sonnet 5 / Haiku 4.5văn bản, hình ảnh, tệpvăn bản
Họ GPT-5văn bản, hình ảnh, tệpvăn bản
DeepSeek V4 Provăn bảnvăn bản

Hai điều đập vào mắt.

Gemini đọc âm thanh và video; Claude và GPT thì không. Đó là khác biệt năng lực rõ ràng nhất giữa các họ lớn hiện nay, và nó không phải một đánh giá chất lượng — nó là danh sách các loại đầu vào được chấp nhận. Nếu đầu vào của bạn là một cuộc họp đã ghi âm hay một đoạn video, khác biệt ấy quyết định mô hình của bạn trước mọi thứ khác.

Mọi họ trong bảng đó đều viết ra văn bản và không gì khác. Gemini có thể xem một video và mô tả nó. Nó không thể làm ra một video.

Vậy ai làm ra hình ảnh và video?

Những mô hình hoàn toàn khác. Chỉ riêng trong danh mục của Atlas Cloud, tỷ lệ là:

LoạiMô hình có giá công bố
Video196
Văn bản136
Hình ảnh121
Âm thanh20

Gần như tất cả những mô hình hình ảnh và video ấy làm một việc: văn bản vào, một loại phương tiện ra. Chúng không trò chuyện, không đọc tài liệu, và không phải các mô hình trong bảng phía trên.

Đây là hình hài thực tế của AI đa phương thức năm 2026: một mô hình văn bản đọc được nhiều loại đầu vào, cộng với các bộ sinh chuyên biệt cho từng loại đầu ra, nối lại bằng mã của bạn. Không phải một mô hình làm tất cả.

Bạn có thể thấy sự phân tách ấy ở danh mục mô hìnhtrò chuyện, hình ảnhvideo là những danh sách riêng vì chúng là những họ mô hình riêng.

Đầu vào đa phương thức thực sự tốn bao nhiêu

Đọc hình ảnh và tài liệu không miễn phí. Chúng được chuyển thành token như mọi thứ khác, và Anthropic công bố các con số:

Vậy một yêu cầu có hai mươi ảnh chụp màn hình tốn khoảng 20.000 token đầu vào trước cả prompt của bạn. Trên Claude Sonnet 5 ở mức 2,00 $ mỗi triệu, đó là bốn xu mỗi yêu cầu — không đáng gì một lần, nhưng có thật ở năm mươi nghìn yêu cầu mỗi tháng.

Video còn nặng hơn, và đó là một phần lý do ít nhà cung cấp chấp nhận nó.

Nơi đa phương thức thật sự xứng đáng

Nơi thì không

Chọn thế nào

  1. Viết ra chiều. Cái gì vào, cái gì ra. Hai danh sách.
  2. Chọn bên đọc theo loại đầu vào. Nếu trong danh sách đầu vào có âm thanh hoặc video, giữa ba ông lớn thì hiện nay câu trả lời là họ Gemini.
  3. Chọn từng bộ sinh riêng. Mô hình hình ảnh, video và âm thanh được chọn theo ưu điểm riêng và giá riêng của chúng.
  4. Đưa đầu vào vào ngân sách. Một nghìn token mỗi ảnh, hai nghìn mỗi PDF, nhân với lượng yêu cầu thật của bạn.

Bản ngắn

Khám phá thêm trên ElliSekiz

Xem các họ cạnh nhau. Danh mục mô hình tách trò chuyện, hình ảnh, video và âm thanh, mỗi mục kèm giá hiện tại.

So sánh bên đọc theo giá. Mức giá token của mọi mô hình văn bản nằm ở trang so sánh, theo đúng đơn vị mà từng nhà cung cấp tính tiền.

Nguồn

Tất cả bài viết