"মাল্টিমোডাল" শব্দটি দুটি আলাদা অর্থে ব্যবহৃত হয়, আর দুটোকে গুলিয়ে ফেললে সত্যিকারের হতাশা আসে।
এক অর্থে এটি এমন মডেল যা একাধিক ধরনের ইনপুট পড়তে পারে — লেখা, ছবি, অডিও, ভিডিও। অন্য অর্থে এটি এমন ব্যবস্থা যা একাধিক ধরনের আউটপুট তৈরি করতে পারে। একটি মডেল দুটোই করে, এমন প্রায় ঘটে না; আর এই দুই সত্যের মধ্যেকার ফাঁকই বুঝিয়ে দেয় কেন "মাল্টিমোডাল অ্যাপ বানানো" সাধারণত কয়েকটি মডেল জুড়ে দেওয়া হয়ে দাঁড়ায়।
সংখ্যাগুলো সর্বশেষ যাচাই: ২৬ আগস্ট ২০২৬।
মোডালিটি কী
মোডালিটি হলো ডেটার একটি ধরন: লেখা, ছবি, অডিও, ভিডিও। মডেল একাধিক ধরন সামলালে সেটি মাল্টিমোডাল।
কাজের প্রশ্নটি কখনোই "এটি কি মাল্টিমোডাল" নয়, বরং "কোন কোন মোডালিটি, কোন দিকে" — কারণ পড়া আর লেখা সম্পূর্ণ আলাদা সামর্থ্য।
আজকের বড় মডেলগুলো আসলে কী নেয়
আড়াআড়ি পড়ুন, নিচের দিকে নয়। এদের প্রত্যেকেই কেবল লেখা বের করে।
| মডেল পরিবার | পড়ে | লেখে |
|---|---|---|
| Gemini 2.5 / 3.x | লেখা, ছবি, ফাইল, অডিও, ভিডিও | লেখা |
| Claude Opus 5 / Sonnet 5 / Haiku 4.5 | লেখা, ছবি, ফাইল | লেখা |
| GPT-5 পরিবার | লেখা, ছবি, ফাইল | লেখা |
| DeepSeek V4 Pro | লেখা | লেখা |
দুটি বিষয় চোখে পড়ে।
Gemini অডিও আর ভিডিও পড়ে; Claude আর GPT পড়ে না। এই মুহূর্তে বড় পরিবারগুলোর মধ্যে এটাই সবচেয়ে স্পষ্ট সামর্থ্যের পার্থক্য, আর এটি মানের বিচার নয় — এটি গ্রহণযোগ্য ইনপুট ধরনের তালিকা। আপনার ইনপুট যদি রেকর্ড করা মিটিং বা ভিডিও ক্লিপ হয়, তবে অন্য সবকিছুর আগে এই পার্থক্যই আপনার মডেল ঠিক করে দেয়।
ওই টেবিলের প্রতিটি পরিবার লেখা লেখে, আর কিছু নয়। Gemini ভিডিও দেখে বর্ণনা করতে পারে। বানাতে পারে না।
তাহলে ছবি আর ভিডিও বানায় কে?
সম্পূর্ণ আলাদা মডেল। শুধু Atlas Cloud-এর তালিকাতেই ভাগটা এমন:
| ধরন | প্রকাশিত দামসহ মডেল |
|---|---|
| ভিডিও | ১৯৬ |
| লেখা | ১৩৬ |
| ছবি | ১২১ |
| অডিও | ২০ |
ওই ছবি আর ভিডিও মডেলগুলোর প্রায় সবাই একটাই কাজ করে: লেখা ঢোকে, এক ধরনের মিডিয়া বের হয়। তারা কথোপকথন করে না, নথি পড়ে না, আর উপরের টেবিলের মডেলও নয়।
২০২৬ সালে মাল্টিমোডাল এআই-এর বাস্তব চেহারা এটাই: কয়েক ধরনের ইনপুট পড়তে পারা একটি টেক্সট মডেল, সঙ্গে প্রতিটি আউটপুট ধরনের জন্য বিশেষায়িত জেনারেটর, আর সেগুলো জোড়া লাগায় আপনার কোড। সবকিছু করা একটিমাত্র মডেল নয়।
ভাগটা দেখতে পাবেন মডেল তালিকায় — চ্যাট, ছবি আর ভিডিও আলাদা তালিকা, কারণ ওগুলো আলাদা মডেল পরিবার।
মাল্টিমোডাল ইনপুটের আসল খরচ
ছবি আর নথি পড়া বিনামূল্যে নয়। বাকি সবকিছুর মতোই সেগুলো টোকেনে বদলায়, আর Anthropic সংখ্যাগুলো প্রকাশ করে:
- একটি ছবি আর একটি ছোট নির্দেশ: ১,০২৮ ইনপুট টোকেন
- একটি PDF আর একটি ছোট নির্দেশ: ২,১৮৮ ইনপুট টোকেন
তাই কুড়িটি স্ক্রিনশটসহ একটি অনুরোধ আপনার প্রম্পট শুরুর আগেই প্রায় ২০,০০০ ইনপুট টোকেন খরচ করে। Claude Sonnet 5-এ দশ লক্ষে $2.00 হারে সেটি অনুরোধপ্রতি চার সেন্ট — একবারে তুচ্ছ, মাসে পঞ্চাশ হাজার অনুরোধে সত্যিকারের অঙ্ক।
ভিডিও আরও ভারী, আর কম সরবরাহকারী সেটি নেয় তার একটি কারণও এটাই।
মাল্টিমোডাল সত্যিই কোথায় নিজের জায়গা অর্জন করে
- যেসব নথি আসলে ছবি, সেগুলো পড়া। স্ক্যান, স্ক্রিনশট, রসিদ, হাতে লেখা ফর্ম। দৃষ্টিসম্পন্ন একটি টেক্সট মডেল OCR পাইপলাইনের জায়গা নেয়, আর এমন বিন্যাসও সামলায় যেগুলোয় তাকে কখনো প্রশিক্ষণ দেওয়া হয়নি।
- অডিও ও ভিডিও বোঝা। মিটিংয়ের সারসংক্ষেপ, কল বিশ্লেষণ, ক্লিপের বর্ণনা। আজ এটি Gemini-র দিকে ইঙ্গিত করে, কারণ ওই পরিবারই এসব ইনপুট নেয়।
- ভিত্তিসহ তৈরি করা। মডেলকে আপনার ব্র্যান্ডের ছবি দেখান আর তার সঙ্গে মানানসই লেখা চান।
- ইন্টারফেসের কাজ। ভাঙা পাতার স্ক্রিনশট দিয়ে মডেলকে জিজ্ঞেস করুন কী গোলমাল।
কোথায় নয়
- যখন আউটপুটে মিডিয়া দরকার। বিশেষায়িত জেনারেটরের দিকে যান। ওই ১৯৬টি ভিডিও আর ১২১টি ছবি মডেল এর জন্যই।
- যখন সাধারণ লেখাতেই চলত। যে PDF আপনি পার্স করতে পারতেন সেটি ভিশন মডেলকে পড়ানো মানে হাজার টোকেন, যা খরচ করার দরকার ছিল না।
- যখন "মাল্টিমোডাল" বিপণনের কাজ করছে। ছবি পড়তে পারা মডেল আপনাআপনি লেখায় ভালো হয় না। বিশেষণ নয়, মোডালিটির তালিকা দেখুন।
কীভাবে বাছবেন
- দিকটা লিখে ফেলুন। কী ঢোকে, কী বেরোয়। দুটি তালিকা।
- পড়ুয়াটি ইনপুট ধরন দিয়ে বাছুন। ইনপুট তালিকায় অডিও বা ভিডিও থাকলে, বড় তিনটির মধ্যে আজ উত্তর Gemini পরিবার।
- প্রতিটি জেনারেটর আলাদা করে বাছুন। ছবি, ভিডিও আর অডিও মডেল নিজ নিজ গুণ আর নিজ নিজ দামে বাছা হয়।
- ইনপুট বাজেটে ধরুন। ছবিপ্রতি হাজার টোকেন, PDF-প্রতি দুই হাজার, আপনার আসল অনুরোধ-সংখ্যা দিয়ে গুণ করে।
সংক্ষেপে
- মাল্টিমোডাল বোঝায় মডেল কী পড়ে, কী লেখে, কিংবা দুটোই — সবসময় জিজ্ঞেস করুন কোনটি।
- Gemini অডিও আর ভিডিও পড়ে। Claude আর GPT পড়ে লেখা, ছবি আর ফাইল। সবাই কেবল লেখা লেখে।
- মিডিয়া বানায় আলাদা বিশেষায়িত মডেল: এক সরবরাহকারীর কাছেই ১৯৬টি ভিডিও, ১২১টি ছবি আর ২০টি অডিও মডেল।
- সত্যিকারের মাল্টিমোডাল অ্যাপ্লিকেশন সাধারণত একজন পড়ুয়া আর এক বা একাধিক জেনারেটর, যা জোড়ে আপনার কোড।
- ছবি আর PDF যথাক্রমে প্রায় ১,০০০ আর ২,০০০ ইনপুট টোকেন নেয়। এগুলো ঘিরে নকশা করার আগে নিজের পরিমাণ দিয়ে গুণ করুন।
ElliSekiz-এ আরও দেখুন
পরিবারগুলো পাশাপাশি দেখুন। মডেল তালিকা চ্যাট, ছবি, ভিডিও আর অডিওকে আলাদা করে, প্রতিটির বর্তমান দামসহ।
পড়ুয়াদের দাম মিলিয়ে দেখুন। প্রতিটি টেক্সট মডেলের টোকেন হার আছে তুলনা পাতায়, যে এককে প্রতিটি সরবরাহকারী বিল করে সেই এককেই।
সূত্র
- OpenRouter models API,
https://openrouter.ai/api/v1/models(ইনপুট ও আউটপুট মোডালিটি, পড়া হয়েছে ২৬-০৮-২০২৬) - Atlas Cloud model catalogue API,
https://api.atlascloud.ai/api/v1/models(মডেল ধরনভেদে সংখ্যা) - Anthropic — Token counting (ছবি ও PDF-এর টোকেন সংখ্যা)
