Setiap kad model membawa angka seperti "konteks 200K" atau "konteks 1M". Ia kelihatan seperti spesifikasi kapasiti, sama seperti ruang cakera. Sebenarnya ia lebih hampir kepada belanjawan yang anda habiskan pada setiap permintaan — dan kebanyakan yang menghabiskannya bukanlah apa yang anda taip.
Angka disemak kali terakhir: 26 Ogos 2026.
Apakah itu panjang konteks
Model tiada ingatan. Setiap kali anda memanggilnya, anda menghantar keseluruhan perbualan semula — prompt sistem, setiap pusingan terdahulu, apa-apa fail yang dilampirkan — dan ia membaca kesemuanya sebelum menulis satu perkataan.
Panjang konteks ialah saiz maksimum bungkusan itu, diukur dalam token. Token ialah cebisan teks kecil, kira-kira tiga perempat perkataan dalam bahasa Inggeris.
Jadi ia bukan storan. Ia saiz meja tempat model boleh membentangkan dokumen anda, dikosongkan semula pada setiap permintaan.
Had sebenar hari ini
| Panjang konteks | Model bersaiz itu |
|---|---|
| 32,768 | Qwen 2.5 Coder 32B |
| 200,000 | Claude Haiku 4.5 |
| 262,144 | Kimi K2.7 Code |
| 400,000 | Seluruh keluarga GPT-5, termasuk setiap varian Codex |
| 1,000,000 | Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash dan Plus |
| 1,048,576 | Keluarga Gemini 2.5 dan 3.x, DeepSeek V4 Pro |
Dua perkara wajar diberi perhatian.
Sejuta token lebih kurang 750,000 perkataan — beberapa buah novel panjang. Hampir tiada aplikasi yang memerlukannya, dan yang merasa perlu biasanya menghadapi masalah capaian maklumat, bukan masalah konteks.
1,048,576 ialah 2²⁰, bukan angka bulat pemasaran. Di mana pembekal menyebut tepat 1,000,000, mereka telah membundarkan; di mana mereka menyebut 1,048,576, mereka melaporkan saiz penimbal yang sebenar.
Harga token dan panjang konteks bagi setiap model teks ada di halaman model sembang.
Apa yang sebenarnya mengisinya
Inilah bahagian yang kad model tidak beritahu anda. Dokumentasi Anthropic menerbitkan kiraan token tepat bagi beberapa permintaan minimum, dan ia mendidik:
| Apa yang dihantar | Token input |
|---|---|
| Prompt sistem lima perkataan serta mesej dua perkataan | 14 |
| Soalan sembilan perkataan serta satu takrif alat | 403 |
| Satu imej serta "Describe this image" | 1,028 |
| Satu PDF serta "Please summarize this document." | 2,188 |
Satu takrif alat menelan kira-kira 390 token. Ejen dengan dua puluh alat menghabiskan sekitar 8,000 token tetingkapnya sebelum pengguna menaip apa-apa — dan membayarnya pada setiap permintaan.
Satu imej kira-kira seribu token. Dua puluh tangkap layar bermakna 20,000.
Dan perbualan itu sendiri membesar. Pusingan 10 membawa pusingan 1 hingga 9. Sembang yang terasa kecil pada mulanya, pada akhirnya menjadi benda terbesar dalam permintaan.
Jadi model "konteks 200K" di dalam ejen dengan lima belas alat, prompt sistem panjang dan beberapa tangkap layar tidak bermula pada 200K. Ia bermula jauh di bawahnya, dan mengecut setiap pusingan.
Perangkapnya: teks yang sama bukan bilangan token yang sama
Panjang konteks diukur dalam token, dan token bukan unit yang stabil antara model.
Dokumentasi Anthropic sendiri menyatakan bahawa Claude 4.7 dan selepasnya menggunakan tokenizer lebih baharu yang mana "teks input yang sama menghasilkan kira-kira 30 peratus lebih banyak token berbanding model terdahulu."
Ertinya: prompt yang diukur 150,000 token pada model lama boleh menjadi kira-kira 195,000 pada yang lebih baharu — perkataan yang sama, tiga puluh peratus lebih tetingkap dan tiga puluh peratus lebih kos. Jika anda menyaiz saluran pemprosesan dokumen terhadap satu model kemudian bertukar, ukur semula sebelum menganggap ia masih muat.
Pembekal memberi anda cara menyemak. Endpoint pengiraan token Anthropic percuma dipanggil. Kira terhadap model tepat yang anda hendak jalankan.
Apa yang berlaku apabila ruang habis
Bukan kemerosotan yang lembut. Bergantung pada pembekal, anda dapat ralat, input terpotong, atau sejarah yang dibuang secara senyap — dan yang ketiga itulah yang berbahaya, kerana model menjawab dengan yakin daripada perbualan yang tidak lagi dilihatnya sepenuhnya.
Tiga jalan keluar, mengikut susunan kerja:
Pangkas. Buang atau ringkaskan pusingan terlama. Paling murah dibina, dan biasanya memadai untuk sembang.
Cache. Jika bahagian besar konteks anda ialah awalan tetap — prompt sistem panjang, dokumen rujukan — cache prompt membolehkan pembekal menyimpannya dan mengecaj sepersekian untuk membacanya semula. Ini tidak membesarkan tetingkap, tetapi menghilangkan sebahagian besar kos mengisinya.
Capai. Berhenti menghantar keseluruhan korpus dan hantar hanya bahagian yang berkaitan. Lebih banyak kejuruteraan, tetapi ini satu-satunya pendekatan yang tidak bertambah buruk apabila data anda membesar.
Mencapai tetingkap konteks yang lebih besar ialah pilihan keempat, dan biasanya yang termahal — kerana anda membayar setiap token dalam tetingkap itu pada setiap permintaan.
Adakah tetingkap lebih besar lebih mahal?
Tidak setiap token. Model konteks 1M tidak dicaj pada kadar lebih tinggi daripada yang 200K bagi permintaan yang sama; Claude Sonnet 5 ialah $2.00 setiap juta token input sama ada anda menghantar lima ratus token atau lima ratus ribu.
Tetapi tetingkap lebih besar memudahkan anda membelanjakan lebih, kerana ia menyingkirkan ralat yang sepatutnya menghentikan anda. Mengisi tetingkap sejuta token pada $2.00 setiap juta berkos $2.00 setiap permintaan — dan jika permintaan itu ialah satu pusingan sembang yang berlaku lima puluh ribu kali sebulan, aritmetiknya cepat menjadi serius.
Disiplinnya sama juga: hantar sesedikit yang anda mampu, bukan sebanyak yang dibenarkan.
Versi ringkas
- Panjang konteks ialah saiz maksimum satu permintaan, dalam token, bukan ingatan.
- Had hari ini berjulat dari kira-kira 33K hingga kira-kira 1M; kebanyakan kerja pengeluaran muat dengan selesa di hujung bawah.
- Takrif alat (~390 token setiap satu), imej (~1,000), PDF (~2,000) dan sejarah yang dihantar semula mengisinya lebih cepat daripada prompt anda.
- Teks yang sama ialah bilangan token berbeza pada model berbeza — semak semula apabila bertukar.
- Tetingkap lebih besar tidak berkos lebih setiap token. Ia cuma memudahkan anda membelanjakan lebih banyak.
Terokai lagi di ElliSekiz
Bandingkan panjang konteks dan harga token bersebelahan. Halaman model sembang menyenaraikan setiap model teks dengan kadar input dan outputnya.
Kemudian ukur prompt anda sendiri. Setiap halaman model mempunyai playground — jalankan permintaan sebenar dan baca kiraan token yang sebenar sebelum menyaiz apa-apa.
Sumber
- OpenRouter models API,
https://openrouter.ai/api/v1/models(panjang konteks, dibaca 26-08-2026) - Anthropic — Token counting (kiraan contoh yang didokumenkan, pertukaran tokenizer, endpoint pengiraan percuma)
