2026-07-13

Apakah itu panjang konteks? (Dan apa yang sebenarnya mengisinya)

Panjang konteks ialah belanjawan, bukan ciri. Apa yang dikira terhadapnya, di mana had sebenar hari ini, dan apa yang berlaku apabila ruang habis.

Apakah itu panjang konteks? (Dan apa yang sebenarnya mengisinya)

Setiap kad model membawa angka seperti "konteks 200K" atau "konteks 1M". Ia kelihatan seperti spesifikasi kapasiti, sama seperti ruang cakera. Sebenarnya ia lebih hampir kepada belanjawan yang anda habiskan pada setiap permintaan — dan kebanyakan yang menghabiskannya bukanlah apa yang anda taip.

Angka disemak kali terakhir: 26 Ogos 2026.

Apakah itu panjang konteks

Model tiada ingatan. Setiap kali anda memanggilnya, anda menghantar keseluruhan perbualan semula — prompt sistem, setiap pusingan terdahulu, apa-apa fail yang dilampirkan — dan ia membaca kesemuanya sebelum menulis satu perkataan.

Panjang konteks ialah saiz maksimum bungkusan itu, diukur dalam token. Token ialah cebisan teks kecil, kira-kira tiga perempat perkataan dalam bahasa Inggeris.

Jadi ia bukan storan. Ia saiz meja tempat model boleh membentangkan dokumen anda, dikosongkan semula pada setiap permintaan.

Had sebenar hari ini

Panjang konteksModel bersaiz itu
32,768Qwen 2.5 Coder 32B
200,000Claude Haiku 4.5
262,144Kimi K2.7 Code
400,000Seluruh keluarga GPT-5, termasuk setiap varian Codex
1,000,000Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash dan Plus
1,048,576Keluarga Gemini 2.5 dan 3.x, DeepSeek V4 Pro

Dua perkara wajar diberi perhatian.

Sejuta token lebih kurang 750,000 perkataan — beberapa buah novel panjang. Hampir tiada aplikasi yang memerlukannya, dan yang merasa perlu biasanya menghadapi masalah capaian maklumat, bukan masalah konteks.

1,048,576 ialah 2²⁰, bukan angka bulat pemasaran. Di mana pembekal menyebut tepat 1,000,000, mereka telah membundarkan; di mana mereka menyebut 1,048,576, mereka melaporkan saiz penimbal yang sebenar.

Harga token dan panjang konteks bagi setiap model teks ada di halaman model sembang.

Apa yang sebenarnya mengisinya

Inilah bahagian yang kad model tidak beritahu anda. Dokumentasi Anthropic menerbitkan kiraan token tepat bagi beberapa permintaan minimum, dan ia mendidik:

Apa yang dihantarToken input
Prompt sistem lima perkataan serta mesej dua perkataan14
Soalan sembilan perkataan serta satu takrif alat403
Satu imej serta "Describe this image"1,028
Satu PDF serta "Please summarize this document."2,188

Satu takrif alat menelan kira-kira 390 token. Ejen dengan dua puluh alat menghabiskan sekitar 8,000 token tetingkapnya sebelum pengguna menaip apa-apa — dan membayarnya pada setiap permintaan.

Satu imej kira-kira seribu token. Dua puluh tangkap layar bermakna 20,000.

Dan perbualan itu sendiri membesar. Pusingan 10 membawa pusingan 1 hingga 9. Sembang yang terasa kecil pada mulanya, pada akhirnya menjadi benda terbesar dalam permintaan.

Jadi model "konteks 200K" di dalam ejen dengan lima belas alat, prompt sistem panjang dan beberapa tangkap layar tidak bermula pada 200K. Ia bermula jauh di bawahnya, dan mengecut setiap pusingan.

Perangkapnya: teks yang sama bukan bilangan token yang sama

Panjang konteks diukur dalam token, dan token bukan unit yang stabil antara model.

Dokumentasi Anthropic sendiri menyatakan bahawa Claude 4.7 dan selepasnya menggunakan tokenizer lebih baharu yang mana "teks input yang sama menghasilkan kira-kira 30 peratus lebih banyak token berbanding model terdahulu."

Ertinya: prompt yang diukur 150,000 token pada model lama boleh menjadi kira-kira 195,000 pada yang lebih baharu — perkataan yang sama, tiga puluh peratus lebih tetingkap dan tiga puluh peratus lebih kos. Jika anda menyaiz saluran pemprosesan dokumen terhadap satu model kemudian bertukar, ukur semula sebelum menganggap ia masih muat.

Pembekal memberi anda cara menyemak. Endpoint pengiraan token Anthropic percuma dipanggil. Kira terhadap model tepat yang anda hendak jalankan.

Apa yang berlaku apabila ruang habis

Bukan kemerosotan yang lembut. Bergantung pada pembekal, anda dapat ralat, input terpotong, atau sejarah yang dibuang secara senyap — dan yang ketiga itulah yang berbahaya, kerana model menjawab dengan yakin daripada perbualan yang tidak lagi dilihatnya sepenuhnya.

Tiga jalan keluar, mengikut susunan kerja:

Pangkas. Buang atau ringkaskan pusingan terlama. Paling murah dibina, dan biasanya memadai untuk sembang.

Cache. Jika bahagian besar konteks anda ialah awalan tetap — prompt sistem panjang, dokumen rujukan — cache prompt membolehkan pembekal menyimpannya dan mengecaj sepersekian untuk membacanya semula. Ini tidak membesarkan tetingkap, tetapi menghilangkan sebahagian besar kos mengisinya.

Capai. Berhenti menghantar keseluruhan korpus dan hantar hanya bahagian yang berkaitan. Lebih banyak kejuruteraan, tetapi ini satu-satunya pendekatan yang tidak bertambah buruk apabila data anda membesar.

Mencapai tetingkap konteks yang lebih besar ialah pilihan keempat, dan biasanya yang termahal — kerana anda membayar setiap token dalam tetingkap itu pada setiap permintaan.

Adakah tetingkap lebih besar lebih mahal?

Tidak setiap token. Model konteks 1M tidak dicaj pada kadar lebih tinggi daripada yang 200K bagi permintaan yang sama; Claude Sonnet 5 ialah $2.00 setiap juta token input sama ada anda menghantar lima ratus token atau lima ratus ribu.

Tetapi tetingkap lebih besar memudahkan anda membelanjakan lebih, kerana ia menyingkirkan ralat yang sepatutnya menghentikan anda. Mengisi tetingkap sejuta token pada $2.00 setiap juta berkos $2.00 setiap permintaan — dan jika permintaan itu ialah satu pusingan sembang yang berlaku lima puluh ribu kali sebulan, aritmetiknya cepat menjadi serius.

Disiplinnya sama juga: hantar sesedikit yang anda mampu, bukan sebanyak yang dibenarkan.

Versi ringkas

Terokai lagi di ElliSekiz

Bandingkan panjang konteks dan harga token bersebelahan. Halaman model sembang menyenaraikan setiap model teks dengan kadar input dan outputnya.

Kemudian ukur prompt anda sendiri. Setiap halaman model mempunyai playground — jalankan permintaan sebenar dan baca kiraan token yang sebenar sebelum menyaiz apa-apa.

Sumber

Semua catatan