每張模型卡上都寫著「200K 脈絡」或「1M 脈絡」之類的數字。看起來像容量規格,就像磁碟空間。其實它更接近你在每一次請求裡都要花掉的預算——而花掉它的大部分並不是你打的那些字。
數字最後核對日期:2026 年 8 月 26 日。
脈絡長度是什麼
模型沒有記憶。每次呼叫,你都要把整段對話重新傳一遍——系統提示、之前的每一輪、所有附件——它會在寫下一個字之前把這些全部讀完。
脈絡長度就是這一整包的最大尺寸,以 token 計。token 是一小塊文字,在英語中大約是四分之三個詞。
所以它不是儲存空間。它是模型能攤開你文件的那張桌子的大小,每次請求都重新清空。
今天的真實上限
| 脈絡長度 | 該量級的模型 |
|---|---|
| 32,768 | Qwen 2.5 Coder 32B |
| 200,000 | Claude Haiku 4.5 |
| 262,144 | Kimi K2.7 Code |
| 400,000 | 整個 GPT-5 家族,包括每個 Codex 變體 |
| 1,000,000 | Claude Opus 5、Claude Sonnet 5、Qwen3 Coder Flash 和 Plus |
| 1,048,576 | Gemini 2.5 與 3.x 家族、DeepSeek V4 Pro |
有兩點值得留意。
一百萬 token 大約是 75 萬個詞——好幾本長篇小說。幾乎沒有哪個應用需要這麼多,而那些覺得需要的,通常是檢索出了問題,而不是脈絡不夠。
1,048,576 就是 2²⁰,不是行銷部湊的整數。某家廠商寫剛好 1,000,000,那是四捨五入過的;寫 1,048,576,那是在回報真實的緩衝區大小。
每個文字模型的 token 價格和脈絡長度都在聊天模型頁。
真正把它填滿的是什麼
這是模型卡不會告訴你的部分。Anthropic 的文件公布了幾個最簡請求的準確 token 數,很有教益:
| 傳送了什麼 | 輸入 token |
|---|---|
| 五個詞的系統提示加兩個詞的訊息 | 14 |
| 九個詞的問題加 一個 工具定義 | 403 |
| 一張圖片加 "Describe this image" | 1,028 |
| 一個 PDF 加 "Please summarize this document." | 2,188 |
一個工具定義要花大約 390 個 token。 帶二十個工具的代理,在使用者還沒輸入任何內容之前,就已經花掉了自己視窗裡約 8,000 個 token——而且每次請求都要付。
一張圖片約一千個 token。 二十張截圖就是 20,000。
而且對話本身在長大。 第 10 輪馱著第 1 到 9 輪。開頭覺得很小的聊天,到結尾會是請求裡最大的那部分。
所以一個「200K 脈絡」的模型,放在帶十五個工具、一段長系統提示和幾張截圖的代理裡,並不是從 200K 起步的。它從遠低於此的地方起步,而且每一輪都在縮水。
陷阱:同樣的文字不是同樣的 token 數
脈絡長度以 token 計量,而 token 在不同模型之間並不是一個穩定單位。
Anthropic 自己的文件寫明,Claude 4.7 及以後使用了更新的分詞器,其中「同樣的輸入文字產生的 token 比早期模型多約 30%」。
這意味著:在舊模型上量到 15 萬 token 的提示詞,在新模型上可能是 19.5 萬左右——同樣的字,多佔三成視窗,多花三成錢。如果你曾按某個模型給文件處理流程定過尺寸,後來換了模型,先重新量一遍,別預設還裝得下。
廠商給了你核對的辦法。Anthropic 的 token 計數端點呼叫免費。用你打算實際執行的那個模型去數。
用完了會怎樣
不是優雅降級。視廠商而定,你會拿到一個錯誤、一段被截斷的輸入,或者被悄悄丟掉的歷史——第三種最危險,因為模型會根據一段它已經看不全的對話,自信地作答。
三條出路,按工作量從小到大:
裁減。 丟掉或摘要最舊的幾輪。最省事,聊天情境通常夠用。
快取。 如果你脈絡裡大塊的部分是固定前綴——一段長系統提示、一份參考文件——提示快取能讓廠商把它存下來,重新讀取時只收一小部分費用。這不會把視窗變大,但能拿掉填滿它的絕大部分成本。
檢索。 別再把整個語料都傳過去,只傳相關的部分。工程量更大,但這是唯一一種不會隨著資料成長而變糟的做法。
去搆一個更大的脈絡視窗是第四個選項,通常也最貴——因為那個視窗裡的每一個 token,你每次請求都要付。
視窗更大是不是更貴
按 token 算不是。同一個請求,1M 脈絡的模型不會比 200K 的按更高費率計費;Claude Sonnet 5 是每百萬輸入 token 2.00 美元,你傳五百個 token 還是五十萬個都一樣。
但是 更大的視窗讓人容易花得更多,因為它把本該攔住你的那個錯誤拿掉了。用 2.00 美元每百萬的價格填滿一百萬 token 的視窗,就是每次請求 2.00 美元——如果那個請求是每月發生五萬次的一輪聊天,這筆帳很快就會變得嚴肅。
無論哪種情況,紀律都一樣:能傳多少就傳多少,而不是允許多少就傳多少。
簡版
- 脈絡長度是一次請求的最大尺寸,以 token 計,不是記憶。
- 今天的上限從約 33K 到約 1M;絕大多數正式環境在低端就綽綽有餘。
- 工具定義(每個約 390 token)、圖片(約 1,000)、PDF(約 2,000)和重新傳送的歷史,比你的提示詞填得快得多。
- 同樣的文字在不同模型上是不同的 token 數——換模型時重新核對。
- 更大的視窗按 token 算並不更貴。它只是讓你更容易多花一些。
在 ElliSekiz 上繼續了解
把脈絡長度和 token 價格並排比較。 聊天模型頁列出了每個文字模型及其輸入與輸出費率。
然後量一量你自己的提示詞。 每個模型頁都有 playground——在給任何東西定尺寸之前,先跑一次真實請求,讀一讀真實的 token 數。
來源
- OpenRouter models API,
https://openrouter.ai/api/v1/models(脈絡長度,讀取於 2026-08-26) - Anthropic — Token counting(有據可查的範例計數、分詞器變更、免費計數端點)
