2026-07-13

什麼是脈絡長度?(以及真正把它填滿的是什麼)

脈絡長度是預算,不是功能。什麼會算進去、今天的真實上限在哪裡,以及用完了會怎樣。

什麼是脈絡長度?(以及真正把它填滿的是什麼)

每張模型卡上都寫著「200K 脈絡」或「1M 脈絡」之類的數字。看起來像容量規格,就像磁碟空間。其實它更接近你在每一次請求裡都要花掉的預算——而花掉它的大部分並不是你打的那些字。

數字最後核對日期:2026 年 8 月 26 日。

脈絡長度是什麼

模型沒有記憶。每次呼叫,你都要把整段對話重新傳一遍——系統提示、之前的每一輪、所有附件——它會在寫下一個字之前把這些全部讀完。

脈絡長度就是這一整包的最大尺寸,以 token 計。token 是一小塊文字,在英語中大約是四分之三個詞。

所以它不是儲存空間。它是模型能攤開你文件的那張桌子的大小,每次請求都重新清空。

今天的真實上限

脈絡長度該量級的模型
32,768Qwen 2.5 Coder 32B
200,000Claude Haiku 4.5
262,144Kimi K2.7 Code
400,000整個 GPT-5 家族,包括每個 Codex 變體
1,000,000Claude Opus 5、Claude Sonnet 5、Qwen3 Coder Flash 和 Plus
1,048,576Gemini 2.5 與 3.x 家族、DeepSeek V4 Pro

有兩點值得留意。

一百萬 token 大約是 75 萬個詞——好幾本長篇小說。幾乎沒有哪個應用需要這麼多,而那些覺得需要的,通常是檢索出了問題,而不是脈絡不夠。

1,048,576 就是 2²⁰,不是行銷部湊的整數。某家廠商寫剛好 1,000,000,那是四捨五入過的;寫 1,048,576,那是在回報真實的緩衝區大小。

每個文字模型的 token 價格和脈絡長度都在聊天模型頁

真正把它填滿的是什麼

這是模型卡不會告訴你的部分。Anthropic 的文件公布了幾個最簡請求的準確 token 數,很有教益:

傳送了什麼輸入 token
五個詞的系統提示加兩個詞的訊息14
九個詞的問題加 一個 工具定義403
一張圖片加 "Describe this image"1,028
一個 PDF 加 "Please summarize this document."2,188

一個工具定義要花大約 390 個 token。 帶二十個工具的代理,在使用者還沒輸入任何內容之前,就已經花掉了自己視窗裡約 8,000 個 token——而且每次請求都要付。

一張圖片約一千個 token。 二十張截圖就是 20,000。

而且對話本身在長大。 第 10 輪馱著第 1 到 9 輪。開頭覺得很小的聊天,到結尾會是請求裡最大的那部分。

所以一個「200K 脈絡」的模型,放在帶十五個工具、一段長系統提示和幾張截圖的代理裡,並不是從 200K 起步的。它從遠低於此的地方起步,而且每一輪都在縮水。

陷阱:同樣的文字不是同樣的 token 數

脈絡長度以 token 計量,而 token 在不同模型之間並不是一個穩定單位。

Anthropic 自己的文件寫明,Claude 4.7 及以後使用了更新的分詞器,其中「同樣的輸入文字產生的 token 比早期模型多約 30%」

這意味著:在舊模型上量到 15 萬 token 的提示詞,在新模型上可能是 19.5 萬左右——同樣的字,多佔三成視窗,多花三成錢。如果你曾按某個模型給文件處理流程定過尺寸,後來換了模型,先重新量一遍,別預設還裝得下。

廠商給了你核對的辦法。Anthropic 的 token 計數端點呼叫免費。用你打算實際執行的那個模型去數。

用完了會怎樣

不是優雅降級。視廠商而定,你會拿到一個錯誤、一段被截斷的輸入,或者被悄悄丟掉的歷史——第三種最危險,因為模型會根據一段它已經看不全的對話,自信地作答。

三條出路,按工作量從小到大:

裁減。 丟掉或摘要最舊的幾輪。最省事,聊天情境通常夠用。

快取。 如果你脈絡裡大塊的部分是固定前綴——一段長系統提示、一份參考文件——提示快取能讓廠商把它存下來,重新讀取時只收一小部分費用。這不會把視窗變大,但能拿掉填滿它的絕大部分成本。

檢索。 別再把整個語料都傳過去,只傳相關的部分。工程量更大,但這是唯一一種不會隨著資料成長而變糟的做法。

去搆一個更大的脈絡視窗是第四個選項,通常也最貴——因為那個視窗裡的每一個 token,你每次請求都要付。

視窗更大是不是更貴

按 token 算不是。同一個請求,1M 脈絡的模型不會比 200K 的按更高費率計費;Claude Sonnet 5 是每百萬輸入 token 2.00 美元,你傳五百個 token 還是五十萬個都一樣。

但是 更大的視窗讓人容易花得更多,因為它把本該攔住你的那個錯誤拿掉了。用 2.00 美元每百萬的價格填滿一百萬 token 的視窗,就是每次請求 2.00 美元——如果那個請求是每月發生五萬次的一輪聊天,這筆帳很快就會變得嚴肅。

無論哪種情況,紀律都一樣:能傳多少就傳多少,而不是允許多少就傳多少。

簡版

在 ElliSekiz 上繼續了解

把脈絡長度和 token 價格並排比較。 聊天模型頁列出了每個文字模型及其輸入與輸出費率。

然後量一量你自己的提示詞。 每個模型頁都有 playground——在給任何東西定尺寸之前,先跑一次真實請求,讀一讀真實的 token 數。

來源

全部文章