2026-07-13

Czym jest długość kontekstu? (I co ją naprawdę zapełnia)

Długość kontekstu to budżet, nie funkcja. Co się na nią składa, jakie są dziś rzeczywiste granice i co się dzieje, gdy zabraknie miejsca.

Czym jest długość kontekstu? (I co ją naprawdę zapełnia)

Na każdej karcie modelu widnieje liczba w rodzaju „200K kontekstu" albo „1M kontekstu". Wygląda jak parametr pojemności, tak jak miejsce na dysku. Bliżej jej do budżetu, który wydajesz przy każdym zapytaniu — a większość tego, co go zjada, to nie jest to, co wpisałeś.

Dane sprawdzone ostatnio 26 sierpnia 2026.

Czym jest długość kontekstu

Model nie ma pamięci. Za każdym wywołaniem wysyłasz całą rozmowę od nowa — prompt systemowy, każdą wcześniejszą turę, wszystkie załączone pliki — a on czyta to wszystko, zanim napisze choć słowo.

Długość kontekstu to maksymalny rozmiar tej paczki, mierzony w tokenach. Token to mały kawałek tekstu, w angielskim mniej więcej trzy czwarte słowa.

To zatem nie jest pamięć trwała. To wielkość biurka, na którym model może rozłożyć twoje dokumenty — sprzątanego do czysta przy każdym zapytaniu.

Rzeczywiste granice dzisiaj

Długość kontekstuModele tej wielkości
32 768Qwen 2.5 Coder 32B
200 000Claude Haiku 4.5
262 144Kimi K2.7 Code
400 000Cała rodzina GPT-5, w tym każdy wariant Codex
1 000 000Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash i Plus
1 048 576Rodziny Gemini 2.5 i 3.x, DeepSeek V4 Pro

Dwie rzeczy warto zauważyć.

Milion tokenów to około 750 000 słów — kilka długich powieści. Prawie żadna aplikacja tego nie potrzebuje, a te, które potrzebują, mają zwykle problem z wyszukiwaniem, a nie z kontekstem.

1 048 576 to 2²⁰, a nie okrągła liczba marketingowa. Tam, gdzie dostawca podaje dokładnie 1 000 000, zaokrąglił; tam, gdzie podaje 1 048 576, raportuje prawdziwy rozmiar bufora.

Ceny za token i długości kontekstu każdego modelu tekstowego są na stronie modeli czatowych.

Co go naprawdę zapełnia

To ta część, o której karty modeli milczą. Dokumentacja Anthropic publikuje dokładne liczby tokenów dla kilku minimalnych zapytań i warto się im przyjrzeć:

Co zostało wysłaneTokeny wejściowe
Prompt systemowy z pięciu słów plus wiadomość z dwóch14
Pytanie z dziewięciu słów plus jedna definicja narzędzia403
Jeden obraz plus „Describe this image"1 028
Jeden PDF plus „Please summarize this document."2 188

Jedna definicja narzędzia kosztuje około 390 tokenów. Agent z dwudziestoma narzędziami wydaje jakieś 8 000 tokenów swojego okna, zanim użytkownik cokolwiek wpisze — i płaci za nie przy każdym zapytaniu.

Obraz to około tysiąca tokenów. Dwadzieścia zrzutów ekranu to 20 000.

A sama rozmowa rośnie. Tura 10 niesie tury od 1 do 9. Czat, który na początku wydawał się mały, pod koniec jest największą rzeczą w zapytaniu.

Zatem model z „200K kontekstu" w agencie z piętnastoma narzędziami, długim promptem systemowym i kilkoma zrzutami wcale nie startuje z 200K. Startuje sporo poniżej i kurczy się z każdą turą.

Pułapka: ten sam tekst to nie ta sama liczba tokenów

Długość kontekstu mierzy się w tokenach, a tokeny nie są jednostką stabilną między modelami.

Dokumentacja Anthropic stwierdza, że Claude 4.7 i nowsze używają nowszego tokenizatora, w którym „ten sam tekst wejściowy daje o około 30 procent więcej tokenów niż we wcześniejszych modelach".

Co oznacza: prompt zmierzony na 150 000 tokenów na starszym modelu może dawać około 195 000 na nowszym — te same słowa, trzydzieści procent więcej okna i trzydzieści procent więcej kosztu. Jeśli wymiarowałeś pipeline przetwarzania dokumentów pod jeden model, a potem go zmieniłeś, zmierz ponownie, zanim założysz, że nadal się mieści.

Dostawcy dają ci sposób sprawdzenia. Endpoint Anthropic do liczenia tokenów jest darmowy w wywołaniu. Licz na dokładnie tym modelu, który zamierzasz uruchomić.

Co się dzieje, gdy zabraknie miejsca

Nie jest to łagodna degradacja. Zależnie od dostawcy dostajesz błąd, obcięte wejście albo po cichu porzuconą historię — i to trzecie jest groźne, bo model odpowiada pewnie na podstawie rozmowy, której już nie widzi w całości.

Trzy wyjścia, w kolejności nakładu pracy:

Przycinaj. Usuwaj albo streszczaj najstarsze tury. Najtańsze w budowie i zwykle wystarczające dla czatu.

Buforuj. Jeśli dużą częścią twojego kontekstu jest stały prefiks — długi prompt systemowy, dokument referencyjny — buforowanie promptów pozwala dostawcy go przechować i naliczyć ułamek za ponowne odczytanie. To nie powiększa okna, ale zdejmuje większość kosztu jego wypełniania.

Wyszukuj. Przestań wysyłać cały korpus i wysyłaj tylko istotne fragmenty. Więcej inżynierii, ale to jedyne podejście, które nie pogarsza się wraz ze wzrostem danych.

Sięganie po większe okno kontekstu to czwarta opcja i zwykle najdroższa — bo płacisz za każdy token w tym oknie przy każdym zapytaniu.

Czy większe okno kosztuje więcej?

Nie w przeliczeniu na token. Model z 1M kontekstu nie jest rozliczany wyższą stawką niż ten z 200K za to samo zapytanie; Claude Sonnet 5 to 2,00 $ za milion tokenów wejściowych, czy wyślesz pięćset tokenów, czy pięćset tysięcy.

Ale większe okno ułatwia wydawanie więcej, bo usuwa błąd, który by cię zatrzymał. Wypełnienie okna miliona tokenów po 2,00 $ za milion kosztuje 2,00 $ za zapytanie — a jeśli tym zapytaniem jest tura czatu zdarzająca się pięćdziesiąt tysięcy razy w miesiącu, arytmetyka szybko robi się poważna.

Dyscyplina jest tak czy owak ta sama: wysyłaj tak mało, jak możesz, a nie tak dużo, jak wolno.

Krótka wersja

Zobacz więcej na ElliSekiz

Porównaj długości kontekstu i ceny tokenów obok siebie. Strona modeli czatowych wymienia każdy model tekstowy wraz ze stawkami wejściowymi i wyjściowymi.

Potem zmierz własny prompt. Każda strona modelu ma playground — uruchom prawdziwe zapytanie i odczytaj rzeczywiste liczby tokenów, zanim cokolwiek zwymiarujesz.

Źródła

Wszystkie wpisy