Her model kartında "200K context" ya da "1M context" gibi bir sayı var. Disk alanı gibi bir kapasite bilgisi izlenimi veriyor. Aslında her istekte yeniden harcadığın bir bütçeye daha yakın — ve onu harcayan şeyin çoğu senin yazdığın metin değil.
Rakamlar son kontrol: 26 Ağustos 2026.
Context length nedir
Modelin hafızası yoktur. Her çağrıda bütün sohbeti yeniden gönderirsin — sistem promptu, önceki her tur, ekli dosyalar — ve model tek kelime yazmadan önce hepsini okur.
Context length, o paketin alabileceği en büyük boyuttur, token cinsinden. Token, küçük bir metin parçasıdır; İngilizcede kabaca bir kelimenin dörtte üçü.
Yani depolama değil. Modelin belgelerini yayabildiği masanın büyüklüğü — ve o masa her istekte sıfırdan kuruluyor.
Bugünkü gerçek sınırlar
| Context length | O boyuttaki modeller |
|---|---|
| 32.768 | Qwen 2.5 Coder 32B |
| 200.000 | Claude Haiku 4.5 |
| 262.144 | Kimi K2.7 Code |
| 400.000 | Bütün GPT-5 ailesi, her Codex sürümü dahil |
| 1.000.000 | Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash ve Plus |
| 1.048.576 | Gemini 2.5 ve 3.x ailesi, DeepSeek V4 Pro |
İki şey dikkat çekiyor.
Bir milyon token kabaca 750.000 kelime — birkaç uzun roman. Neredeyse hiçbir uygulamanın buna ihtiyacı yok, ihtiyacı olanların da genelde context sorunu değil erişim sorunu var.
1.048.576 sayısı 2²⁰, pazarlama için yuvarlanmış bir sayı değil. Bir sağlayıcı tam olarak 1.000.000 yazıyorsa yuvarlamıştır; 1.048.576 yazıyorsa gerçek tampon boyutunu bildiriyordur.
Her metin modelinin token fiyatı ve context uzunluğu sohbet modelleri sayfasında.
Onu gerçekte ne dolduruyor
Model kartlarının anlatmadığı kısım burası. Anthropic'in dokümanı birkaç minimal isteğin tam token sayısını yayınlıyor ve öğretici:
| Gönderilen | Girdi token |
|---|---|
| Beş kelimelik sistem promptu artı iki kelimelik mesaj | 14 |
| Dokuz kelimelik soru artı tek bir araç tanımı | 403 |
| Bir görsel artı "Describe this image" | 1.028 |
| Bir PDF artı "Please summarize this document." | 2.188 |
Tek bir araç tanımı yaklaşık 390 token. Yirmi araçlı bir ajan, kullanıcı hiçbir şey yazmadan penceresinin yaklaşık 8.000 token'ını harcamış oluyor — ve bunu her istekte ödüyor.
Bir görsel yaklaşık bin token. Yirmi ekran görüntüsü 20.000 eder.
Bir de sohbetin kendisi büyüyor. 10. tur, 1'den 9'a kadar olan turları taşır. Başlangıçta küçük görünen bir sohbet, sonunda istekteki en büyük şeydir.
Yani on beş araçlı, uzun sistem promptlu ve birkaç ekran görüntülü bir ajanda "200K context" modeli 200K'dan başlamıyor. Belirgin daha aşağıdan başlıyor ve her turda küçülüyor.
Tuzak: aynı metin aynı sayıda token değil
Context length token cinsinden ölçülüyor ve token modeller arasında sabit bir birim değil.
Anthropic'in kendi dokümanı, Claude 4.7 ve sonrasının yeni bir tokenizer kullandığını ve "aynı girdi metninin önceki modellere göre yaklaşık yüzde 30 daha fazla token ürettiğini" yazıyor.
Yani: eski bir modelde 150.000 token ölçülen bir prompt, yeni bir modelde yaklaşık 195.000 olabilir — aynı kelimeler, pencerenin %30 fazlası ve maliyetin %30 fazlası. Bir belge işleme hattını bir modele göre boyutlandırıp sonra model değiştirdiysen, hâlâ sığdığını varsaymadan önce yeniden ölç.
Sağlayıcılar bunu kontrol etmenin yolunu veriyor. Anthropic'in token sayma uç noktası ücretsiz. Çalıştıracağın modele karşı say.
Sınıra çarpınca ne oluyor
Kademeli bir yavaşlama değil. Sağlayıcıya göre ya hata alırsın, ya girdin kırpılır, ya da geçmiş sessizce düşürülür — ve tehlikeli olan üçüncüsü, çünkü model artık tamamını göremediği bir sohbetten kendinden emin cevap verir.
Üç çıkış yolu, iş yüküne göre sıralı:
Kırp. En eski turları at ya da özetle. Kurması en ucuz yol ve sohbet için genelde yeterli.
Önbellekle. Context'in büyük kısmı sabit bir ön ekse — uzun bir sistem promptu, bir referans belge — prompt önbellekleme sağlayıcının onu saklamasını ve tekrar okumak için çok küçük bir ücret almasını sağlar. Bu pencereyi büyütmez ama doldurma maliyetinin çoğunu kaldırır.
Getir. Bütün derlemeyi göndermeyi bırak, yalnızca ilgili parçaları gönder. Daha çok mühendislik ama verin büyüdükçe kötüleşmeyen tek yaklaşım bu.
Daha büyük bir context penceresine uzanmak dördüncü seçenek ve genelde en pahalısı — çünkü o penceredeki her token'ı her istekte ödüyorsun.
Büyük pencere daha mı pahalı?
Token başına değil. 1M context'li bir model, aynı istek için 200K'lık birinden daha yüksek oranla faturalanmaz; Claude Sonnet 5, beş yüz token da gönderseniz beş yüz bin token da gönderseniz 1M girdi token başına $2.00.
Ama büyük pencere daha çok harcamayı kolaylaştırır, çünkü seni durduracak hatayı ortadan kaldırır. 1M token'lık bir pencereyi 1M başına $2.00'dan doldurmak istek başına $2.00 eder — ve o istek ayda elli bin kez olan bir sohbet turuysa aritmetik hızla ciddileşir.
Disiplin her iki durumda da aynı: izin verilenin en fazlasını değil, yapabileceğinin en azını gönder.
Özet
- Context length, bir isteğin alabileceği en büyük boyuttur; token cinsinden, ve hafıza değildir.
- Bugünkü sınırlar yaklaşık 33K ile 1M arasında; üretimdeki işlerin çoğu alt uçta rahatça sığar.
- Araç tanımları (her biri ~390 token), görseller (~1.000), PDF'ler (~2.000) ve tekrar gönderilen geçmiş, onu senin promptlarından daha hızlı doldurur.
- Aynı metin farklı modellerde farklı sayıda token eder — model değiştirince yeniden ölç.
- Büyük pencere token başına daha pahalı değil. Sadece daha çok token harcamayı kolaylaştırıyor.
ElliSekiz'de devamı
Context uzunluklarını ve token fiyatlarını yan yana karşılaştır. Sohbet modelleri sayfası her metin modelini girdi ve çıktı oranlarıyla listeliyor.
Sonra kendi promptunu ölç. Her model sayfasında bir playground var — bir şeyi boyutlandırmadan önce gerçek bir istek çalıştır ve gerçek token sayılarını oku.
Kaynaklar
- OpenRouter models API,
https://openrouter.ai/api/v1/models(context uzunlukları, 26 Ağustos 2026'da okundu) - Anthropic — Token counting (belgelenmiş örnek sayımlar, tokenizer değişikliği, ücretsiz sayma uç noktası)
