Toda ficha de modelo traz um número como «200K de contexto» ou «1M de contexto». Parece uma especificação de capacidade, tal como espaço em disco. Está mais perto de ser um orçamento que gastas em cada pedido — e a maior parte do que o consome não é aquilo que escreveste.
Valores verificados pela última vez a 26 de agosto de 2026.
O que é o comprimento de contexto
Um modelo não tem memória. De cada vez que o chamas, envias a conversa inteira outra vez — prompt de sistema, cada turno anterior, quaisquer ficheiros anexados — e ele lê tudo antes de escrever uma palavra.
O comprimento de contexto é o tamanho máximo desse pacote, medido em tokens. Um token é um pedaço pequeno de texto, cerca de três quartos de uma palavra em inglês.
Portanto não é armazenamento. É o tamanho da secretária onde o modelo pode espalhar os teus documentos, limpa de novo a cada pedido.
Os limites reais hoje
| Comprimento de contexto | Modelos desse tamanho |
|---|---|
| 32.768 | Qwen 2.5 Coder 32B |
| 200.000 | Claude Haiku 4.5 |
| 262.144 | Kimi K2.7 Code |
| 400.000 | Toda a família GPT-5, incluindo cada variante Codex |
| 1.000.000 | Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash e Plus |
| 1.048.576 | Famílias Gemini 2.5 e 3.x, DeepSeek V4 Pro |
Duas coisas merecem atenção.
Um milhão de tokens são cerca de 750.000 palavras — vários romances longos. Quase nenhuma aplicação precisa disso, e as que precisam costumam ter um problema de recuperação e não de contexto.
1.048.576 é 2²⁰, não um número redondo de marketing. Onde um fornecedor indica exatamente 1.000.000, arredondou; onde indica 1.048.576, está a reportar o tamanho real do buffer.
Preços por token e comprimentos de contexto de cada modelo de texto estão na página dos modelos de chat.
O que realmente o enche
Esta é a parte que as fichas de modelo não te contam. A documentação da Anthropic publica contagens exatas de tokens para alguns pedidos mínimos, e são instrutivas:
| O que foi enviado | Tokens de entrada |
|---|---|
| Um prompt de sistema de cinco palavras mais uma mensagem de duas | 14 |
| Uma pergunta de nove palavras mais uma definição de ferramenta | 403 |
| Uma imagem mais «Describe this image» | 1.028 |
| Um PDF mais «Please summarize this document.» | 2.188 |
Uma definição de ferramenta custa cerca de 390 tokens. Um agente com vinte ferramentas gasta uns 8.000 tokens da sua janela antes de o utilizador ter escrito seja o que for — e paga-os em cada pedido.
Uma imagem são cerca de mil tokens. Vinte capturas de ecrã são 20.000.
E a própria conversa cresce. O turno 10 carrega os turnos 1 a 9. Um chat que parecia pequeno no início é, no fim, a maior coisa do pedido.
Portanto, um modelo de «200K de contexto» dentro de um agente com quinze ferramentas, um prompt de sistema longo e algumas capturas não começa nos 200K. Começa bastante abaixo, e encolhe a cada turno.
A armadilha: o mesmo texto não é o mesmo número de tokens
O comprimento de contexto mede-se em tokens, e os tokens não são uma unidade estável entre modelos.
A própria documentação da Anthropic afirma que o Claude 4.7 e posteriores usam um tokenizador mais recente em que «o mesmo texto de entrada produz aproximadamente mais 30 por cento de tokens do que nos modelos anteriores».
O que significa: um prompt medido em 150.000 tokens num modelo mais antigo pode dar cerca de 195.000 num mais recente — as mesmas palavras, mais trinta por cento de janela e mais trinta por cento de custo. Se dimensionaste um pipeline de processamento de documentos contra um modelo e depois mudaste, volta a medir antes de assumires que ainda cabe.
Os fornecedores dão-te como verificar. O endpoint de contagem de tokens da Anthropic é gratuito. Conta contra o modelo exato que vais executar.
O que acontece quando o espaço acaba
Não é uma degradação suave. Consoante o fornecedor, recebes um erro, uma entrada truncada, ou histórico descartado em silêncio — e o terceiro é o perigoso, porque o modelo responde com confiança a partir de uma conversa que já não vê por inteiro.
Três saídas, por ordem de trabalho:
Cortar. Eliminar ou resumir os turnos mais antigos. O mais barato de construir, e normalmente suficiente para chat.
Guardar em cache. Se a parte grande do teu contexto é um prefixo fixo — um prompt de sistema longo, um documento de referência —, a cache de prompts permite ao fornecedor guardá-lo e cobrar uma fração para o reler. Isto não aumenta a janela, mas retira a maior parte do custo de a encher.
Recuperar. Deixar de enviar o corpus inteiro e enviar só as partes relevantes. Mais engenharia, mas é a única abordagem que não piora à medida que os teus dados crescem.
Ir buscar uma janela de contexto maior é a quarta opção, e normalmente a mais cara — porque pagas cada token dessa janela em cada pedido.
Uma janela maior custa mais?
Não por token. Um modelo de 1M de contexto não é faturado a uma tarifa mais alta do que um de 200K para o mesmo pedido; o Claude Sonnet 5 são 2,00 $ por milhão de tokens de entrada, quer envies quinhentos tokens quer quinhentos mil.
Mas uma janela maior torna fácil gastar mais, porque remove o erro que te teria travado. Encher uma janela de um milhão de tokens a 2,00 $ por milhão custa 2,00 $ por pedido — e se esse pedido for um turno de chat que acontece cinquenta mil vezes por mês, a aritmética fica séria depressa.
A disciplina é a mesma de qualquer maneira: envia o mínimo que conseguires, não o máximo que te é permitido.
Versão curta
- Comprimento de contexto é o tamanho máximo de um pedido, em tokens, não uma memória.
- Os limites de hoje vão de cerca de 33K a cerca de 1M; quase todo o trabalho em produção cabe folgadamente na parte de baixo.
- Definições de ferramentas (~390 tokens cada), imagens (~1.000), PDF (~2.000) e o histórico reenviado enchem-no mais depressa do que os teus prompts.
- O mesmo texto dá números de tokens diferentes em modelos diferentes — volta a verificar quando mudares.
- Uma janela maior não custa mais por token. Só torna mais fácil gastar mais deles.
Explora mais na ElliSekiz
Compara comprimentos de contexto e preços de tokens lado a lado. A página dos modelos de chat lista cada modelo de texto com as suas tarifas de entrada e saída.
Depois mede o teu próprio prompt. Cada página de modelo tem um playground — corre um pedido real e lê as contagens de tokens verdadeiras antes de dimensionares o que quer que seja.
Fontes
- API de modelos da OpenRouter,
https://openrouter.ai/api/v1/models(comprimentos de contexto, consultada a 26-08-2026) - Anthropic — Token counting (contagens de exemplo documentadas, mudança de tokenizador, endpoint de contagem gratuito)
