2026-07-13

O que é o comprimento de contexto? (E o que realmente o enche)

O comprimento de contexto é um orçamento, não uma funcionalidade. O que conta para ele, quais são os limites reais hoje, e o que acontece quando o espaço acaba.

O que é o comprimento de contexto? (E o que realmente o enche)

Toda ficha de modelo traz um número como «200K de contexto» ou «1M de contexto». Parece uma especificação de capacidade, tal como espaço em disco. Está mais perto de ser um orçamento que gastas em cada pedido — e a maior parte do que o consome não é aquilo que escreveste.

Valores verificados pela última vez a 26 de agosto de 2026.

O que é o comprimento de contexto

Um modelo não tem memória. De cada vez que o chamas, envias a conversa inteira outra vez — prompt de sistema, cada turno anterior, quaisquer ficheiros anexados — e ele lê tudo antes de escrever uma palavra.

O comprimento de contexto é o tamanho máximo desse pacote, medido em tokens. Um token é um pedaço pequeno de texto, cerca de três quartos de uma palavra em inglês.

Portanto não é armazenamento. É o tamanho da secretária onde o modelo pode espalhar os teus documentos, limpa de novo a cada pedido.

Os limites reais hoje

Comprimento de contextoModelos desse tamanho
32.768Qwen 2.5 Coder 32B
200.000Claude Haiku 4.5
262.144Kimi K2.7 Code
400.000Toda a família GPT-5, incluindo cada variante Codex
1.000.000Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash e Plus
1.048.576Famílias Gemini 2.5 e 3.x, DeepSeek V4 Pro

Duas coisas merecem atenção.

Um milhão de tokens são cerca de 750.000 palavras — vários romances longos. Quase nenhuma aplicação precisa disso, e as que precisam costumam ter um problema de recuperação e não de contexto.

1.048.576 é 2²⁰, não um número redondo de marketing. Onde um fornecedor indica exatamente 1.000.000, arredondou; onde indica 1.048.576, está a reportar o tamanho real do buffer.

Preços por token e comprimentos de contexto de cada modelo de texto estão na página dos modelos de chat.

O que realmente o enche

Esta é a parte que as fichas de modelo não te contam. A documentação da Anthropic publica contagens exatas de tokens para alguns pedidos mínimos, e são instrutivas:

O que foi enviadoTokens de entrada
Um prompt de sistema de cinco palavras mais uma mensagem de duas14
Uma pergunta de nove palavras mais uma definição de ferramenta403
Uma imagem mais «Describe this image»1.028
Um PDF mais «Please summarize this document.»2.188

Uma definição de ferramenta custa cerca de 390 tokens. Um agente com vinte ferramentas gasta uns 8.000 tokens da sua janela antes de o utilizador ter escrito seja o que for — e paga-os em cada pedido.

Uma imagem são cerca de mil tokens. Vinte capturas de ecrã são 20.000.

E a própria conversa cresce. O turno 10 carrega os turnos 1 a 9. Um chat que parecia pequeno no início é, no fim, a maior coisa do pedido.

Portanto, um modelo de «200K de contexto» dentro de um agente com quinze ferramentas, um prompt de sistema longo e algumas capturas não começa nos 200K. Começa bastante abaixo, e encolhe a cada turno.

A armadilha: o mesmo texto não é o mesmo número de tokens

O comprimento de contexto mede-se em tokens, e os tokens não são uma unidade estável entre modelos.

A própria documentação da Anthropic afirma que o Claude 4.7 e posteriores usam um tokenizador mais recente em que «o mesmo texto de entrada produz aproximadamente mais 30 por cento de tokens do que nos modelos anteriores».

O que significa: um prompt medido em 150.000 tokens num modelo mais antigo pode dar cerca de 195.000 num mais recente — as mesmas palavras, mais trinta por cento de janela e mais trinta por cento de custo. Se dimensionaste um pipeline de processamento de documentos contra um modelo e depois mudaste, volta a medir antes de assumires que ainda cabe.

Os fornecedores dão-te como verificar. O endpoint de contagem de tokens da Anthropic é gratuito. Conta contra o modelo exato que vais executar.

O que acontece quando o espaço acaba

Não é uma degradação suave. Consoante o fornecedor, recebes um erro, uma entrada truncada, ou histórico descartado em silêncio — e o terceiro é o perigoso, porque o modelo responde com confiança a partir de uma conversa que já não vê por inteiro.

Três saídas, por ordem de trabalho:

Cortar. Eliminar ou resumir os turnos mais antigos. O mais barato de construir, e normalmente suficiente para chat.

Guardar em cache. Se a parte grande do teu contexto é um prefixo fixo — um prompt de sistema longo, um documento de referência —, a cache de prompts permite ao fornecedor guardá-lo e cobrar uma fração para o reler. Isto não aumenta a janela, mas retira a maior parte do custo de a encher.

Recuperar. Deixar de enviar o corpus inteiro e enviar só as partes relevantes. Mais engenharia, mas é a única abordagem que não piora à medida que os teus dados crescem.

Ir buscar uma janela de contexto maior é a quarta opção, e normalmente a mais cara — porque pagas cada token dessa janela em cada pedido.

Uma janela maior custa mais?

Não por token. Um modelo de 1M de contexto não é faturado a uma tarifa mais alta do que um de 200K para o mesmo pedido; o Claude Sonnet 5 são 2,00 $ por milhão de tokens de entrada, quer envies quinhentos tokens quer quinhentos mil.

Mas uma janela maior torna fácil gastar mais, porque remove o erro que te teria travado. Encher uma janela de um milhão de tokens a 2,00 $ por milhão custa 2,00 $ por pedido — e se esse pedido for um turno de chat que acontece cinquenta mil vezes por mês, a aritmética fica séria depressa.

A disciplina é a mesma de qualquer maneira: envia o mínimo que conseguires, não o máximo que te é permitido.

Versão curta

Explora mais na ElliSekiz

Compara comprimentos de contexto e preços de tokens lado a lado. A página dos modelos de chat lista cada modelo de texto com as suas tarifas de entrada e saída.

Depois mede o teu próprio prompt. Cada página de modelo tem um playground — corre um pedido real e lê as contagens de tokens verdadeiras antes de dimensionares o que quer que seja.

Fontes

Todos os posts