Toda ficha de modelo lleva un número como «200K de contexto» o «1M de contexto». Parece una especificación de capacidad, igual que el espacio en disco. Se parece más a un presupuesto que gastas en cada petición — y la mayor parte de lo que lo consume no es lo que tú escribiste.
Cifras comprobadas por última vez: 26 de agosto de 2026.
Qué es la longitud de contexto
Un modelo no tiene memoria. Cada vez que lo llamas le envías la conversación entera otra vez — el prompt de sistema, cada turno anterior, cualquier archivo adjunto — y lo lee todo antes de escribir una palabra.
La longitud de contexto es el tamaño máximo de ese paquete, medido en tokens. Un token es un fragmento pequeño de texto, unos tres cuartos de palabra en inglés.
Así que no es almacenamiento. Es el tamaño de la mesa sobre la que el modelo puede extender tus documentos, despejada de nuevo en cada petición.
Los límites reales hoy
| Longitud de contexto | Modelos de ese tamaño |
|---|---|
| 32.768 | Qwen 2.5 Coder 32B |
| 200.000 | Claude Haiku 4.5 |
| 262.144 | Kimi K2.7 Code |
| 400.000 | Toda la familia GPT-5, incluida cada variante Codex |
| 1.000.000 | Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash y Plus |
| 1.048.576 | Familias Gemini 2.5 y 3.x, DeepSeek V4 Pro |
Dos cosas merecen atención.
Un millón de tokens son unas 750.000 palabras — varias novelas largas. Casi ninguna aplicación necesita eso, y las que lo necesitan suelen tener un problema de recuperación, no de contexto.
1.048.576 es 2²⁰, no una cifra redonda de marketing. Donde un proveedor cita exactamente 1.000.000 ha redondeado; donde cita 1.048.576 está informando del búfer real.
Los precios por token y las longitudes de contexto de cada modelo de texto están en la página de modelos de chat.
Qué lo llena de verdad
Esta es la parte que las fichas de modelo no te cuentan. La documentación de Anthropic publica recuentos exactos de tokens para unas pocas peticiones mínimas, y son instructivos:
| Qué se envió | Tokens de entrada |
|---|---|
| Un prompt de sistema de cinco palabras más un mensaje de dos | 14 |
| Una pregunta de nueve palabras más una definición de herramienta | 403 |
| Una imagen más «Describe this image» | 1.028 |
| Un PDF más «Please summarize this document.» | 2.188 |
Una definición de herramienta cuesta unos 390 tokens. Un agente con veinte herramientas gasta unos 8.000 tokens de su ventana antes de que el usuario haya escrito nada — y los paga en cada petición.
Una imagen son unos mil tokens. Veinte capturas de pantalla son 20.000.
Y la propia conversación crece. El turno 10 arrastra los turnos 1 al 9. Un chat que parecía pequeño al principio es, al final, lo más grande de la petición.
Así que un modelo de «200K de contexto» dentro de un agente con quince herramientas, un prompt de sistema largo y unas cuantas capturas no empieza en 200K. Empieza bastante por debajo, y encoge en cada turno.
La trampa: el mismo texto no son los mismos tokens
La longitud de contexto se mide en tokens, y los tokens no son una unidad estable entre modelos.
La propia documentación de Anthropic indica que Claude 4.7 y posteriores usan un tokenizador más nuevo en el que «el mismo texto de entrada produce aproximadamente un 30 por ciento más de tokens que en los modelos anteriores».
Lo que significa: un prompt medido en 150.000 tokens en un modelo antiguo puede ser unos 195.000 en uno nuevo — las mismas palabras, un treinta por ciento más de ventana y un treinta por ciento más de coste. Si dimensionaste un pipeline de procesamiento de documentos contra un modelo y luego cambiaste, vuelve a medir antes de dar por hecho que sigue cabiendo.
Los proveedores te dan cómo comprobarlo. El endpoint de recuento de tokens de Anthropic es gratuito. Cuenta contra el modelo exacto que vayas a ejecutar.
Qué pasa cuando te quedas sin espacio
No es una degradación elegante. Según el proveedor obtienes un error, una entrada truncada, o historial descartado en silencio — y el tercero es el peligroso, porque el modelo responde con seguridad desde una conversación que ya no ve entera.
Tres salidas, ordenadas por el trabajo que cuestan:
Recortar. Eliminar o resumir los turnos más antiguos. Lo más barato de construir, y normalmente suficiente para un chat.
Cachear. Si la parte grande de tu contexto es un prefijo fijo — un prompt de sistema largo, un documento de referencia —, el almacenamiento en caché de prompts permite al proveedor guardarlo y cobrar una fracción por releerlo. Esto no agranda la ventana, pero elimina casi todo el coste de llenarla.
Recuperar. Dejar de enviar el corpus entero y mandar solo las partes relevantes. Más ingeniería, pero es el único enfoque que no empeora a medida que crecen tus datos.
Recurrir a una ventana de contexto mayor es la cuarta opción, y normalmente la más cara — porque pagas cada token de esa ventana en cada petición.
¿Cuesta más una ventana más grande?
No por token. Un modelo de 1M de contexto no se factura a una tarifa mayor que uno de 200K para la misma petición; Claude Sonnet 5 cuesta 2,00 $ por millón de tokens de entrada tanto si envías quinientos tokens como quinientos mil.
Pero una ventana más grande facilita gastar más, porque quita el error que te habría detenido. Llenar una ventana de un millón de tokens a 2,00 $ por millón cuesta 2,00 $ por petición — y si esa petición es un turno de chat que ocurre cincuenta mil veces al mes, la aritmética se pone seria rápido.
La disciplina es la misma en cualquier caso: envía lo mínimo que puedas, no lo máximo que te permiten.
La versión corta
- La longitud de contexto es el tamaño máximo de una petición, en tokens, no una memoria.
- Los límites de hoy van de unos 33K a cerca de 1M; casi todo el trabajo en producción cabe holgadamente en la parte baja.
- Las definiciones de herramientas (~390 tokens cada una), las imágenes (~1.000), los PDF (~2.000) y el historial reenviado lo llenan más rápido que tus prompts.
- El mismo texto son distintos tokens en distintos modelos — vuelve a comprobarlo al cambiar.
- Una ventana mayor no cuesta más por token. Solo hace más fácil gastar más de ellos.
Explora más en ElliSekiz
Compara longitudes de contexto y precios por token, uno al lado del otro. La página de modelos de chat lista cada modelo de texto con sus tarifas de entrada y salida.
Y después mide tu propio prompt. Cada página de modelo tiene un playground: lanza una petición real y lee los recuentos de tokens de verdad antes de dimensionar nada.
Fuentes
- API de modelos de OpenRouter,
https://openrouter.ai/api/v1/models(longitudes de contexto, consultada el 26-08-2026) - Anthropic — Token counting (recuentos de ejemplo documentados, cambio de tokenizador, endpoint de recuento gratuito)
