Chaque fiche de modèle porte un nombre du genre « 200K de contexte » ou « 1M de contexte ». Cela ressemble à une spécification de capacité, comme de l'espace disque. C'est plutôt un budget que tu dépenses à chaque requête — et l'essentiel de ce qui le consomme n'est pas ce que tu as tapé.
Chiffres vérifiés pour la dernière fois le 26 août 2026.
Ce qu'est la longueur de contexte
Un modèle n'a pas de mémoire. À chaque appel, tu renvoies toute la conversation — le prompt système, chaque tour précédent, les fichiers joints — et il lit l'ensemble avant d'écrire un mot.
La longueur de contexte est la taille maximale de ce paquet, mesurée en tokens. Un token est un petit morceau de texte, environ trois quarts de mot en anglais.
Ce n'est donc pas du stockage. C'est la taille du bureau sur lequel le modèle peut étaler tes documents, débarrassé à neuf à chaque requête.
Les limites réelles aujourd'hui
| Longueur de contexte | Modèles de cette taille |
|---|---|
| 32 768 | Qwen 2.5 Coder 32B |
| 200 000 | Claude Haiku 4.5 |
| 262 144 | Kimi K2.7 Code |
| 400 000 | Toute la famille GPT-5, y compris chaque variante Codex |
| 1 000 000 | Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash et Plus |
| 1 048 576 | Familles Gemini 2.5 et 3.x, DeepSeek V4 Pro |
Deux points méritent l'attention.
Un million de tokens font environ 750 000 mots — plusieurs longs romans. Presque aucune application n'en a besoin, et celles qui en ont besoin ont généralement un problème de recherche documentaire, pas un problème de contexte.
1 048 576 vaut 2²⁰, ce n'est pas un chiffre rond de marketing. Là où un fournisseur annonce exactement 1 000 000, il a arrondi ; là où il annonce 1 048 576, il rapporte la vraie taille du tampon.
Les prix par token et les longueurs de contexte de chaque modèle de texte sont sur la page des modèles de chat.
Ce qui la remplit vraiment
C'est la partie que les fiches de modèle passent sous silence. La documentation d'Anthropic publie les comptes exacts de tokens pour quelques requêtes minimales, et ils sont instructifs :
| Ce qui a été envoyé | Tokens d'entrée |
|---|---|
| Un prompt système de cinq mots plus un message de deux mots | 14 |
| Une question de neuf mots plus une définition d'outil | 403 |
| Une image plus « Describe this image » | 1 028 |
| Un PDF plus « Please summarize this document. » | 2 188 |
Une définition d'outil coûte environ 390 tokens. Un agent doté de vingt outils dépense quelque 8 000 tokens de sa fenêtre avant que l'utilisateur ait tapé quoi que ce soit — et les paie à chaque requête.
Une image, c'est environ mille tokens. Vingt captures d'écran, 20 000.
Et la conversation elle-même grossit. Le tour 10 porte les tours 1 à 9. Un chat qui semblait petit au début est, à la fin, la plus grosse chose de la requête.
Un modèle « 200K de contexte » dans un agent avec quinze outils, un long prompt système et quelques captures ne démarre donc pas à 200K. Il démarre bien en dessous, et rétrécit à chaque tour.
Le piège : le même texte n'est pas le même nombre de tokens
La longueur de contexte se mesure en tokens, et les tokens ne sont pas une unité stable d'un modèle à l'autre.
La documentation d'Anthropic indique elle-même que Claude 4.7 et les versions suivantes utilisent un tokeniseur plus récent où « le même texte d'entrée produit environ 30 pour cent de tokens de plus que sur les modèles antérieurs ».
Autrement dit : un prompt mesuré à 150 000 tokens sur un ancien modèle peut faire près de 195 000 sur un plus récent — les mêmes mots, trente pour cent de fenêtre en plus, trente pour cent de coût en plus. Si tu as dimensionné un pipeline de traitement documentaire pour un modèle puis que tu en as changé, remesure avant de supposer que ça tient encore.
Les fournisseurs te donnent de quoi vérifier. L'endpoint de comptage de tokens d'Anthropic est gratuit. Compte contre le modèle exact que tu comptes exécuter.
Ce qui arrive quand la place manque
Pas une dégradation en douceur. Selon le fournisseur, tu obtiens une erreur, une entrée tronquée, ou un historique silencieusement supprimé — et c'est le troisième qui est dangereux, parce que le modèle répond avec assurance à partir d'une conversation qu'il ne voit plus en entier.
Trois issues, par ordre d'effort :
Élaguer. Supprimer ou résumer les tours les plus anciens. Le moins cher à construire, et généralement suffisant pour du chat.
Mettre en cache. Si la grosse part de ton contexte est un préfixe fixe — un long prompt système, un document de référence —, le cache de prompt permet au fournisseur de le stocker et de facturer une fraction pour le relire. Cela n'agrandit pas la fenêtre, mais cela supprime l'essentiel du coût de son remplissage.
Rechercher. Cesser d'envoyer tout le corpus et n'envoyer que les parties pertinentes. Plus d'ingénierie, mais c'est la seule approche qui ne se dégrade pas à mesure que tes données grossissent.
Se tourner vers une fenêtre de contexte plus grande est la quatrième option, et généralement la plus chère — parce que tu paies chaque token de cette fenêtre à chaque requête.
Une fenêtre plus grande coûte-t-elle plus cher ?
Pas par token. Un modèle à 1M de contexte n'est pas facturé à un tarif plus élevé qu'un modèle à 200K pour la même requête ; Claude Sonnet 5 est à 2,00 $ le million de tokens d'entrée, que tu envoies cinq cents tokens ou cinq cent mille.
Mais une fenêtre plus grande rend facile d'en dépenser plus, parce qu'elle supprime l'erreur qui t'aurait arrêté. Remplir une fenêtre d'un million de tokens à 2,00 $ le million coûte 2,00 $ par requête — et si cette requête est un tour de chat qui se produit cinquante mille fois par mois, l'arithmétique devient vite sérieuse.
La discipline est la même dans les deux cas : envoie le moins que tu peux, pas le plus que tu as le droit.
En bref
- La longueur de contexte est la taille maximale d'une requête, en tokens, pas une mémoire.
- Les limites actuelles vont d'environ 33K à environ 1M ; l'essentiel du travail en production tient confortablement dans le bas de l'échelle.
- Les définitions d'outils (~390 tokens chacune), les images (~1 000), les PDF (~2 000) et l'historique renvoyé la remplissent plus vite que tes prompts.
- Le même texte fait un nombre de tokens différent selon les modèles — remesure quand tu changes.
- Une fenêtre plus grande ne coûte pas plus par token. Elle rend juste plus facile d'en dépenser davantage.
Explorer plus loin sur ElliSekiz
Compare longueurs de contexte et prix des tokens côte à côte. La page des modèles de chat liste chaque modèle de texte avec ses tarifs d'entrée et de sortie.
Puis mesure ton propre prompt. Chaque page de modèle a un playground — lance une vraie requête et lis les comptes de tokens réels avant de dimensionner quoi que ce soit.
Sources
- API des modèles OpenRouter,
https://openrouter.ai/api/v1/models(longueurs de contexte, consultée le 26/08/2026) - Anthropic — Token counting (comptes d'exemple documentés, changement de tokeniseur, endpoint de comptage gratuit)
