2026-07-13

Qu'est-ce que la longueur de contexte ? (Et ce qui la remplit vraiment)

La longueur de contexte est un budget, pas une fonctionnalité. Ce qui la consomme, les limites réelles aujourd'hui, et ce qui arrive quand la place manque.

Qu'est-ce que la longueur de contexte ? (Et ce qui la remplit vraiment)

Chaque fiche de modèle porte un nombre du genre « 200K de contexte » ou « 1M de contexte ». Cela ressemble à une spécification de capacité, comme de l'espace disque. C'est plutôt un budget que tu dépenses à chaque requête — et l'essentiel de ce qui le consomme n'est pas ce que tu as tapé.

Chiffres vérifiés pour la dernière fois le 26 août 2026.

Ce qu'est la longueur de contexte

Un modèle n'a pas de mémoire. À chaque appel, tu renvoies toute la conversation — le prompt système, chaque tour précédent, les fichiers joints — et il lit l'ensemble avant d'écrire un mot.

La longueur de contexte est la taille maximale de ce paquet, mesurée en tokens. Un token est un petit morceau de texte, environ trois quarts de mot en anglais.

Ce n'est donc pas du stockage. C'est la taille du bureau sur lequel le modèle peut étaler tes documents, débarrassé à neuf à chaque requête.

Les limites réelles aujourd'hui

Longueur de contexteModèles de cette taille
32 768Qwen 2.5 Coder 32B
200 000Claude Haiku 4.5
262 144Kimi K2.7 Code
400 000Toute la famille GPT-5, y compris chaque variante Codex
1 000 000Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash et Plus
1 048 576Familles Gemini 2.5 et 3.x, DeepSeek V4 Pro

Deux points méritent l'attention.

Un million de tokens font environ 750 000 mots — plusieurs longs romans. Presque aucune application n'en a besoin, et celles qui en ont besoin ont généralement un problème de recherche documentaire, pas un problème de contexte.

1 048 576 vaut 2²⁰, ce n'est pas un chiffre rond de marketing. Là où un fournisseur annonce exactement 1 000 000, il a arrondi ; là où il annonce 1 048 576, il rapporte la vraie taille du tampon.

Les prix par token et les longueurs de contexte de chaque modèle de texte sont sur la page des modèles de chat.

Ce qui la remplit vraiment

C'est la partie que les fiches de modèle passent sous silence. La documentation d'Anthropic publie les comptes exacts de tokens pour quelques requêtes minimales, et ils sont instructifs :

Ce qui a été envoyéTokens d'entrée
Un prompt système de cinq mots plus un message de deux mots14
Une question de neuf mots plus une définition d'outil403
Une image plus « Describe this image »1 028
Un PDF plus « Please summarize this document. »2 188

Une définition d'outil coûte environ 390 tokens. Un agent doté de vingt outils dépense quelque 8 000 tokens de sa fenêtre avant que l'utilisateur ait tapé quoi que ce soit — et les paie à chaque requête.

Une image, c'est environ mille tokens. Vingt captures d'écran, 20 000.

Et la conversation elle-même grossit. Le tour 10 porte les tours 1 à 9. Un chat qui semblait petit au début est, à la fin, la plus grosse chose de la requête.

Un modèle « 200K de contexte » dans un agent avec quinze outils, un long prompt système et quelques captures ne démarre donc pas à 200K. Il démarre bien en dessous, et rétrécit à chaque tour.

Le piège : le même texte n'est pas le même nombre de tokens

La longueur de contexte se mesure en tokens, et les tokens ne sont pas une unité stable d'un modèle à l'autre.

La documentation d'Anthropic indique elle-même que Claude 4.7 et les versions suivantes utilisent un tokeniseur plus récent où « le même texte d'entrée produit environ 30 pour cent de tokens de plus que sur les modèles antérieurs ».

Autrement dit : un prompt mesuré à 150 000 tokens sur un ancien modèle peut faire près de 195 000 sur un plus récent — les mêmes mots, trente pour cent de fenêtre en plus, trente pour cent de coût en plus. Si tu as dimensionné un pipeline de traitement documentaire pour un modèle puis que tu en as changé, remesure avant de supposer que ça tient encore.

Les fournisseurs te donnent de quoi vérifier. L'endpoint de comptage de tokens d'Anthropic est gratuit. Compte contre le modèle exact que tu comptes exécuter.

Ce qui arrive quand la place manque

Pas une dégradation en douceur. Selon le fournisseur, tu obtiens une erreur, une entrée tronquée, ou un historique silencieusement supprimé — et c'est le troisième qui est dangereux, parce que le modèle répond avec assurance à partir d'une conversation qu'il ne voit plus en entier.

Trois issues, par ordre d'effort :

Élaguer. Supprimer ou résumer les tours les plus anciens. Le moins cher à construire, et généralement suffisant pour du chat.

Mettre en cache. Si la grosse part de ton contexte est un préfixe fixe — un long prompt système, un document de référence —, le cache de prompt permet au fournisseur de le stocker et de facturer une fraction pour le relire. Cela n'agrandit pas la fenêtre, mais cela supprime l'essentiel du coût de son remplissage.

Rechercher. Cesser d'envoyer tout le corpus et n'envoyer que les parties pertinentes. Plus d'ingénierie, mais c'est la seule approche qui ne se dégrade pas à mesure que tes données grossissent.

Se tourner vers une fenêtre de contexte plus grande est la quatrième option, et généralement la plus chère — parce que tu paies chaque token de cette fenêtre à chaque requête.

Une fenêtre plus grande coûte-t-elle plus cher ?

Pas par token. Un modèle à 1M de contexte n'est pas facturé à un tarif plus élevé qu'un modèle à 200K pour la même requête ; Claude Sonnet 5 est à 2,00 $ le million de tokens d'entrée, que tu envoies cinq cents tokens ou cinq cent mille.

Mais une fenêtre plus grande rend facile d'en dépenser plus, parce qu'elle supprime l'erreur qui t'aurait arrêté. Remplir une fenêtre d'un million de tokens à 2,00 $ le million coûte 2,00 $ par requête — et si cette requête est un tour de chat qui se produit cinquante mille fois par mois, l'arithmétique devient vite sérieuse.

La discipline est la même dans les deux cas : envoie le moins que tu peux, pas le plus que tu as le droit.

En bref

Explorer plus loin sur ElliSekiz

Compare longueurs de contexte et prix des tokens côte à côte. La page des modèles de chat liste chaque modèle de texte avec ses tarifs d'entrée et de sortie.

Puis mesure ton propre prompt. Chaque page de modèle a un playground — lance une vraie requête et lis les comptes de tokens réels avant de dimensionner quoi que ce soit.

Sources

Tous les articles