Orbite du contexte

Comprendre la mémoire de Claude Code · chiffres vérifiés en septembre 2026

Tout ce queClaude voit,oublie et résume.

Ce qu'il peut garder sous les yeux0 tokens ≈ 750 000 mots
Déjà occupé avant votre « bonjour »0
Conservation des conversations0 jours
DÉFILER

00 — Les bases

Cinq mots, et tout le reste devient clair.

Imaginez Claude comme un collègue brillant qui travaille sur un bureau. Tout ce qu'il sait de votre projet, c'est ce qui est posé sur ce bureau à l'instant où il répond. Le reste de la page déroule cette image.

Token

Un petit morceau de texte, en moyenne les trois quarts d'un mot anglais. C'est l'unité dans laquelle Claude lit et écrit, et c'est en tokens que se vide votre forfait.

Les syllabes de la machine
Fenêtre de contexte

Tout ce que Claude a sous les yeux au moment de répondre : vos messages, ses réponses, les fichiers qu'il a ouverts. Aujourd'hui, 1 million de tokens, soit environ 750 000 mots : 7 ou 8 romans.

La surface du bureau
Session

Une conversation. En ouvrir une nouvelle (ou taper /clear), c'est repartir d'un bureau propre.

Une journée de travail
Compaction

Quand le bureau déborde, Claude résume la conversation et range le détail. C'est pratique, mais un résumé perd toujours des choses. On peut la lancer soi-même avec /compact.

Remplacer un classeur par une fiche
CLAUDE.md et mémoire

Des fichiers de notes que Claude Code relit mot pour mot à chaque démarrage et après chaque résumé. C'est la seule mémoire qui ne se déforme pas.

Le carnet de bord posé sur le bureau

01 — Le démarrage

Avant même votre « bonjour », le bureau n'est pas vide.

Au lancement, Claude Code pose déjà ses instructions de base, vos notes, sa mémoire et la liste de ses outils : environ 7 900 tokens. Sur un bureau de 1 million, c'est moins de 1 %. La place ne manque pas. C'est ce qu'on y empile ensuite qui compte.

Bougez les curseurs. Chaque case représente 5 000 tokens, soit environ 3 750 mots.

Pour les curieux

Cette grille imite la commande /context de Claude Code, qui montre ce qui occupe la fenêtre. Les tailles de départ sont les valeurs « représentatives » de la documentation officielle : prompt système 4 200, mémoire auto 680, environnement 280, noms des outils MCP 120, descriptions de skills 450, CLAUDE.md 320 + 1 800.

Hypothèses des curseurs : 1 ligne de CLAUDE.md ≈ 9 tokens ; 1 fichier ≈ 1 700 tokens (moyenne de l'exemple officiel) ; 1 aller-retour ≈ 1 250 tokens. Les outils MCP ne sont chargés en entier que si ENABLE_TOOL_SEARCH=false ; par défaut, seuls leurs noms entrent. Fenêtre 1M native sur Opus 5.5, Sonnet 5 et Fable 5.1 ; Haiku 4.5 reste à 200K.

Le bureau de Claude—

> /context · Opus 5.5 · Sonnet 5 · Fable 5.1 — 1M

02 — L'amnésie

Claude ne se souvient de rien entre deux messages. On lui relit tout, à chaque fois.

C'est le point le plus surprenant. Le modèle n'a aucune mémoire propre : avant chaque réponse, Claude Code lui renvoie tout le dossier depuis la première page. Plus la conversation est longue, plus le dossier est épais. Heureusement, les pages déjà lues passent « en cache » : elles sont relues en diagonale et comptent environ 10 fois moins sur votre forfait.

Message n° 1prêt
⌂
Votre ordinateur
garde le dossier
IA
Claude
ne retient rien
Instructions de base et notes
Pages déjà lues (cache)compte ~10× moins
Nouvelle pagecompte en entier
0tokens relus au total
Épaisseur du dossier envoyé
—
Dont pages déjà lues
—
Poids de ce message sur le forfait
—
Poids total depuis le début
—

Le poids est exprimé en « premier message = 1 ». Grâce au cache, un message pèse vite moins que le premier. Mais le dossier ne fait que grossir : dans cet exemple, le 50e message envoie 108 000 tokens, contre 10 000 pour le premier.

Pour les curieux

Si chaque message ajoute g tokens, le n-ième en envoie environ n × g, et le total relu après N messages vaut environ g × N² / 2 : il croît comme le carré du nombre de messages. Le cache réduit le poids de la relecture, il ne la supprime pas.

Au tarif public (API), une relecture en cache vaut 0,1× le prix normal (0,05× sur Opus 5.5, 0,025× sur Fable 5.1), et écrire une nouvelle page dans le cache 1,25× (cache de 5 min) ou 2× (cache d'1 h). Sur abonnement, Anthropic confirme que le cache « compte moins » sans donner le rapport exact ; ce simulateur reprend ceux du tarif public. Le cache dure 1 h sur abonnement, 5 min avec une clé API. Après une pause plus longue, tout est relu et compte en entier. doc · prompt caching

03 — Le remplissage

À vous de jouer : remplissez le bureau.

Chaque action pose des pages sur le bureau. Quand il approche du plein, Claude Code fait le ménage tout seul : il jette d'abord les vieux résultats de commandes, puis résume la conversation. Vous pouvez aussi le faire vous-même : /compact pour résumer, /clear pour tout débarrasser et repartir à zéro.

Quand faire le ménage ? autocompact ≈ 967K
ménage auto
bureau vide1M
Instructions et notes
Fiche résumé
Conversation et fichiers
Sur le bureau
0
Rempli à
0 %
Résumés faits
0
Total relu par Claude
0
Pour les curieux

Les tailles des actions viennent de l'exemple officiel « Explore the context window » : lecture d'un fichier 1 100 à 2 400 tokens, résultat de npm test 1 200. Un sous-agent (l'« assistant ») lit 6 100 tokens dans son propre contexte et n'en rapporte que 420 : c'est pour ça que déléguer économise de la place.

Le seuil se règle avec /autocompact 500k (de 100K à 1M). Le résumé est modélisé à 12 % du contenu résumé, comme dans la simulation officielle : c'est une valeur d'illustration, la taille réelle varie. Le moment où Claude Code passe du simple nettoyage au résumé (80 % du seuil ici) est une hypothèse de cette simulation.

04 — Le résumé

Un classeur entier réduit à une fiche.

Quand Claude compacte, il remplace toute la conversation par un résumé. C'est comme résumer un film en cinq lignes : on garde l'intrigue, on perd des répliques. Ce qui survit à coup sûr, c'est ce qui est écrit dans des fichiers, parce que Claude Code les relit directement sur le disque.

  1. Le bureau est plein

    Par défaut vers 967 000 tokens. On peut avancer ce seuil avec /autocompact.

  2. On jette les vieux résultats

    Les anciens résultats de commandes (tests, recherches) partent en premier. Si ça suffit, on s'arrête là.

  3. Claude relit tout une dernière fois

    Pour écrire le résumé, il doit relire toute la conversation. C'est un message de plus, qui consomme du forfait.

  4. La conversation devient une fiche

    L'historique détaillé quitte le bureau. Il ne reste que le résumé.

  5. Les documents importants reviennent

    Vos notes CLAUDE.md, la mémoire, le plan de travail et les 5 derniers fichiers utilisés sont reposés sur le bureau.

Le trou noir du résumé
Une longue conversation en orbite

Revient sur le bureau

  • Les instructions de base
  • Vos notes CLAUDE.md
  • La mémoire automatique de Claude
  • Le plan de travail validé
  • Les 5 derniers fichiers utilisés (s'ils ne sont pas trop gros)
  • Les compétences (skills) déjà utilisées

Résumé, donc abîmé ou perdu

  • Les consignes détaillées données au début
  • La liste des compétences pas encore utilisées
  • Les règles propres à un dossier, jusqu'à ce qu'on y retourne
  • Le contenu des gros fichiers : seul leur nom reste
  • Tout ce que le résumé a jugé secondaire
Pour les curieux

Seuil par défaut ≈ 967K sur les modèles à fenêtre 1M (Sonnet 5, Fable, Opus 4.7 et suivants), réglable de 100K à 1M. La requête de résumé relit l'historique au tarif du cache s'il est encore « chaud », en entier sinon. Après le résumé sont réinjectés : CLAUDE.md racine et règles sans paths:, MEMORY.md (200 lignes / 25 Ko max), le plan, un git status frais, jusqu'à 5 fichiers de moins de 5 000 tokens chacun, les skills invoquées (5 000 tokens chacune, 25 000 au total), la sortie des hooks SessionStart compact. La liste des descriptions de skills, elle, n'est pas réinjectée.

doc · what survives compaction · doc · when context fills up

05 — La fatigue

Un bureau trop chargé, ce sont des détails qui passent à la trappe.

Avoir de la place ne veut pas dire tout lire aussi bien. Les tests publiés en 2026 sur les modèles actuels sont clairs : jusqu'à environ 128 000 tokens, les meilleurs modèles retrouvent presque tout. Vers 1 million, ils en ratent beaucoup plus. Les chercheurs appellent ça le context rot, la « fatigue du contexte ». La documentation de Claude Code le dit aussi : la qualité baisse à mesure que la fenêtre se remplit.

À savoir : pour Opus 5.5 et Sonnet 5, Anthropic ne publie plus ce genre de courbe. Les chiffres ci-dessus concernent les générations juste avant (Claude 4.6 à Mythos 5, GPT-5.x, Gemini 3).

06 — Le duel

Repartir de zéro à chaque tâche, ou garder la même conversation pendant des mois ?

Stratégie A

Un bureau propre pour chaque tâche

Nouvelle session (ou /clear) à chaque fois.

vs

Stratégie B

Un seul bureau pendant des mois

On note l'essentiel dans des fichiers, puis on lance /compact après chaque tâche.

D'abord : comment votre forfait compte

Avec un abonnement Claude (Pro à 20 $, Max 5x à 100 $, Max 20x à 200 $ par mois), vous ne payez pas au message. Vous avez un quota qui se recharge toutes les 5 heures, plus un plafond par semaine, partagés entre Claude et Claude Code. Ce quota se vide en fonction des tokens que Claude traite. Anthropic le dit clairement : plus la conversation est longue, plus chaque message consomme. Et le contenu déjà en cache « compte moins » que le nouveau.

Anthropic ne publie pas ce quota en tokens. On ne peut donc pas dire « vous avez droit à X tokens ». On peut en revanche comparer les stratégies entre elles, à forfait égal. C'est ce que fait le simulateur ci-dessous.

Modèle utilisé

Comment c'est calculé

Combien chaque stratégie pèse sur votre forfait, pour le même travail (A = 100)

Ce que Claude a traité sur toute la période, en millions de tokens

Pourquoi : l'épaisseur du dossier envoyé à chaque échange, sur les 3 premiers jours (chaque graduation multiplie par 10)

B′ : le même bureau unique, mais sans jamais résumer soi-même. On le laisse déborder jusqu'au ménage automatique (vers 967K tokens).

Le téléphone sans fil des résumés

En stratégie B, une info qui n'est écrite nulle part est résumée à la fin de chaque tâche, puis le résumé est lui-même résumé, et ainsi de suite : 360 fois sur la période choisie. Comme au jeu du téléphone sans fil, chaque passage peut la déformer. Une info écrite dans un fichier, elle, est relue mot pour mot, dans les deux stratégies.

Jour 1Fin de la période

A · Un bureau propre par tâche

  • Claude démarre léger (environ 7 900 tokens) : il est plus attentif et chaque échange consomme moins de forfait.
  • C'est la méthode recommandée par Anthropic quand on change de sujet. Et /clear est gratuit.
  • Pas de mélange : les idées d'une tâche ne polluent pas la suivante.
  • Claude voit toute la liste de ses compétences à chaque démarrage.
  • Ce qui n'est pas écrit quelque part est oublié : il faut prendre l'habitude de noter.
  • Claude doit rouvrir les fichiers utiles au début de chaque tâche.

B · Un seul bureau pendant des mois

  • Continuité : le résumé garde le fil récent, et les derniers fichiers sont reposés sur le bureau.
  • Vous choisissez quand résumer et sur quoi insister (/compact suivi d'une consigne).
  • Les notes dans des fichiers ne se déforment pas… mais c'est tout aussi vrai en stratégie A.
  • Chaque résumé est un message en plus, qui relit toute la conversation et consomme du forfait.
  • Le bureau ne repart jamais vide : résumé et fichiers réinjectés sont relus à chaque échange.
  • Résumé de résumé de résumé : les consignes anciennes se diluent. La doc officielle prévient qu'elles peuvent être perdues.
  • Après un résumé, Claude ne voit plus la liste des compétences qu'il n'a pas encore utilisées.
  • Mélange possible : des décisions d'anciennes tâches traînent dans le résumé.
En clairce que disent les chiffres

La vraie mémoire à long terme, ce sont les fichiers : CLAUDE.md, la mémoire automatique, vos notes, l'historique git. Ils sont relus sans déformation, et ils marchent aussi bien en A qu'en B. La stratégie B y ajoute un résumé : un peu plus de continuité, mais des échanges plus gourmands et un risque de dérive.

Le bon réflexe, recommandé par Anthropic : /clear quand on change de sujet, /compact quand une même tâche s'éternise. Et surtout, ne jamais laisser la conversation grossir sans fin (B′) : c'est de loin ce qui vide le plus vite votre forfait.

07 — Quiz

Qu'avez-vous retenu ?

Question 1 / 10

Sources

Chaque chiffre a une source.