Comprendre la mémoire de Claude Code · chiffres vérifiés en septembre 2026
Tout ce queClaude voit,oublie et résume.
00 — Les bases
Cinq mots, et tout le reste devient clair.
Imaginez Claude comme un collègue brillant qui travaille sur un bureau. Tout ce qu'il sait de votre projet, c'est ce qui est posé sur ce bureau à l'instant où il répond. Le reste de la page déroule cette image.
- Token
Un petit morceau de texte, en moyenne les trois quarts d'un mot anglais. C'est l'unité dans laquelle Claude lit et écrit, et c'est en tokens que se vide votre forfait.
Les syllabes de la machine- Fenêtre de contexte
Tout ce que Claude a sous les yeux au moment de répondre : vos messages, ses réponses, les fichiers qu'il a ouverts. Aujourd'hui, 1 million de tokens, soit environ 750 000 mots : 7 ou 8 romans.
La surface du bureau- Session
Une conversation. En ouvrir une nouvelle (ou taper
Une journée de travail/clear), c'est repartir d'un bureau propre.- Compaction
Quand le bureau déborde, Claude résume la conversation et range le détail. C'est pratique, mais un résumé perd toujours des choses. On peut la lancer soi-même avec
Remplacer un classeur par une fiche/compact.- CLAUDE.md et mémoire
Des fichiers de notes que Claude Code relit mot pour mot à chaque démarrage et après chaque résumé. C'est la seule mémoire qui ne se déforme pas.
Le carnet de bord posé sur le bureau
01 — Le démarrage
Avant même votre « bonjour », le bureau n'est pas vide.
Au lancement, Claude Code pose déjà ses instructions de base, vos notes, sa mémoire et la liste de ses outils : environ 7 900 tokens. Sur un bureau de 1 million, c'est moins de 1 %. La place ne manque pas. C'est ce qu'on y empile ensuite qui compte.
Bougez les curseurs. Chaque case représente 5 000 tokens, soit environ 3 750 mots.
Pour les curieux
Cette grille imite la commande /context de Claude Code, qui montre ce qui occupe la fenêtre. Les tailles de départ sont les valeurs « représentatives » de la documentation officielle : prompt système 4 200, mémoire auto 680, environnement 280, noms des outils MCP 120, descriptions de skills 450, CLAUDE.md 320 + 1 800.
Hypothèses des curseurs : 1 ligne de CLAUDE.md ≈ 9 tokens ; 1 fichier ≈ 1 700 tokens (moyenne de l'exemple officiel) ; 1 aller-retour ≈ 1 250 tokens. Les outils MCP ne sont chargés en entier que si ENABLE_TOOL_SEARCH=false ; par défaut, seuls leurs noms entrent. Fenêtre 1M native sur Opus 5.5, Sonnet 5 et Fable 5.1 ; Haiku 4.5 reste à 200K.
> /context · Opus 5.5 · Sonnet 5 · Fable 5.1 — 1M
02 — L'amnésie
Claude ne se souvient de rien entre deux messages. On lui relit tout, à chaque fois.
C'est le point le plus surprenant. Le modèle n'a aucune mémoire propre : avant chaque réponse, Claude Code lui renvoie tout le dossier depuis la première page. Plus la conversation est longue, plus le dossier est épais. Heureusement, les pages déjà lues passent « en cache » : elles sont relues en diagonale et comptent environ 10 fois moins sur votre forfait.
garde le dossier
ne retient rien
- Épaisseur du dossier envoyé
- —
- Dont pages déjà lues
- —
- Poids de ce message sur le forfait
- —
- Poids total depuis le début
- —
Le poids est exprimé en « premier message = 1 ». Grâce au cache, un message pèse vite moins que le premier. Mais le dossier ne fait que grossir : dans cet exemple, le 50e message envoie 108 000 tokens, contre 10 000 pour le premier.
Pour les curieux
Si chaque message ajoute g tokens, le n-ième en envoie environ n × g, et le total relu après N messages vaut environ g × N² / 2 : il croît comme le carré du nombre de messages. Le cache réduit le poids de la relecture, il ne la supprime pas.
Au tarif public (API), une relecture en cache vaut 0,1× le prix normal (0,05× sur Opus 5.5, 0,025× sur Fable 5.1), et écrire une nouvelle page dans le cache 1,25× (cache de 5 min) ou 2× (cache d'1 h). Sur abonnement, Anthropic confirme que le cache « compte moins » sans donner le rapport exact ; ce simulateur reprend ceux du tarif public. Le cache dure 1 h sur abonnement, 5 min avec une clé API. Après une pause plus longue, tout est relu et compte en entier. doc · prompt caching
03 — Le remplissage
À vous de jouer : remplissez le bureau.
Chaque action pose des pages sur le bureau. Quand il approche du plein, Claude Code fait le ménage tout seul : il jette d'abord les vieux résultats de commandes, puis résume la conversation. Vous pouvez aussi le faire vous-même : /compact pour résumer, /clear pour tout débarrasser et repartir à zéro.
Pour les curieux
Les tailles des actions viennent de l'exemple officiel « Explore the context window » : lecture d'un fichier 1 100 à 2 400 tokens, résultat de npm test 1 200. Un sous-agent (l'« assistant ») lit 6 100 tokens dans son propre contexte et n'en rapporte que 420 : c'est pour ça que déléguer économise de la place.
Le seuil se règle avec /autocompact 500k (de 100K à 1M). Le résumé est modélisé à 12 % du contenu résumé, comme dans la simulation officielle : c'est une valeur d'illustration, la taille réelle varie. Le moment où Claude Code passe du simple nettoyage au résumé (80 % du seuil ici) est une hypothèse de cette simulation.
04 — Le résumé
Un classeur entier réduit à une fiche.
Quand Claude compacte, il remplace toute la conversation par un résumé. C'est comme résumer un film en cinq lignes : on garde l'intrigue, on perd des répliques. Ce qui survit à coup sûr, c'est ce qui est écrit dans des fichiers, parce que Claude Code les relit directement sur le disque.
Le bureau est plein
Par défaut vers 967 000 tokens. On peut avancer ce seuil avec
/autocompact.On jette les vieux résultats
Les anciens résultats de commandes (tests, recherches) partent en premier. Si ça suffit, on s'arrête là.
Claude relit tout une dernière fois
Pour écrire le résumé, il doit relire toute la conversation. C'est un message de plus, qui consomme du forfait.
La conversation devient une fiche
L'historique détaillé quitte le bureau. Il ne reste que le résumé.
Les documents importants reviennent
Vos notes CLAUDE.md, la mémoire, le plan de travail et les 5 derniers fichiers utilisés sont reposés sur le bureau.
Revient sur le bureau
- Les instructions de base
- Vos notes CLAUDE.md
- La mémoire automatique de Claude
- Le plan de travail validé
- Les 5 derniers fichiers utilisés (s'ils ne sont pas trop gros)
- Les compétences (skills) déjà utilisées
Résumé, donc abîmé ou perdu
- Les consignes détaillées données au début
- La liste des compétences pas encore utilisées
- Les règles propres à un dossier, jusqu'à ce qu'on y retourne
- Le contenu des gros fichiers : seul leur nom reste
- Tout ce que le résumé a jugé secondaire
Pour les curieux
Seuil par défaut ≈ 967K sur les modèles à fenêtre 1M (Sonnet 5, Fable, Opus 4.7 et suivants), réglable de 100K à 1M. La requête de résumé relit l'historique au tarif du cache s'il est encore « chaud », en entier sinon. Après le résumé sont réinjectés : CLAUDE.md racine et règles sans paths:, MEMORY.md (200 lignes / 25 Ko max), le plan, un git status frais, jusqu'à 5 fichiers de moins de 5 000 tokens chacun, les skills invoquées (5 000 tokens chacune, 25 000 au total), la sortie des hooks SessionStart compact. La liste des descriptions de skills, elle, n'est pas réinjectée.
doc · what survives compaction · doc · when context fills up
05 — La fatigue
Un bureau trop chargé, ce sont des détails qui passent à la trappe.
Avoir de la place ne veut pas dire tout lire aussi bien. Les tests publiés en 2026 sur les modèles actuels sont clairs : jusqu'à environ 128 000 tokens, les meilleurs modèles retrouvent presque tout. Vers 1 million, ils en ratent beaucoup plus. Les chercheurs appellent ça le context rot, la « fatigue du contexte ». La documentation de Claude Code le dit aussi : la qualité baisse à mesure que la fenêtre se remplit.
À savoir : pour Opus 5.5 et Sonnet 5, Anthropic ne publie plus ce genre de courbe. Les chiffres ci-dessus concernent les générations juste avant (Claude 4.6 à Mythos 5, GPT-5.x, Gemini 3).
06 — Le duel
Repartir de zéro à chaque tâche, ou garder la même conversation pendant des mois ?
Stratégie A
Un bureau propre pour chaque tâche
Nouvelle session (ou /clear) à chaque fois.
Stratégie B
Un seul bureau pendant des mois
On note l'essentiel dans des fichiers, puis on lance /compact après chaque tâche.
D'abord : comment votre forfait compte
Avec un abonnement Claude (Pro à 20 $, Max 5x à 100 $, Max 20x à 200 $ par mois), vous ne payez pas au message. Vous avez un quota qui se recharge toutes les 5 heures, plus un plafond par semaine, partagés entre Claude et Claude Code. Ce quota se vide en fonction des tokens que Claude traite. Anthropic le dit clairement : plus la conversation est longue, plus chaque message consomme. Et le contenu déjà en cache « compte moins » que le nouveau.
Anthropic ne publie pas ce quota en tokens. On ne peut donc pas dire « vous avez droit à X tokens ». On peut en revanche comparer les stratégies entre elles, à forfait égal. C'est ce que fait le simulateur ci-dessous.
Modèle utilisé
Comment c'est calculé
Combien chaque stratégie pèse sur votre forfait, pour le même travail (A = 100)
Ce que Claude a traité sur toute la période, en millions de tokens
Pourquoi : l'épaisseur du dossier envoyé à chaque échange, sur les 3 premiers jours (chaque graduation multiplie par 10)
B′ : le même bureau unique, mais sans jamais résumer soi-même. On le laisse déborder jusqu'au ménage automatique (vers 967K tokens).
Le téléphone sans fil des résumés
En stratégie B, une info qui n'est écrite nulle part est résumée à la fin de chaque tâche, puis le résumé est lui-même résumé, et ainsi de suite : 360 fois sur la période choisie. Comme au jeu du téléphone sans fil, chaque passage peut la déformer. Une info écrite dans un fichier, elle, est relue mot pour mot, dans les deux stratégies.
A · Un bureau propre par tâche
- Claude démarre léger (environ 7 900 tokens) : il est plus attentif et chaque échange consomme moins de forfait.
- C'est la méthode recommandée par Anthropic quand on change de sujet. Et
/clearest gratuit. - Pas de mélange : les idées d'une tâche ne polluent pas la suivante.
- Claude voit toute la liste de ses compétences à chaque démarrage.
- Ce qui n'est pas écrit quelque part est oublié : il faut prendre l'habitude de noter.
- Claude doit rouvrir les fichiers utiles au début de chaque tâche.
B · Un seul bureau pendant des mois
- Continuité : le résumé garde le fil récent, et les derniers fichiers sont reposés sur le bureau.
- Vous choisissez quand résumer et sur quoi insister (
/compactsuivi d'une consigne). - Les notes dans des fichiers ne se déforment pas… mais c'est tout aussi vrai en stratégie A.
- Chaque résumé est un message en plus, qui relit toute la conversation et consomme du forfait.
- Le bureau ne repart jamais vide : résumé et fichiers réinjectés sont relus à chaque échange.
- Résumé de résumé de résumé : les consignes anciennes se diluent. La doc officielle prévient qu'elles peuvent être perdues.
- Après un résumé, Claude ne voit plus la liste des compétences qu'il n'a pas encore utilisées.
- Mélange possible : des décisions d'anciennes tâches traînent dans le résumé.
La vraie mémoire à long terme, ce sont les fichiers : CLAUDE.md, la mémoire automatique, vos notes, l'historique git. Ils sont relus sans déformation, et ils marchent aussi bien en A qu'en B. La stratégie B y ajoute un résumé : un peu plus de continuité, mais des échanges plus gourmands et un risque de dérive.
Le bon réflexe, recommandé par Anthropic : /clear quand on change de sujet, /compact quand une même tâche s'éternise. Et surtout, ne jamais laisser la conversation grossir sans fin (B′) : c'est de loin ce qui vide le plus vite votre forfait.
07 — Quiz
Qu'avez-vous retenu ?
Sources