AIDive

Pack vidéo

Limite hebdo Claude Code en baisse : leviers mesurés, tables de cache, checklist du lundi

10 min de lecture

TL;DR

  • La limite hebdomadaire de Claude Code est passée d'une base de 100 à un niveau promo de 150, puis s'est fixée à 125 de façon permanente le 14 septembre 2026. Par rapport au niveau promo, c'est une baisse de 17 % ; par rapport à l'ancienne base, une hausse de 25 %. Les deux affirmations sont vraies en même temps.
  • Sur un mois de logs locaux, les subagents ont consommé 48,1 % de tous les tokens et 55,3 % du coût pondéré. Le levier numéro un : lancer moins de subagents et fixer un petit modèle sur ceux que vous gardez.
  • Les subagents écrivent un cache de 5 minutes, la session principale un cache d'1 heure. Une requête qui suit une pause à froid réécrit environ 19 fois plus de cache qu'une requête à chaud.
  • Une pause de plus de 60 minutes dans une session principale coûte en médiane 130 332 tokens de réécriture de cache à la requête suivante, contre 1 176 quand l'écart est inférieur à 5 minutes.
  • Baisser l'effort n'a pas réduit la sortie par requête dans ces logs (moyenne de 778 tokens en high contre 837 en medium sur les sessions principales) : c'est un arbitrage de qualité, pas une économie gratuite.
  • Désactiver les suggestions de prompt et filtrer la sortie du shell sont des leviers réels mais petits. Comptez-les en dernier.

Ce que disent les mesures

Le calcul derrière le titre : base 100, niveau promo 150, niveau permanent 125. 125 / 150 = 0,8333, donc la baisse est de 16,67 %, arrondie à 17 %. La mauvaise lecture consiste à soustraire les hausses (50 % vers 25 %) et à parler d'une baisse de 25 %. s2

La promotion a couru du 13 mai 2026 au 13 septembre 2026, a relevé de 50 % les limites hebdomadaires dans Claude Code uniquement, et n'a pas touché aux limites de 5 heures. Elle s'appliquait aux plans Pro, Max, Team et Enterprise par siège. s1

Les mesures ci-dessous viennent des logs Claude Code d'une seule machine : 455 sessions principales, 2 631 exécutions de subagents, 63 398 requêtes dédoublonnées entre le 2026-09-03 et le 2026-10-03. Le premier constat concerne le comptage lui-même : chaque requête apparaît sur 1,96 ligne de log en moyenne, donc additionner toutes les lignes surestime le total de tokens de 99,3 %. Tout script qui lit ces logs doit d'abord dédoublonner sur (message.id, requestId). s11

Les subagents sont le plus gros poste. Dédoublonnés, ils représentent 48,1 % des tokens totaux, 63,9 % des tokens de sortie et 55,3 % du coût pondéré. La première requête d'un subagent porte un prompt médian de 47 117 tokens avant de faire quoi que ce soit ; le p90 est de 52 681 et le max de 126 769. Les agents à jeu d'outils restreint démarrent bien plus bas (min 5 295). s8

Le choix du modèle aggrave l'effet. Les subagents héritent du modèle de la conversation principale, sauf si un frontmatter model, un paramètre model par invocation ou CLAUDE_CODE_SUBAGENT_MODEL en décide autrement, et depuis la v2.1.251 la variable d'environnement seule ne remplace plus le frontmatter : il faut CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Dans les logs, claude-opus-5 représentait à lui seul 31,5 % de tous les tokens et 35,8 % du coût pondéré, dont 63,2 % dépensés dans des subagents. s3

Le palier de cache dépend de l'endroit où la requête s'exécute. Dans ces données, 100,0 % des écritures de cache des subagents étaient en 5 minutes et 100,0 % de celles des sessions principales en 1 heure ; aucune requête n'avait de répartition mixte. Dans les exécutions de subagents, seulement 95 requêtes de suite sur 41 790 (0,2 %) sont arrivées après un écart de plus de 5 minutes, mais elles ont écrit en moyenne 74 582 tokens de cache_creation contre 3 886 pour les requêtes à chaud. Le réglage subagentPromptCacheTtl et la variable d'environnement CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL acceptent 5m ou 1h et exigent Claude Code v2.1.242 ou plus récent. s4

Une exécution indépendante a vu la même répartition : toutes les requêtes de subagent écrites sous ephemeral_5m_input_tokens pendant que le parent utilisait ephemeral_1h_input_tokens, et un agent qui réécrivait les 20 971 tokens de son préfixe sur une requête arrivée après la fenêtre de cinq minutes. s6

L'équivalent côté session principale est la longue pause. Les requêtes arrivées moins de 5 minutes après la précédente ont écrit une médiane de 1 176 tokens de cache_creation (n = 18 029). Entre 5 et 60 minutes, 1 327 (n = 414). Au-delà de 60 minutes, 130 332 (n = 79), avec un prompt médian de 175 523 tokens et un p90 de 674 348. La doc confirme que la facturation au dépassement fait aussi passer la conversation principale au palier de cinq minutes. s3

Le démarrage de session est le coût fixe : la première requête d'une session principale portait une médiane de 55 989 tokens (p90 72 000), avec un écart par projet de 15 764 à 105 020 selon la taille de CLAUDE.md et de la mémoire. Une mesure publique antérieure situait le plancher à environ 29k dans un dossier vide, 30,4k avec 3 serveurs MCP et 38,8k dans un vrai dépôt. s9

L'effort est le levier que la doc met en avant et que les logs ne récompensent pas. Sur les sessions principales, les requêtes en high ont produit en moyenne 778 tokens de sortie contre 837 en medium ; les subagents en high en ont produit 323 contre 642. La comparaison est biaisée (tâches, modèles et projets différents) : c'est une raison de rester sceptique, pas une preuve. Les conseils de l'équipe Claude Code présentent l'effort comme l'endroit où dépenser du raisonnement, pas comme un bouton de budget. s10

Deux astuces populaires ont mesuré petit. Les suggestions de prompt coûtent des requêtes supplémentaires, et le chiffre « économisez ~10 % » très partagé est un plafond, pas une économie typique ; le réglage est promptSuggestionEnabled: false ou CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Le filtrage de la sortie du shell sur vingt jours a ramené 66,7 millions de tokens de sortie à 24,1 millions, mais ces 66,7 millions représentaient 7,4 % des nouveaux tokens consommés sur la même fenêtre. s11

Mesures

Coût de lancement d'un subagent, prompt de la première requête en tokens, par modèle :

Modèle n min médiane p90 max
Tous 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Réécriture de cache à la reprise, sessions principales, selon l'écart avant la requête :

Écart n cache_creation médiane moyenne cache_read médiane prompt médian
< 5 min 18,029 1,176 2,391 184,169 186,412
5 à 60 min 414 1,327 5,575 221,857 225,168
> 60 min 79 130,332 241,499 25,264 175,523

Protocole : lire chaque session principale ~/.claude/projects/*/<uuid>.jsonl et chaque exécution */<uuid>/subagents/agent-*.jsonl, requêtes à partir du 2026-09-01. Dédoublonner les lignes assistant sur (message.id, requestId) et garder un seul enregistrement usage par requête. Total tokens = input + output + cache_read + cache_creation ; taille du prompt = input + cache_read + cache_creation. Écart = temps entre la dernière ligne de log de la requête précédente et la première de celle-ci, dans une même session ou exécution. Le coût pondéré utilise des poids relatifs : input 1, écriture cache 5m 1,25, écriture cache 1h 2, cache read 0,1, output 5 ; ces poids sont une hypothèse, pas un tarif publié.

À faire lundi

  • Lancez /usage sur votre plan et lisez la répartition par skill, subagent, plugin et MCP, ainsi que les alertes de comportement levées à 10 % ou plus de l'usage récent.
  • Listez vos définitions de subagents et ajoutez un frontmatter model: haiku ou model: sonnet à chacun de ceux qui se contentent de chercher, vérifier ou résumer.
  • Si vous voulez un seul modèle sur tous les subagents quel que soit le frontmatter, définissez CLAUDE_CODE_SUBAGENT_MODEL et CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Vérifiez que votre version de Claude Code est 2.1.242 ou plus récente, puis décidez workflow par workflow si subagentPromptCacheTtl: "1h" est rentable : il aide les subagents qui restent inactifs entre deux appels d'outils, pas les courts.
  • Avant une pause de plus d'une heure, terminez la tâche dans la session en cours et écrivez un fichier de passation ; ouvrez une session neuve au retour plutôt que de reprendre un prompt de 175k tokens.
  • Écrivez un script en lecture seule sur vos propres logs, dédoublonné sur (message.id, requestId), et comparez la part principale contre subagents avant de changer autre chose.
  • Définissez promptSuggestionEnabled: false si vous n'utilisez jamais les suggestions, et considérez l'économie comme quelques pourcents au mieux.

Aller plus loin

  • Max 5x contre Max 20x : le rapport de capacité mesuré par les utilisateurs après la baisse est une question de choix de plan que la vidéo a laissée de côté. s7
  • La chaîne de priorité complète du TTL de cache (variable de forçage, variable par palier, réglage par palier, experimental.cacheTtl du subagent) et ce qui change en facturation au dépassement. s4
  • Pourquoi changer l'effort en cours de session peut relire tout l'historique sans aucun cache hit sur la plupart des modèles, et quels modèles y échappent. s3
  • Comment lire les champs usage et les paliers de cache dans vos propres logs de session, et l'approche ccboard pour une vue de budget par jour. s11
  • Trois fichiers de subagent avec trois modèles et ce que chaque lancement a réellement écrit en cache, avec les corrections de l'auteur en annexe. s8
  • Les définitions d'outils MCP différées et ENABLE_TOOL_SEARCH=auto:N pour contrôler quand les schémas d'outils se chargent dans le contexte. s3

Sources

FAQ

Est-ce une baisse de 17 % ou une hausse de 25 % ?

Les deux, mesurées depuis des bases différentes. Par rapport à la base d'avant la promo de 100, le niveau permanent de 125 est une hausse de 25 %. Par rapport au niveau promo de 150 dont les utilisateurs ont profité du 13 mai au 13 septembre 2026, c'est une baisse de 17 %.

Dois-je mettre subagentPromptCacheTtl à 1h partout ?

Seulement si vos subagents restent inactifs plus de cinq minutes entre deux requêtes. Dans les logs, 0,2 % des requêtes de suite tombent dans ce cas, donc un palier 1h généralisé paie surtout un prix d'écriture plus élevé pour rien. Mesurez d'abord votre propre distribution d'écarts.

Baisser l'effort économise-t-il des tokens ?

Pas de façon visible dans ces logs : les requêtes de session principale en high ont produit en moyenne 778 tokens de sortie contre 837 en medium. Les données sont biaisées, donc la réponse honnête est que l'effort est un bouton de qualité dont vous devez mesurer l'économie sur vos propres tâches.

Pourquoi mon premier prompt après le déjeuner coûte-t-il autant ?

La session principale écrit un cache d'1 heure. Après un écart de plus de 60 minutes, la requête suivante réécrit le préfixe : une médiane de 130 332 tokens de cache_creation dans les logs, contre 1 176 pour une requête à chaud. Terminez les tâches avant les longues pauses et repartez à neuf ensuite.