AIDive

Pack vidéo

Quatre économiseurs de tokens Claude Code mesurés : verdicts, checklist et sources

11 min de lecture

TL;DR

  • Quatre outils agissent sur quatre tranches différentes d'une facture Claude Code : graphify sur ce qui est lu, rtk sur la sortie du shell, Superpowers sur l'historique et le choix du modèle, caveman sur ce que l'agent écrit. Classez-les par la taille de la tranche qu'ils touchent, pas par le pourcentage affiché dans leur README.
  • Superpowers est le seul qui fait bouger la facture : un sous-agent neuf par tâche et le modèle le moins puissant qui convient changent ce qui est lu et qui le lit. Son coût, c'est une porte d'entrée sur chaque tâche, même les minuscules.
  • graphify arrive deuxième : un graphe tree-sitter local, construit avec zéro crédit LLM, 91.8x moins de tokens par requête qu'une lecture naïve de notre propre corpus.
  • rtk compresse la seule tranche qu'un hook Bash peut voir. JetBrains a mesuré 19.7% de ce que le modèle lit comme compressible, un plafond autour de 3% de la facture, et +7.6% par tâche dans le test de bout en bout.
  • caveman annonce 65% et a mesuré 8.5% des tokens de sortie sur du travail agentique. Claude Code livre la même idée avec le style de sortie Concise.
  • Les deux chiffres que tout le monde cite, 11.6M de tokens économisés et +7.6% par tâche, ne mesurent pas la même chose : des octets de sortie bash d'un côté, le coût d'une tâche terminée de l'autre.

Ce que disent les mesures

La carte d'abord. Le document de rtk sur ses économies dessine l'arbre de ce qu'une session lit et marque la sortie bash comme la seule partie que le proxy filtre, puis le dit sans détour : « A command showing 90% fewer output bytes does not make your session 90% cheaper » s3. JetBrains a rejoué 83 sessions de référence, 1.9 million de caractères de sortie d'outils, et les a réparties en trois : sortie shell que rtk peut compresser 373,339 (19.7%), sortie shell sans règle 879,326 (46.3%), lecture de fichiers et outils de recherche qui contournent rtk 646,613 (34.0%) s1. Read et Grep ne passent jamais par le hook Bash. Le README de caveman arrive à la même conclusion par l'autre bout : la lecture est généralement la plus grosse moitié de la facture s7.

graphify. Le dépôt a été créé le 2026-04-03 et affichait 113,946 stars et 11,078 forks le 2026-09-02, dernière version v0.9.53, Python, Apache-2.0 s5. La ligne de benchmark du README indique « Graph build | LLM credits | 0 » : le code est analysé en local avec tree-sitter sur ~40 langages, les communautés sont découpées avec Leiden, rien ne quitte la machine s5. Le post de l'auteur sur r/ClaudeAI annonçait 73k stars et 2.2M de téléchargements en 2.5 mois s10. Notre propre graphify benchmark sur un projet de 1,701,550 mots (environ 2,268,733 tokens en lecture naïve) a construit 34,031 noeuds et 56,865 arêtes, un coût moyen par requête d'environ 24,702 tokens, soit 91.8x moins de tokens par requête ; selon la question, l'écart va de 679.1x pour « what is the main entry point » à 34.0x pour « what connects the data layer to the api » s5. Le 91.8x se mesure face à une lecture complète naïve, que personne ne fait exprès ; le graphe devient aussi obsolète quand le code bouge, et la passe sémantique optionnelle est la seule étape qui coûte des appels au modèle.

rtk. Créé le 2026-01-22, 78,326 stars et 4,942 forks le 2026-09-02, version v0.47.0, Rust, Apache-2.0, « 100+ supported commands, <10ms overhead » s4. Le post de lancement annonçait « cargo test: 155 lines → 3 lines (-98%) », « git status: 119 chars → 28 chars (-76%) » et « Total over 2 weeks: 10.2M tokens saved (89.2%) » s9. Sur notre machine, rtk 0.42.3 affichait 25599 commandes et 11.6M de tokens économisés (41.6%), avec find, read et grep en tête du tableau By Command s4. JetBrains a installé rtk v0.43.0 exactement comme le livre rtk init -g, sur Claude Code 2.1.201 et claude-sonnet-5, et a lancé 86 tâches deux fois. Seule 1 commande shell sur 3 est réécrivable par rtk (349 réécrivables, 525 sans règle, 182 ignorées, sur 1,056 commandes). Même en réduisant de 70% toute la sortie compressible, l'économie plafonne autour de 3% de la facture ; le résultat mesuré a été +7.6% de coût par tâche, sans différence à effort élevé s1. Le README concède maintenant le point : « RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90% », et les comptes qu'il rapporte sont estimés en octets / 4 s4.

Superpowers. Créé le 2025-10-09, 280,792 stars et 25,164 forks le 2026-09-02, version v6.3.0 avec quatorze skills, MIT, une seule commande d'installation : /plugin install superpowers@claude-plugins-official s6. Le skill brainstorming s'ouvre sur une porte stricte : pas de code, pas de scaffolding, pas de skill d'implémentation tant qu'une intention explicite n'est pas approuvée ; trois chemins (spike, bounded, architectural) et la règle « When in doubt between two paths, take the heavier one » s12. writing-plans suppose que l'ingénieur n'a aucun contexte et découpe le travail en étapes où « Each step is one action (2-5 minutes) » s13. subagent-driven-development donne à chaque tâche un sous-agent neuf qui ne reçoit que le contexte de sa tâche, jamais l'historique de la session, avec une revue après chaque tâche et une revue large de la branche à la fin. Sa section sur les modèles dit « Use the least powerful model that can handle each role to conserve cost », prévient qu'un modèle omis hérite du modèle de la session, et pose « Turn count beats token price ». Cinq tours maximum par tâche : les tours 1 à 3 reprennent l'implémenteur, le tour 4 fait venir un nouvel implémenteur sur un modèle plus capable, au tour 5 l'orchestrateur tranche lui-même s14. Aucune compression nulle part : l'économie vient de la lecture d'un historique plus court et d'un modèle moins cher pour les étapes mécaniques. Le tour complet est dans notre vidéo précédente s11.

caveman. Créé le 2026-04-04, 102,548 stars et 5,967 forks le 2026-09-02, version bin-v1.1.5, Go ; le skill est MIT, le runtime du proxy BSL-1.1 s7. Son propre tableau, dix prompts via l'API Claude, montre une moyenne de 1214 tokens de sortie sans et 294 avec, soit 65%, meilleur cas 87% et pire cas 22% s7. Le bloc IMPORTANT du README est honnête : le skill ne raccourcit que la sortie, les tokens d'entrée et de raisonnement ne changent pas, et les règles coûtent environ 1 à 1.5k tokens d'entrée à chaque tour, donc l'économie sur la session entière tombe plus bas que le graphique s7. JetBrains a fait tourner 82 tâches appariées sur Claude Code 2.1.200 avec claude-sonnet-5 à effort low, environ 106 USD : « Advertised saving: 65%. Measured saving: 8.5% », de 592k à 542k tokens de sortie, aucune dégradation de qualité détectable (test des signes p = 0.82), recommandation « use it if you like it » s2. Le style Concise intégré à Claude Code fait le même travail : « Claude leads with the result, skips preamble and narration, and keeps responses short by default », demande la v2.1.237 ou plus récente, se choisit via /config et s'enregistre sous outputStyle dans .claude/settings.local.json. Les styles ne s'appliquent qu'à la conversation principale ; un sous-agent tourne avec son propre prompt système s8.

Tableau des verdicts

Outil Tranche de la facture Annoncé Mesuré Bouge
Superpowers historique + modèle par tâche aucun chiffre contexte neuf par tâche, modèle le moins puissant par rôle la facture
graphify ce qui est lu 0 crédit LLM pour construire 91.8x moins de tokens par requête vs lecture naïve (nos mesures) la facture, sur les lectures
rtk sortie shell compressible 60-90% sur les commandes 19.7% compressible, plafond autour de 3%, +7.6% par tâche (JetBrains) les marges
caveman / Concise ce que l'agent écrit 65% 8.5% des tokens de sortie (JetBrains) les marges

À faire lundi

  • Ouvrez votre dernière longue session et comptez où l'entrée est partie : combien de Read et Grep, combien de sortie shell, combien d'historique rejoué. Placez chaque outil sur sa tranche avant d'installer quoi que ce soit.
  • Installez Superpowers avec /plugin install superpowers@claude-plugins-official et passez une vraie fonctionnalité par brainstorming, writing-plans et subagent-driven-development. Regardez la jauge de contexte de l'orchestrateur rester plate.
  • Fixez un modèle explicite sur chaque sous-agent que vous lancez. Un modèle omis hérite de celui de la session, et vous payez le niveau de l'orchestrateur pour du travail mécanique.
  • Lancez /graphify . sur votre plus gros dépôt, puis graphify benchmark, et comparez le coût par requête avec la taille du corpus naïf qu'il affiche. Reconstruisez le graphe quand le code bouge.
  • Si vous utilisez déjà rtk, lisez rtk gain comme des octets de sortie shell, pas de l'argent. Croisez-le avec la répartition JetBrains : ce que find, read et grep économisent, les outils Read et Grep ne sont jamais passés par le hook.
  • Passez au style de sortie Concise via /config avant d'ajouter caveman ; il est livré avec Claude Code et ne coûte aucune règle de skill à chaque tour.
  • Gardez une mesure à vous : le coût d'une tâche avant et après chaque changement, sur le même jeu de tâches, pas le nombre d'octets d'une seule commande.

Aller plus loin

  • La méthodologie complète de JetBrains sur rtk, avec le rejeu de 83 sessions et la répartition des 1,056 commandes, est la référence pour mesurer n'importe quel proxy shell s1.
  • Le benchmark caveman explique comment 82 tâches appariées et un test des signes ramènent un graphique à 65% à 8.5% des tokens de sortie s2.
  • La page savings-explained de rtk est l'arbre le plus clair de ce qu'une session lit réellement ; lisez-la avant de croire un compteur de « tokens saved » s3.
  • La section benchmarks du README de graphify documente la construction à zéro crédit et la passe sémantique, la seule étape qui coûte des appels au modèle s5.
  • La section de sélection de modèle de Superpowers, avec « Turn count beats token price » et le plafond de cinq tours, est la partie à copier dans vos propres définitions d'agents s14.
  • La porte stricte du brainstorming et les trois chemins montrent comment la cérémonie s'adapte à la tâche, et où elle se déclenche aussi sur des correctifs trop petits pour la mériter s12.
  • Les styles de sortie dans la doc Claude Code : le style Concise, le seuil v2.1.237, et pourquoi les sous-agents l'ignorent s8.

Sources

FAQ

Pourquoi rtk affiche-t-il 11.6M de tokens économisés s'il bouge à peine la facture ?

Le compteur mesure des octets de sortie shell divisés par 4, sur les commandes passées par le hook. Les appels aux outils Read et Grep, le prompt système et l'historique rejoué n'y passent jamais, et JetBrains a trouvé que seuls 19.7% de ce que le modèle lit se compressent ainsi.

Superpowers compresse-t-il quelque chose ?

Non. Il lit moins en donnant à chaque tâche un sous-agent neuf avec le seul contexte de cette tâche, et paie moins en attribuant le modèle le moins puissant qui convient au rôle. Le coût, c'est une porte d'entrée sur chaque tâche.

Faut-il installer caveman ?

JetBrains n'a trouvé aucune perte de qualité et 8.5% de tokens de sortie en moins : utilisez-le si le style vous plaît. Le style de sortie Concise de Claude Code v2.1.237 ou plus récent donne le même effet sans les 1 à 1.5k tokens d'entrée que les règles du skill coûtent à chaque tour.

Quand graphify cesse-t-il de rapporter ?

Quand le graphe est obsolète ou que la question demande la passe sémantique, qui coûte bien des appels au modèle. Le chiffre de 91.8x compare une requête à la lecture du corpus entier, donc les petits dépôts voient un écart plus faible.