JetBrains dit non, ma machine dit 11,6 millions
En juillet 2026, JetBrains a dépensé environ 320 $ de crédit API — 425 essais facturés — pour évaluer rtk, un proxy shell que des dizaines de milliers de développeurs installent pour économiser des tokens dans Claude Code. Verdict : les sessions sont ressorties 7,6 % plus chères par tâche. Deux semaines plus tôt, la même équipe avait mesuré caveman, la skill annoncée comme coupant 65 % des tokens, et obtenu 8,5 %. Sur ma propre machine, rtk gain affiche 11,6 millions de tokens économisés sur 25 599 commandes.
Les deux séries de chiffres sont réelles. Elles ne mesurent pas la même chose : l'une est le coût par tâche terminée, l'autre des octets de sortie bash.
| Chiffre | Ce qu'il mesure | Source |
|---|---|---|
| +7,6 % par tâche (p=0,004) | Coût de bout en bout d'une tâche avec rtk installé | JetBrains, 425 essais, ~320 $ |
| 8,5 % des tokens de sortie | Économie mesurée de caveman en travail agentique | JetBrains, 82 tâches appariées |
| 65 % | Économie annoncée par caveman | README caveman |
| 11,6 M économisés (41,6 %) | Octets de sortie bash compressés par rtk | rtk gain, 25 599 commandes |
Voici la stack, quatre outils : graphify, rtk, Superpowers et caveman, 575 612 étoiles GitHub à eux quatre au 2026-09-02. Chacun touche une tranche différente de la facture.
| Outil | Étoiles (2026-09-02) | Langage | Licence |
|---|---|---|---|
| Superpowers | 280 792 | Skills Markdown | MIT |
| graphify | 113 946 | Python | Apache-2.0 |
| caveman | 102 548 | Go | MIT (skill) |
| rtk | 78 326 | Rust | Apache-2.0 |
Où vont vraiment les tokens
Une facture Claude Code a deux faces. Les tokens d'entrée, c'est tout ce que le modèle lit : la sortie de chaque commande shell, votre prompt, le prompt système, et tout l'historique de conversation rejoué à chaque appel. Les tokens de sortie, c'est tout ce que le modèle écrit.
La documentation de rtk dessine exactement cet arbre, et ajoute une phrase que son post de lancement n'avait pas : « Une commande qui affiche 90 % d'octets en moins ne rend pas votre session 90 % moins chère. »
JetBrains a chiffré le côté lecture en rejouant 83 sessions de référence, soit 1,9 million de caractères de sortie d'outils.
| Tranche de ce que le modèle lit | Caractères | Part |
|---|---|---|
| Sortie shell que rtk peut compresser | 373 339 | 19,7 % |
| Sortie shell pour laquelle rtk n'a pas de règle | 879 326 | 46,3 % |
| Outils de lecture et de recherche qui contournent rtk | 646 613 | 34,0 % |
Un cinquième seulement de ce que le modèle lit est compressible par un proxy shell — les outils intégrés Read, Grep et Glob de Claude Code ne passent jamais par le hook Bash.
D'où la carte des quatre outils : graphify réduit ce que l'agent lit, rtk réduit ce que le shell renvoie, Superpowers réduit l'historique que chaque tâche transporte et choisit quel modèle la porte, et caveman réduit ce que l'agent dit. La lecture est la plus grosse moitié de la facture : c'est donc par là que commence le classement.
graphify : parcourir des nœuds, pas des lignes
graphify est une skill qui transforme une base de code — avec ses docs, schémas SQL, fichiers de config et PDF — en graphe de connaissances interrogeable. Vous tapez /graphify . dans Claude Code, Cursor, Codex ou Gemini CLI, et le projet est cartographié une fois pour que l'agent interroge le graphe au lieu de grepper les fichiers.
Le code est parsé en AST avec tree-sitter, sur une quarantaine de langages : déterministe, aucun appel LLM, rien ne quitte la machine. La construction coûte zéro crédit LLM. Elle produit trois fichiers : graph.html à explorer au clic, GRAPH_REPORT.md, et graph.json — le graphe lui-même, interrogeable sans relire vos fichiers. Chaque nœud est un concept (un fichier, une fonction, une classe), et chaque arête porte le tag EXTRACTED quand elle était explicite dans le source ou INFERRED quand graphify l'a résolue. Les nœuds sont regroupés en sous-systèmes avec l'algorithme de Leiden.
Le benchmark intégré, lancé sur un de nos propres projets :
| Métrique | Valeur |
|---|---|
| Nœuds | 34 031 |
| Arêtes | 56 865 |
| Communautés détectées | 967 |
| Provenance des arêtes | 76 % EXTRACTED · 24 % INFERRED |
| Lecture naïve du corpus complet | 1 701 550 mots ≈ 2 268 733 tokens |
| Requête moyenne sur le graphe | ~24 702 tokens |
| Réduction | 91,8× moins de tokens par requête |
Par question, l'écart est large : 679,1× sur « what is the main entry point », 34,0× sur « what connects the data layer to the api ».
Deux limites. La comparaison se fait contre une lecture de tout, et une session pilotée au grep n'a jamais coûté ça : le gain réel est plus faible. Et le graphe se périme — rafraîchissez-le avec graphify update <path>, --watch ou les hooks git — tandis que la passe sémantique sur les docs, PDF et images appelle bien un modèle et dépense bien des tokens.
Installation : uv tool install graphifyy (le nom du paquet porte deux y), puis graphify install.
rtk : le proxy shell au tribunal
rtk est un proxy CLI entre Claude Code et votre shell. Des commandes banales comme ls, cat ou git status renvoient du bruit que l'agent doit lire en tokens d'entrée : permissions de fichiers, barres de progression, cent lignes de tests qui passent. rtk exécute la même commande et rend une version compacte : un seul binaire Rust, plus de 100 commandes supportées, moins de 10 ms de surcoût. Un hook PreToolUse réécrit chaque appel Bash éligible (git status → rtk git status) avant exécution, l'agent n'a donc jamais à y penser.
Le post de lancement de l'auteur annonçait 10,2 M de tokens économisés en deux semaines, 89,2 %, avec des exemples comme cargo test passant de 155 lignes à 3. Notre propre tableau de bord après 25 599 commandes :
| Commande | Appels | Tokens économisés | Taux |
|---|---|---|---|
rtk find |
354 | 2,2 M | 46,6 % |
rtk read |
3 504 | 2,2 M | 10,4 % |
rtk grep |
2 760 | 1,9 M | 47,7 % |
rtk ps aux |
24 | 1,1 M | 98,0 % |
rtk diff |
39 | 541,1 K | 92,2 % |
| Total | 25 599 | 11,6 M | 41,6 % |
Vient le procès. JetBrains a installé rtk tel qu'il est livré et lancé 86 tâches deux fois, sur claude-sonnet-5.
| Constat JetBrains | Valeur |
|---|---|
| Commandes shell que rtk peut réécrire | 349 sur 1 056 (1 sur 3) |
| Plafond d'économie totale | ~3 % de la facture |
| Coût par tâche, effort de raisonnement faible | +7,6 % (p=0,004) |
| Tours par tâche | +13,8 % (p=0,03) |
| Coût par tâche, effort élevé | ±0 % |
| Qualité des tâches | Inchangée |
Le README de rtk le dit désormais clairement : jusqu'à 90 % de la sortie bash, « ce qui n'est pas la même chose que couper votre facture de 90 % », et ses propres compteurs sont estimés en octets / 4.
Verdict : c'est gratuit, la compression est réelle et, selon les mots de JetBrains, « souvent élégante ». Gardez-le pour les sessions chargées en bash ; n'attendez pas qu'il bouge la facture.
Superpowers : cadrer d'abord, puis des tâches trop petites pour échouer
Superpowers est le plugin Claude Code de Jesse Vincent — 280 792 étoiles, quatorze skills, une seule commande d'installation (/plugin install superpowers@claude-plugins-official). Il économise des tokens sans rien compresser.
Tout commence par la skill brainstorming, qui s'ouvre sur une barrière dure : pas de code, pas de scaffolding, aucune skill d'implémentation tant qu'une intention explicite n'est pas validée. Quand la skill se charge, l'agent devient un partenaire de brainstorming, et en pratique des pans du projet sont repensés avant qu'on ne construise quoi que ce soit. C'est l'étape qui compte le plus, parce que les tokens les plus chers sont ceux dépensés à construire la mauvaise chose.
La skill classe le travail en spike, changement borné ou changement architectural, et la règle est écrite dans le fichier : « En cas de doute entre deux voies, prenez la plus lourde. » Elle nomme même le mode d'échec, avec une section anti-pattern intitulée « Too Simple To Need Approval ». La voie architecturale produit une spec que vous validez, puis un plan d'implémentation.
C'est le plan qui apporte la fiabilité. La skill writing-plans découpe le travail en étapes d'une seule action, de 2 à 5 minutes : écrire le test qui échoue, le lancer pour vérifier qu'il échoue, écrire le code minimal qui le fait passer, relancer les tests, committer. Les plans sont rédigés en supposant que l'ingénieur n'a aucun contexte. Une tâche aussi petite tient dans une fenêtre de contexte fraîche avec de la marge : l'agent n'atteint donc jamais la fin d'une tâche avec une fenêtre saturée — et c'est la saturation qui produit du code halluciné.
La limite, c'est le cérémonial. Le fichier dit qu'il s'adapte à la taille de la tâche, mais la barrière se déclenche quand même sur un correctif d'une ligne, et ça coûte des tokens aussi.
Superpowers : une tâche, un subagent, un modèle à la taille
Puis le plan s'exécute, et l'arithmétique des tokens change. Une tâche, un subagent. Chaque subagent démarre avec un contexte frais qui ne contient que sa tâche, jamais l'historique de session : la fenêtre de l'orchestrateur reste petite et celle du subagent reste propre. Après chaque tâche, l'orchestrateur relit le résultat : OK, tâche suivante ; pas OK, un correctif repart vers un subagent. Cinq tours maximum par tâche — les tours 1 à 3 relancent l'implémenteur d'origine, le tour 4 confie le travail à un implémenteur neuf sur un modèle plus capable, au tour 5 l'orchestrateur tranche lui-même.
La règle qui paie tout le reste, c'est la sélection de modèle : « Utilisez le modèle le moins puissant capable de tenir chaque rôle, pour économiser. » L'orchestrateur note la difficulté de chaque tâche et choisit le modèle correspondant.
| Type de tâche | Niveau de modèle |
|---|---|
| Mécanique, bien spécifiée ; le plan contient déjà le code | Modèle le moins cher / petit |
| Coordination multi-fichiers, débogage | Modèle standard |
| Architecture, revue finale de branche | Modèle le plus capable |
| Modèle non précisé | Hérite du modèle de la session |
Une nuance du même fichier : « Le nombre de tours l'emporte sur le prix du token. » Un modèle bon marché qui prend trois tours n'est pas bon marché. En pratique, c'est ce qui rend Opus et Fable utilisables sur un plan Pro à 20 $ — le modèle cher ne touche qu'une poignée de tâches au lieu de toute la session.
Dernier gain : la documentation. Chaque spec et chaque plan est un fichier markdown enregistré dans docs/superpowers/specs/ et docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md, committé à la fin du travail. Sur le pipeline de cette chaîne, la migration vers notre moteur vidéo actuel est une spec plus un plan de quatorze tâches que l'on peut encore ouvrir, mentionner dans une nouvelle session et prolonger. Rien de ce que les agents ont fait n'est hors suivi.
caveman et le style Concise : en dire moins
Dernière tranche : ce que l'agent dit. Les agents narrent — « bien sûr », « ravi de vous aider », « le problème que vous rencontrez vient probablement de » — et ce sont des tokens de sortie pour rien.
caveman est une skill de Julius Brussee, 102 548 étoiles, qui fait parler l'agent comme un homme des cavernes : supprimer les articles, le remplissage, les politesses et les précautions, et suivre le patron [chose] [action] [raison]. [étape suivante]. Le code, les commandes, les chemins de fichiers et les messages d'erreur exacts ne sont jamais « cavemannés » ; seule la prose autour l'est. Elle propose trois niveaux (/caveman lite|full|ultra) et un hook SessionStart qui l'active au démarrage.
Son propre tableau, dix prompts via l'API Claude, donne 1 214 tokens de sortie en moyenne sans la skill et 294 avec — 65 %, avec un meilleur cas à 87 % et un pire cas à 22 %.
Le README fournit lui-même le rappel à la réalité : la skill ne raccourcit que la sortie, les tokens d'entrée et de raisonnement ne changent pas, et ses propres règles coûtent environ 1 à 1,5 k tokens d'entrée à chaque tour. JetBrains l'a mesurée sur 82 tâches agentiques appariées, pour environ 106 $ de crédit.
| caveman | Annoncé | Mesuré (JetBrains) |
|---|---|---|
| Économie de tokens de sortie | 65 % | 8,5 % (592 k → 542 k) |
| Impact qualité | — | Aucune dégradation détectable (test des signes p=0,82) |
L'écart est structurel : la sortie d'un agent est surtout du code et des appels d'outils, que caveman laisse à juste titre tranquilles. Recommandation de JetBrains : « utilisez-la si elle vous plaît. C'est amusant, et ça ne vous coûte rien de mesurable en qualité. »
Depuis Claude Code v2.1.237, il existe un équivalent intégré, le style de sortie Concise : Claude « commence par le résultat, saute le préambule et la narration, et garde des réponses courtes par défaut ». Choisissez-le dans /config → Output style ; il est enregistré dans .claude/settings.local.json et prend effet après un /clear ou une nouvelle session. Une limite commune aux deux : les styles de sortie ne s'appliquent qu'à la conversation principale — un subagent exécute son propre prompt système.
Verdict : ce qui bouge la facture, ce qui bouge les marges
Classement selon ce que chaque outil bouge vraiment, avec le coût qu'il porte.
| Rang | Outil | Ce qu'il bouge | Effet mesuré | Le coût |
|---|---|---|---|---|
| 1 | Superpowers | L'historique par tâche + quel modèle le lit | Le modèle cher sur une poignée de tâches au lieu de la session | Une barrière sur chaque tâche, même les correctifs d'une ligne |
| 2 | graphify | Ce que l'agent lit | 91,8× moins de tokens par requête qu'une lecture naïve du corpus (notre projet) | Le graphe se périme ; la passe sémantique dépense des tokens |
| 3 | rtk | Les octets de sortie bash | Plafond ~3 % de la facture ; +7,6 % par tâche à effort faible dans le test JetBrains | Seule 1 commande shell sur 3 a une règle |
| 4 | caveman / Concise | La prose que l'agent écrit | 8,5 % des tokens de sortie, sans perte de qualité | ~1 à 1,5 k tokens d'entrée à chaque tour |
Superpowers gagne, et pas grâce à une quelconque compression : un contexte frais par tâche et le modèle le moins cher capable de faire le travail changent ce qui est lu et qui le lit. graphify est deuxième parce que lire moins est la plus grosse moitié de la facture. rtk est réel, gratuit et inoffensif, mais deux tiers des commandes shell et toutes les lectures de fichiers passent à côté. caveman, ou le style Concise désormais livré avec Claude Code, rogne la plus petite tranche.
Les quatre sont gratuits à installer — graphify et rtk en Apache-2.0, Superpowers en MIT, la skill caveman en MIT. Plus de 570 000 étoiles disent que les gens veulent un miracle. La version honnête est un classement.
AIDive