TL;DR
- Vier Tools greifen an vier verschiedenen Stellen einer Claude-Code-Rechnung an: graphify bei dem, was gelesen wird, rtk bei der Shell-Ausgabe, Superpowers bei Verlauf und Modellwahl, caveman bei dem, was der Agent schreibt. Sortiere sie nach der Größe des Anteils, den sie berühren, nicht nach der Prozentzahl in ihrer README.
- Superpowers ist das Einzige, das die Rechnung wirklich bewegt: ein frischer Subagent pro Aufgabe und das schwächste Modell, das ausreicht, ändern, was gelesen wird und wer es liest. Der Preis ist ein Gate bei jeder Aufgabe, auch bei winzigen.
- graphify ist zweiter: ein lokaler tree-sitter-Graph, gebaut ohne LLM-Credits, 91.8x weniger Tokens pro Abfrage als beim naiven Lesen unseres eigenen Korpus.
- rtk komprimiert den einen Anteil, den ein Bash-Hook sieht. JetBrains hat gemessen: 19.7% dessen, was das Modell liest, sind komprimierbar, die Obergrenze liegt bei rund 3% der Rechnung, und im End-to-End-Test waren es +7.6% pro Aufgabe.
- caveman wirbt mit 65% und hat bei agentischer Arbeit 8.5% der Output-Tokens gemessen. Claude Code liefert dieselbe Idee als Output-Stil Concise mit.
- Die zwei Kennzahlen, die alle zitieren, 11.6M gesparte Tokens und +7.6% pro Aufgabe, messen verschiedene Dinge: Bytes an Bash-Ausgabe gegen die Kosten einer abgeschlossenen Aufgabe.
Was die Messungen sagen
Zuerst die Karte. Das Spar-Dokument von rtk zeichnet den Baum dessen, was eine Session liest, und markiert die Bash-Ausgabe als einzigen Teil, den der Proxy filtert. Dann sagt es klar: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains hat 83 Baseline-Sessions nachgespielt, 1,9 Millionen Zeichen Tool-Ausgabe, und in drei Teile aufgeteilt: Shell-Ausgabe, die rtk komprimieren kann, 373,339 (19.7%), Shell-Ausgabe ohne passende Regel 879,326 (46.3%), Datei- und Suchtools, die an rtk vorbeilaufen, 646,613 (34.0%) s1. Read und Grep laufen nie durch den Bash-Hook. Die caveman-README kommt von der anderen Seite zum selben Schluss: Das Lesen ist meist die größere Hälfte der Rechnung s7.
graphify. Das Repo wurde am 2026-04-03 angelegt und hatte am 2026-09-02 113,946 Sterne und 11,078 Forks, letzte Version v0.9.53, Python, Apache-2.0 s5. Die Benchmark-Zeile der README lautet "Graph build | LLM credits | 0": Der Code wird lokal mit tree-sitter über ~40 Sprachen geparst, Communities werden mit Leiden getrennt, nichts verlässt den Rechner s5. Der Beitrag des Autors auf r/ClaudeAI nannte 73k Sterne und 2.2M Downloads in 2.5 Monaten s10. Unser eigenes graphify benchmark auf einem Projekt mit 1,701,550 Wörtern (etwa 2,268,733 Tokens bei naivem Lesen) baute 34,031 Knoten und 56,865 Kanten, durchschnittliche Abfragekosten rund 24,702 Tokens, 91.8x weniger Tokens pro Abfrage; pro Frage reichte die Spanne von 679.1x für "what is the main entry point" bis 34.0x für "what connects the data layer to the api" s5. Die 91.8x gelten gegenüber einem naiven vollständigen Lesen, das niemand absichtlich tut; außerdem veraltet der Graph, sobald sich der Code bewegt, und der optionale semantische Durchlauf ist der einzige Schritt, der Modellaufrufe kostet.
rtk. Angelegt am 2026-01-22, 78,326 Sterne und 4,942 Forks am 2026-09-02, Version v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Der Launch-Post behauptete "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" und "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Auf unserer Maschine meldete rtk 0.42.3 25599 Befehle und 11.6M gesparte Tokens (41.6%), mit find, read und grep ganz oben in der Tabelle By Command s4. JetBrains installierte rtk v0.43.0 genau so, wie rtk init -g es ausliefert, auf Claude Code 2.1.201 und claude-sonnet-5, und ließ 86 Aufgaben zweimal laufen. Nur 1 von 3 Shell-Befehlen kann rtk umschreiben (349 umschreibbar, 525 ohne Regel, 182 übersprungen, von 1,056 Befehlen). Selbst wenn man alle komprimierbare Ausgabe um 70% drückt, liegt die Ersparnis bei höchstens rund 3% der Rechnung; gemessen wurden +7.6% Mehrkosten pro Aufgabe, ohne Unterschied bei hohem Effort s1. Die README räumt den Punkt inzwischen ein: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", und die gemeldeten Zahlen sind als bytes / 4 geschätzt s4.
Superpowers. Angelegt am 2025-10-09, 280,792 Sterne und 25,164 Forks am 2026-09-02, Version v6.3.0 mit vierzehn Skills, MIT, ein Installationsbefehl: /plugin install superpowers@claude-plugins-official s6. Der Brainstorming-Skill beginnt mit einem harten Gate: kein Code, kein Scaffolding, kein Implementierungs-Skill, bevor eine explizite Absicht bestätigt ist; drei Pfade (Spike, begrenzt, architektonisch) und die Regel "When in doubt between two paths, take the heavier one" s12. writing-plans geht davon aus, dass der Engineer null Kontext hat, und schneidet die Arbeit in Schritte, bei denen "Each step is one action (2-5 minutes)" s13. subagent-driven-development gibt jeder Aufgabe einen frischen Subagenten, der nur den Kontext seiner Aufgabe erhält, nie den Sitzungsverlauf, mit einem Review nach jeder Aufgabe und einem breiten Review des Branches am Ende. Der Abschnitt zur Modellwahl sagt "Use the least powerful model that can handle each role to conserve cost", warnt, dass ein weggelassenes Modell das der Session erbt, und hält fest "Turn count beats token price". Höchstens fünf Runden pro Aufgabe: Runde 1 bis 3 setzen den Implementer fort, Runde 4 bringt einen frischen Implementer auf einem stärkeren Modell, in Runde 5 entscheidet der Orchestrator selbst s14. Nirgends Kompression: Die Ersparnis kommt aus weniger gelesenem Verlauf und aus einem kleineren Modell für mechanische Schritte. Den vollständigen Durchgang gibt es in unserem früheren Video s11.
caveman. Angelegt am 2026-04-04, 102,548 Sterne und 5,967 Forks am 2026-09-02, Version bin-v1.1.5, Go; der Skill steht unter MIT, die Proxy-Runtime unter BSL-1.1 s7. Die eigene Tabelle, zehn Prompts über die Claude API, zeigt im Schnitt 1214 Output-Tokens ohne und 294 mit caveman, also 65%, im besten Fall 87%, im schlechtesten 22% s7. Der IMPORTANT-Block der README ist ehrlich: Der Skill kürzt nur den Output, Input- und Reasoning-Tokens bleiben gleich, und die Regeln kosten bei jedem Turn etwa 1 bis 1.5k Input-Tokens, sodass die Ersparnis über die ganze Session niedriger ausfällt als im Diagramm s7. JetBrains ließ 82 gepaarte Aufgaben auf Claude Code 2.1.200 mit claude-sonnet-5 bei Effort low laufen, rund USD 106: "Advertised saving: 65%. Measured saving: 8.5%", 592k auf 542k Output-Tokens, keine messbare Qualitätseinbuße (Vorzeichentest p = 0.82), Empfehlung "use it if you like it" s2. Der eingebaute Concise-Stil von Claude Code leistet dasselbe: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", erfordert v2.1.237 oder neuer, wird über /config gewählt und als outputStyle in .claude/settings.local.json gespeichert. Stile gelten nur für die Hauptkonversation; ein Subagent läuft mit seinem eigenen System-Prompt s8.
Urteilstabelle
| Tool | Anteil an der Rechnung | Beworben | Gemessen | Bewegt |
|---|---|---|---|---|
| Superpowers | Verlauf + Modell pro Aufgabe | keine Zahl | frischer Kontext pro Aufgabe, schwächstes Modell pro Rolle | die Rechnung |
| graphify | was gelesen wird | 0 LLM-Credits zum Bauen | 91.8x weniger Tokens pro Abfrage gegenüber naivem Lesen (unsere Messung) | die Rechnung, beim Lesen |
| rtk | komprimierbare Shell-Ausgabe | 60-90% bei Befehlen | 19.7% komprimierbar, Obergrenze rund 3%, +7.6% pro Aufgabe (JetBrains) | die Ränder |
| caveman / Concise | was der Agent schreibt | 65% | 8.5% der Output-Tokens (JetBrains) | die Ränder |
Das machst du am Montag
- Öffne deine letzte lange Session und zähle, wohin der Input ging: wie viel Read und Grep, wie viel Shell-Ausgabe, wie viel wiederholter Verlauf. Ordne jedes Tool seinem Anteil zu, bevor du irgendetwas installierst.
- Installiere Superpowers mit
/plugin install superpowers@claude-plugins-officialund führe ein echtes Feature durch brainstorming, writing-plans und subagent-driven-development. Beobachte, wie die Kontextanzeige des Orchestrators flach bleibt. - Setze bei jedem Subagenten, den du losschickst, ein explizites Modell. Ein weggelassenes Modell erbt das der Session, und du zahlst für mechanische Arbeit den Tarif des Orchestrators.
- Führe
/graphify .auf deinem größten Repo aus, danngraphify benchmark, und vergleiche die Kosten pro Abfrage mit der Größe des naiven Korpus, die ausgegeben wird. Baue den Graphen neu, wenn sich der Code bewegt. - Wenn du rtk schon nutzt, lies
rtk gainals Bytes an Shell-Ausgabe, nicht als Geld. Lege die JetBrains-Aufteilung daneben: Was auch immerfind,readundgrepsparen, die Tools Read und Grep liefen nie durch den Hook. - Wechsle über
/configzum Output-Stil Concise, bevor du caveman hinzufügst; er wird mit Claude Code ausgeliefert und kostet keine Skill-Regeln pro Turn. - Führe eine eigene Messung: Aufgabenkosten vor und nach jeder Änderung, dieselbe Aufgabenmenge, nicht die Byte-Zahl eines einzelnen Befehls.
Weiterlesen
- Die vollständige rtk-Methodik von JetBrains, mit dem Nachspielen von 83 Sessions und der Aufteilung der 1,056 Befehle, ist die Referenz, wenn du einen Shell-Proxy messen willst s1.
- Der caveman-Benchmark erklärt, wie 82 gepaarte Aufgaben und ein Vorzeichentest aus einem 65%-Diagramm 8.5% der Output-Tokens machen s2.
- Die Seite savings-explained von rtk zeigt am klarsten den Baum dessen, was eine Session tatsächlich liest; lies sie, bevor du einem "tokens saved"-Zähler traust s3.
- Der Benchmark-Abschnitt der graphify-README dokumentiert den Build ohne Credits und den semantischen Durchlauf, den einzigen Schritt, der Modellaufrufe kostet s5.
- Der Abschnitt zur Modellwahl bei Superpowers, mit "Turn count beats token price" und der Fünf-Runden-Grenze, ist der Teil, den du in deine eigenen Agent-Definitionen kopieren solltest s14.
- Das harte Brainstorming-Gate und die drei Pfade zeigen, wie die Zeremonie mit der Aufgabe skaliert und wo sie auch bei Fixes feuert, die sie nicht verdienen s12.
- Output-Stile in den Claude-Code-Docs: der Stil Concise, die Untergrenze v2.1.237 und warum Subagenten ihn ignorieren s8.
Quellen
- Does rtk really save tokens in Claude Code?, JetBrains. Warum lesen: der einzige End-to-End-Test von rtk, mit der Aufteilung 19.7% / 46.3% / 34.0% dessen, was ein Agent liest.
- Speak to AI agents like cavemen to save tokens, JetBrains. Warum lesen: 82 gepaarte Aufgaben, die die 65%-Behauptung auf 8.5% schrumpfen lassen, ohne Qualitätsverlust zu finden.
- How RTK savings work, GitHub. Warum lesen: der Baum der Rechnung von den Maintainern selbst und der Satz über 90% weniger Bytes.
- rtk-ai/rtk on GitHub, GitHub. Warum lesen: Die README sagt jetzt, was rtk misst und wie die Zahlen geschätzt werden.
- Graphify-Labs/graphify on GitHub, GitHub. Warum lesen: Benchmark-Tabelle, der Build ohne Credits und der hier verwendete Befehl
graphify benchmark. - obra/superpowers on GitHub, GitHub. Warum lesen: das Plugin, das ändert, was gelesen wird und welches Modell es liest.
- JuliusBrussee/caveman on GitHub, GitHub. Warum lesen: die Spartabelle und der IMPORTANT-Block, der sie relativiert.
- Output styles, Claude Code docs. Warum lesen: der eingebaute Stil Concise und seine Grenzen bei Subagenten.
- rtk launch post on r/ClaudeAI, Reddit. Warum lesen: die ursprüngliche 10.2M-Behauptung, nützlich zum Vergleich mit dem, was JetBrains gemessen hat.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Warum lesen: der Autor zur Verbreitung und dazu, wofür der Graph gedacht ist.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Warum lesen: unser vollständiger Durchgang durch das Plugin, Skill für Skill.
- Superpowers brainstorming skill (SKILL.md), GitHub. Warum lesen: das harte Gate und die drei Pfade im Wortlaut.
- Superpowers writing-plans skill (SKILL.md), GitHub. Warum lesen: die Schrittgröße von 2 bis 5 Minuten, die die Kontexte der Subagenten klein hält.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Warum lesen: Modellwahl pro Rolle und die Fünf-Runden-Grenze.
FAQ
Warum zeigt rtk 11.6M gesparte Tokens, wenn es die Rechnung kaum bewegt?
Der Zähler misst Bytes an Shell-Ausgabe geteilt durch 4, bei den Befehlen, die durch den Hook liefen. Aufrufe von Read und Grep, System-Prompt und wiederholter Verlauf laufen nie dort durch, und JetBrains fand, dass nur 19.7% dessen, was das Modell liest, auf diese Weise komprimierbar sind.
Komprimiert Superpowers irgendetwas?
Nein. Es liest weniger, weil jede Aufgabe einen frischen Subagenten mit nur dem Kontext dieser Aufgabe bekommt, und zahlt weniger, weil es das schwächste Modell zuweist, das die Rolle erfüllen kann. Der Preis ist ein Gate bei jeder Aufgabe.
Lohnt sich caveman?
JetBrains fand keinen Qualitätsverlust und 8.5% weniger Output-Tokens, also nutze es, wenn dir der Stil gefällt. Der Output-Stil Concise in Claude Code ab v2.1.237 bringt denselben Effekt ohne die 1 bis 1.5k Input-Tokens, die die Regeln des Skills bei jedem Turn kosten.
Wann zahlt sich graphify nicht mehr aus?
Wenn der Graph veraltet ist oder die Frage den semantischen Durchlauf braucht, der Modellaufrufe kostet. Die 91.8x vergleichen eine Abfrage mit dem Lesen des gesamten Korpus, kleinere Repos sehen also eine kleinere Lücke.
AIDive