TL;DR
- Cztery narzędzia działają na czterech różnych częściach rachunku za Claude Code: graphify na tym, co jest czytane, rtk na wyjściu powłoki, Superpowers na historii i wyborze modelu, caveman na tym, co pisze agent. Szereguj je według wielkości kawałka, którego dotykają, a nie według procentu z ich README.
- Superpowers jako jedyne naprawdę rusza rachunek: świeży subagent na zadanie i najsłabszy model, który wystarcza, zmieniają to, co jest czytane, i to, kto to czyta. Koszt to bramka przy każdym zadaniu, także malutkim.
- graphify jest drugie: lokalny graf tree-sitter budowany bez kredytów LLM, 91.8x mniej tokenów na zapytanie niż przy naiwnym czytaniu naszego korpusu.
- rtk kompresuje jedyny kawałek, który widzi hook Bash. JetBrains zmierzył, że 19.7% tego, co model czyta, da się skompresować, sufit to około 3% rachunku, a w teście end-to-end wyszło +7.6% na zadanie.
- caveman reklamuje 65%, a zmierzono 8.5% tokenów wyjściowych przy pracy agentowej. Claude Code ma ten sam pomysł wbudowany jako styl wyjścia Concise.
- Dwie liczby, które wszyscy cytują, 11.6M zaoszczędzonych tokenów i +7.6% na zadanie, mierzą różne rzeczy: bajty wyjścia basha kontra koszt ukończonego zadania.
Co mówią pomiary
Najpierw mapa. Dokument rtk o oszczędnościach rysuje drzewo tego, co czyta sesja, i zaznacza wyjście basha jako jedyną część filtrowaną przez proxy, po czym mówi to wprost: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains odtworzył 83 sesje bazowe, 1,9 miliona znaków wyjścia narzędzi, i podzielił je na trzy części: wyjście powłoki, które rtk potrafi skompresować, 373,339 (19.7%), wyjście powłoki bez reguły 879,326 (46.3%), narzędzia do czytania plików i wyszukiwania, które omijają rtk, 646,613 (34.0%) s1. Read i Grep nigdy nie przechodzą przez hook Bash. README caveman dochodzi do tego samego wniosku z drugiej strony: czytanie to zwykle większa połowa rachunku s7.
graphify. Repo powstało 2026-04-03, a 2026-09-02 miało 113,946 gwiazdek i 11,078 forków, najnowsze wydanie v0.9.53, Python, Apache-2.0 s5. Wiersz benchmarku w README brzmi "Graph build | LLM credits | 0": kod jest parsowany lokalnie przez tree-sitter w ~40 językach, społeczności są dzielone algorytmem Leiden, nic nie opuszcza maszyny s5. Post autora na r/ClaudeAI podawał 73k gwiazdek i 2.2M pobrań w 2.5 miesiąca s10. Nasz własny graphify benchmark na projekcie z 1,701,550 słów (około 2,268,733 tokenów przy naiwnym czytaniu) zbudował 34,031 węzłów i 56,865 krawędzi, średni koszt zapytania około 24,702 tokenów, 91.8x mniej tokenów na zapytanie; w przeliczeniu na pytanie rozrzut sięgał od 679.1x dla "what is the main entry point" do 34.0x dla "what connects the data layer to the api" s5. Te 91.8x to porównanie z naiwnym pełnym czytaniem, którego nikt nie robi celowo; do tego graf się starzeje, gdy kod się zmienia, a opcjonalny przebieg semantyczny to jedyny krok, który kosztuje wywołania modelu.
rtk. Utworzony 2026-01-22, 78,326 gwiazdek i 4,942 forków 2026-09-02, wydanie v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Post startowy twierdził "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" oraz "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Na naszej maszynie rtk 0.42.3 raportował 25599 poleceń i 11.6M zaoszczędzonych tokenów (41.6%), a find, read i grep były na szczycie tabeli By Command s4. JetBrains zainstalował rtk v0.43.0 dokładnie tak, jak dostarcza go rtk init -g, na Claude Code 2.1.201 i claude-sonnet-5, i uruchomił 86 zadań dwukrotnie. Tylko 1 na 3 polecenia powłoki rtk potrafi przepisać (349 do przepisania, 525 bez reguły, 182 pominięte, z 1,056 poleceń). Nawet po zbiciu całego kompresowalnego wyjścia o 70% oszczędność kończy się na około 3% rachunku; zmierzony wynik to +7.6% droższe zadanie, bez różnicy przy wysokim effort s1. README przyznaje to teraz wprost: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", a podawane liczby są szacowane jako bytes / 4 s4.
Superpowers. Utworzony 2025-10-09, 280,792 gwiazdek i 25,164 forków 2026-09-02, wydanie v6.3.0 z czternastoma skillami, MIT, jedno polecenie instalacji: /plugin install superpowers@claude-plugins-official s6. Skill brainstorming zaczyna się od twardej bramki: żadnego kodu, żadnego scaffoldingu, żadnego skilla implementacyjnego, dopóki jawny zamiar nie zostanie zatwierdzony; trzy ścieżki (spike, ograniczona, architektoniczna) i reguła "When in doubt between two paths, take the heavier one" s12. writing-plans zakłada, że inżynier ma zerowy kontekst, i tnie pracę na kroki, w których "Each step is one action (2-5 minutes)" s13. subagent-driven-development daje każdemu zadaniu świeżego subagenta, który dostaje tylko kontekst swojego zadania, nigdy historię sesji, z review po każdym zadaniu i szerokim review brancha na końcu. Sekcja o modelach mówi "Use the least powerful model that can handle each role to conserve cost", ostrzega, że pominięty model dziedziczy model sesji, i stwierdza "Turn count beats token price". Maksymalnie pięć rund na zadanie: rundy od 1 do 3 wznawiają implementatora, runda 4 wprowadza nowego implementatora na mocniejszym modelu, w rundzie 5 rozstrzyga sam orkiestrator s14. Nigdzie nie ma kompresji: oszczędność bierze się z czytania mniejszej historii i płacenia mniejszemu modelowi za mechaniczne kroki. Pełne omówienie jest w naszym wcześniejszym filmie s11.
caveman. Utworzony 2026-04-04, 102,548 gwiazdek i 5,967 forków 2026-09-02, wydanie bin-v1.1.5, Go; skill jest na MIT, runtime proxy na BSL-1.1 s7. Jego własna tabela, dziesięć promptów przez Claude API, pokazuje średnio 1214 tokenów wyjściowych bez i 294 z caveman, czyli 65%, w najlepszym przypadku 87%, w najgorszym 22% s7. Blok IMPORTANT w README jest uczciwy: skill skraca tylko wyjście, tokeny wejściowe i rozumowania się nie zmieniają, a reguły kosztują około 1 do 1.5k tokenów wejściowych w każdej turze, więc oszczędność w całej sesji wypada niżej niż na wykresie s7. JetBrains uruchomił 82 sparowane zadania na Claude Code 2.1.200 z claude-sonnet-5 przy effort low, około 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", z 592k do 542k tokenów wyjściowych, bez wykrywalnego spadku jakości (test znaków p = 0.82), rekomendacja "use it if you like it" s2. Wbudowany styl Concise w Claude Code robi to samo: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", wymaga v2.1.237 lub nowszej, wybiera się go przez /config i zapisuje jako outputStyle w .claude/settings.local.json. Style dotyczą tylko głównej rozmowy; subagent działa na własnym prompcie systemowym s8.
Tabela werdyktów
| Narzędzie | Część rachunku | Reklamowane | Zmierzone | Rusza |
|---|---|---|---|---|
| Superpowers | historia + model na zadanie | brak liczby | świeży kontekst na zadanie, najsłabszy model na rolę | rachunek |
| graphify | to, co jest czytane | 0 kredytów LLM na budowę | 91.8x mniej tokenów na zapytanie niż przy naiwnym czytaniu (nasze) | rachunek, na czytaniu |
| rtk | kompresowalne wyjście powłoki | 60-90% na poleceniach | 19.7% kompresowalne, sufit około 3%, +7.6% na zadanie (JetBrains) | marginesy |
| caveman / Concise | to, co pisze agent | 65% | 8.5% tokenów wyjściowych (JetBrains) | marginesy |
Do zrobienia w poniedziałek
- Otwórz swoją ostatnią długą sesję i policz, gdzie poszło wejście: ile Read i Grep, ile wyjścia powłoki, ile powtórnie wczytanej historii. Przypisz każde narzędzie do jego kawałka, zanim cokolwiek zainstalujesz.
- Zainstaluj Superpowers przez
/plugin install superpowers@claude-plugins-officiali przepuść jedną prawdziwą funkcję przez brainstorming, writing-plans i subagent-driven-development. Obserwuj, jak wskaźnik kontekstu orkiestratora zostaje płaski. - Ustaw jawny model w każdym subagencie, którego uruchamiasz. Pominięty model dziedziczy model sesji i płacisz stawką orkiestratora za mechaniczną robotę.
- Uruchom
/graphify .na największym repo, potemgraphify benchmark, i porównaj koszt na zapytanie z rozmiarem naiwnego korpusu, który wypisuje. Przebuduj graf, gdy kod się zmieni. - Jeśli już używasz rtk, czytaj
rtk gainjako bajty wyjścia powłoki, nie pieniądze. Zestaw to z podziałem JetBrains: cokolwiek oszczędzająfind,readigrep, narzędzia Read i Grep nigdy nie przechodziły przez hook. - Przełącz się na styl wyjścia Concise przez
/config, zanim dodasz caveman; jest w Claude Code i nie kosztuje reguł skilla w każdej turze. - Prowadź jeden własny pomiar: koszt zadania przed i po każdej zmianie, ten sam zestaw zadań, a nie liczba bajtów pojedynczego polecenia.
Czytaj dalej
- Pełna metodologia JetBrains dla rtk, z odtworzeniem 83 sesji i podziałem 1,056 poleceń, to punkt odniesienia do mierzenia każdego proxy powłoki s1.
- Benchmark caveman wyjaśnia, jak 82 sparowane zadania i test znaków zamieniają wykres 65% w 8.5% tokenów wyjściowych s2.
- Strona savings-explained w rtk to najczytelniejsze drzewo tego, co sesja naprawdę czyta; przeczytaj ją, zanim zaufasz jakiemukolwiek licznikowi "tokens saved" s3.
- Sekcja benchmarków w README graphify opisuje budowę bez kredytów i przebieg semantyczny, jedyny krok kosztujący wywołania modelu s5.
- Sekcja o wyborze modelu w Superpowers, z "Turn count beats token price" i limitem pięciu rund, to część warta skopiowania do własnych definicji agentów s14.
- Twarda bramka brainstormingu i trzy ścieżki pokazują, jak ceremonia skaluje się z zadaniem i gdzie odpala także przy poprawkach zbyt małych, by na nią zasługiwać s12.
- Style wyjścia w dokumentacji Claude Code: styl Concise, próg v2.1.237 i dlaczego subagenci go ignorują s8.
Źródła
- Does rtk really save tokens in Claude Code?, JetBrains. Dlaczego warto: jedyny test end-to-end rtk, z podziałem 19.7% / 46.3% / 34.0% tego, co czyta agent.
- Speak to AI agents like cavemen to save tokens, JetBrains. Dlaczego warto: 82 sparowane zadania, które sprowadzają obietnicę 65% do 8.5% bez znalezienia spadku jakości.
- How RTK savings work, GitHub. Dlaczego warto: drzewo rachunku od samych maintainerów i zdanie o 90% mniejszej liczbie bajtów.
- rtk-ai/rtk on GitHub, GitHub. Dlaczego warto: README mówi teraz, co mierzy rtk i jak szacowane są liczby.
- Graphify-Labs/graphify on GitHub, GitHub. Dlaczego warto: tabela benchmarków, budowa bez kredytów i polecenie
graphify benchmarkużyte tutaj. - obra/superpowers on GitHub, GitHub. Dlaczego warto: plugin, który zmienia to, co jest czytane, i to, który model to czyta.
- JuliusBrussee/caveman on GitHub, GitHub. Dlaczego warto: tabela oszczędności i blok IMPORTANT, który ją podważa.
- Output styles, Claude Code docs. Dlaczego warto: wbudowany styl Concise i jego ograniczenia przy subagentach.
- rtk launch post on r/ClaudeAI, Reddit. Dlaczego warto: oryginalne twierdzenie o 10.2M, przydatne do porównania z tym, co zmierzył JetBrains.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Dlaczego warto: autor o adopcji i o tym, do czego służy graf.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Dlaczego warto: nasze pełne omówienie pluginu, skill po skillu.
- Superpowers brainstorming skill (SKILL.md), GitHub. Dlaczego warto: twarda bramka i trzy ścieżki w oryginalnym brzmieniu.
- Superpowers writing-plans skill (SKILL.md), GitHub. Dlaczego warto: granulacja kroków 2 do 5 minut, która utrzymuje małe konteksty subagentów.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Dlaczego warto: wybór modelu na rolę i limit pięciu rund.
FAQ
Dlaczego rtk pokazuje 11.6M zaoszczędzonych tokenów, skoro ledwo rusza rachunek?
Licznik mierzy bajty wyjścia powłoki podzielone przez 4, dla poleceń, które przeszły przez hook. Wywołania Read i Grep, prompt systemowy i powtórnie wczytana historia nigdy tamtędy nie przechodzą, a JetBrains ustalił, że tylko 19.7% tego, co model czyta, da się w ten sposób skompresować.
Czy Superpowers cokolwiek kompresuje?
Nie. Czyta mniej, bo daje każdemu zadaniu świeżego subagenta z samym kontekstem tego zadania, i płaci mniej, bo przypisuje najsłabszy model, który poradzi sobie z rolą. Koszt to bramka przy każdym zadaniu.
Czy warto zainstalować caveman?
JetBrains nie znalazł spadku jakości i zmierzył 8.5% mniej tokenów wyjściowych, więc używaj go, jeśli lubisz ten styl. Styl wyjścia Concise w Claude Code od v2.1.237 daje ten sam efekt bez 1 do 1.5k tokenów wejściowych, które reguły skilla kosztują w każdej turze.
Kiedy graphify przestaje się opłacać?
Gdy graf jest nieaktualny albo pytanie wymaga przebiegu semantycznego, który kosztuje wywołania modelu. Liczba 91.8x porównuje zapytanie z czytaniem całego korpusu, więc mniejsze repo widzą mniejszą różnicę.
AIDive