AIDive

Pakiet do filmu

Cztery oszczędzacze tokenów Claude Code zmierzone: tabela werdyktów, checklista i źródła

11 min czytania

TL;DR

  • Cztery narzędzia działają na czterech różnych częściach rachunku za Claude Code: graphify na tym, co jest czytane, rtk na wyjściu powłoki, Superpowers na historii i wyborze modelu, caveman na tym, co pisze agent. Szereguj je według wielkości kawałka, którego dotykają, a nie według procentu z ich README.
  • Superpowers jako jedyne naprawdę rusza rachunek: świeży subagent na zadanie i najsłabszy model, który wystarcza, zmieniają to, co jest czytane, i to, kto to czyta. Koszt to bramka przy każdym zadaniu, także malutkim.
  • graphify jest drugie: lokalny graf tree-sitter budowany bez kredytów LLM, 91.8x mniej tokenów na zapytanie niż przy naiwnym czytaniu naszego korpusu.
  • rtk kompresuje jedyny kawałek, który widzi hook Bash. JetBrains zmierzył, że 19.7% tego, co model czyta, da się skompresować, sufit to około 3% rachunku, a w teście end-to-end wyszło +7.6% na zadanie.
  • caveman reklamuje 65%, a zmierzono 8.5% tokenów wyjściowych przy pracy agentowej. Claude Code ma ten sam pomysł wbudowany jako styl wyjścia Concise.
  • Dwie liczby, które wszyscy cytują, 11.6M zaoszczędzonych tokenów i +7.6% na zadanie, mierzą różne rzeczy: bajty wyjścia basha kontra koszt ukończonego zadania.

Co mówią pomiary

Najpierw mapa. Dokument rtk o oszczędnościach rysuje drzewo tego, co czyta sesja, i zaznacza wyjście basha jako jedyną część filtrowaną przez proxy, po czym mówi to wprost: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains odtworzył 83 sesje bazowe, 1,9 miliona znaków wyjścia narzędzi, i podzielił je na trzy części: wyjście powłoki, które rtk potrafi skompresować, 373,339 (19.7%), wyjście powłoki bez reguły 879,326 (46.3%), narzędzia do czytania plików i wyszukiwania, które omijają rtk, 646,613 (34.0%) s1. Read i Grep nigdy nie przechodzą przez hook Bash. README caveman dochodzi do tego samego wniosku z drugiej strony: czytanie to zwykle większa połowa rachunku s7.

graphify. Repo powstało 2026-04-03, a 2026-09-02 miało 113,946 gwiazdek i 11,078 forków, najnowsze wydanie v0.9.53, Python, Apache-2.0 s5. Wiersz benchmarku w README brzmi "Graph build | LLM credits | 0": kod jest parsowany lokalnie przez tree-sitter w ~40 językach, społeczności są dzielone algorytmem Leiden, nic nie opuszcza maszyny s5. Post autora na r/ClaudeAI podawał 73k gwiazdek i 2.2M pobrań w 2.5 miesiąca s10. Nasz własny graphify benchmark na projekcie z 1,701,550 słów (około 2,268,733 tokenów przy naiwnym czytaniu) zbudował 34,031 węzłów i 56,865 krawędzi, średni koszt zapytania około 24,702 tokenów, 91.8x mniej tokenów na zapytanie; w przeliczeniu na pytanie rozrzut sięgał od 679.1x dla "what is the main entry point" do 34.0x dla "what connects the data layer to the api" s5. Te 91.8x to porównanie z naiwnym pełnym czytaniem, którego nikt nie robi celowo; do tego graf się starzeje, gdy kod się zmienia, a opcjonalny przebieg semantyczny to jedyny krok, który kosztuje wywołania modelu.

rtk. Utworzony 2026-01-22, 78,326 gwiazdek i 4,942 forków 2026-09-02, wydanie v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Post startowy twierdził "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" oraz "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Na naszej maszynie rtk 0.42.3 raportował 25599 poleceń i 11.6M zaoszczędzonych tokenów (41.6%), a find, read i grep były na szczycie tabeli By Command s4. JetBrains zainstalował rtk v0.43.0 dokładnie tak, jak dostarcza go rtk init -g, na Claude Code 2.1.201 i claude-sonnet-5, i uruchomił 86 zadań dwukrotnie. Tylko 1 na 3 polecenia powłoki rtk potrafi przepisać (349 do przepisania, 525 bez reguły, 182 pominięte, z 1,056 poleceń). Nawet po zbiciu całego kompresowalnego wyjścia o 70% oszczędność kończy się na około 3% rachunku; zmierzony wynik to +7.6% droższe zadanie, bez różnicy przy wysokim effort s1. README przyznaje to teraz wprost: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", a podawane liczby są szacowane jako bytes / 4 s4.

Superpowers. Utworzony 2025-10-09, 280,792 gwiazdek i 25,164 forków 2026-09-02, wydanie v6.3.0 z czternastoma skillami, MIT, jedno polecenie instalacji: /plugin install superpowers@claude-plugins-official s6. Skill brainstorming zaczyna się od twardej bramki: żadnego kodu, żadnego scaffoldingu, żadnego skilla implementacyjnego, dopóki jawny zamiar nie zostanie zatwierdzony; trzy ścieżki (spike, ograniczona, architektoniczna) i reguła "When in doubt between two paths, take the heavier one" s12. writing-plans zakłada, że inżynier ma zerowy kontekst, i tnie pracę na kroki, w których "Each step is one action (2-5 minutes)" s13. subagent-driven-development daje każdemu zadaniu świeżego subagenta, który dostaje tylko kontekst swojego zadania, nigdy historię sesji, z review po każdym zadaniu i szerokim review brancha na końcu. Sekcja o modelach mówi "Use the least powerful model that can handle each role to conserve cost", ostrzega, że pominięty model dziedziczy model sesji, i stwierdza "Turn count beats token price". Maksymalnie pięć rund na zadanie: rundy od 1 do 3 wznawiają implementatora, runda 4 wprowadza nowego implementatora na mocniejszym modelu, w rundzie 5 rozstrzyga sam orkiestrator s14. Nigdzie nie ma kompresji: oszczędność bierze się z czytania mniejszej historii i płacenia mniejszemu modelowi za mechaniczne kroki. Pełne omówienie jest w naszym wcześniejszym filmie s11.

caveman. Utworzony 2026-04-04, 102,548 gwiazdek i 5,967 forków 2026-09-02, wydanie bin-v1.1.5, Go; skill jest na MIT, runtime proxy na BSL-1.1 s7. Jego własna tabela, dziesięć promptów przez Claude API, pokazuje średnio 1214 tokenów wyjściowych bez i 294 z caveman, czyli 65%, w najlepszym przypadku 87%, w najgorszym 22% s7. Blok IMPORTANT w README jest uczciwy: skill skraca tylko wyjście, tokeny wejściowe i rozumowania się nie zmieniają, a reguły kosztują około 1 do 1.5k tokenów wejściowych w każdej turze, więc oszczędność w całej sesji wypada niżej niż na wykresie s7. JetBrains uruchomił 82 sparowane zadania na Claude Code 2.1.200 z claude-sonnet-5 przy effort low, około 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", z 592k do 542k tokenów wyjściowych, bez wykrywalnego spadku jakości (test znaków p = 0.82), rekomendacja "use it if you like it" s2. Wbudowany styl Concise w Claude Code robi to samo: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", wymaga v2.1.237 lub nowszej, wybiera się go przez /config i zapisuje jako outputStyle w .claude/settings.local.json. Style dotyczą tylko głównej rozmowy; subagent działa na własnym prompcie systemowym s8.

Tabela werdyktów

Narzędzie Część rachunku Reklamowane Zmierzone Rusza
Superpowers historia + model na zadanie brak liczby świeży kontekst na zadanie, najsłabszy model na rolę rachunek
graphify to, co jest czytane 0 kredytów LLM na budowę 91.8x mniej tokenów na zapytanie niż przy naiwnym czytaniu (nasze) rachunek, na czytaniu
rtk kompresowalne wyjście powłoki 60-90% na poleceniach 19.7% kompresowalne, sufit około 3%, +7.6% na zadanie (JetBrains) marginesy
caveman / Concise to, co pisze agent 65% 8.5% tokenów wyjściowych (JetBrains) marginesy

Do zrobienia w poniedziałek

  • Otwórz swoją ostatnią długą sesję i policz, gdzie poszło wejście: ile Read i Grep, ile wyjścia powłoki, ile powtórnie wczytanej historii. Przypisz każde narzędzie do jego kawałka, zanim cokolwiek zainstalujesz.
  • Zainstaluj Superpowers przez /plugin install superpowers@claude-plugins-official i przepuść jedną prawdziwą funkcję przez brainstorming, writing-plans i subagent-driven-development. Obserwuj, jak wskaźnik kontekstu orkiestratora zostaje płaski.
  • Ustaw jawny model w każdym subagencie, którego uruchamiasz. Pominięty model dziedziczy model sesji i płacisz stawką orkiestratora za mechaniczną robotę.
  • Uruchom /graphify . na największym repo, potem graphify benchmark, i porównaj koszt na zapytanie z rozmiarem naiwnego korpusu, który wypisuje. Przebuduj graf, gdy kod się zmieni.
  • Jeśli już używasz rtk, czytaj rtk gain jako bajty wyjścia powłoki, nie pieniądze. Zestaw to z podziałem JetBrains: cokolwiek oszczędzają find, read i grep, narzędzia Read i Grep nigdy nie przechodziły przez hook.
  • Przełącz się na styl wyjścia Concise przez /config, zanim dodasz caveman; jest w Claude Code i nie kosztuje reguł skilla w każdej turze.
  • Prowadź jeden własny pomiar: koszt zadania przed i po każdej zmianie, ten sam zestaw zadań, a nie liczba bajtów pojedynczego polecenia.

Czytaj dalej

  • Pełna metodologia JetBrains dla rtk, z odtworzeniem 83 sesji i podziałem 1,056 poleceń, to punkt odniesienia do mierzenia każdego proxy powłoki s1.
  • Benchmark caveman wyjaśnia, jak 82 sparowane zadania i test znaków zamieniają wykres 65% w 8.5% tokenów wyjściowych s2.
  • Strona savings-explained w rtk to najczytelniejsze drzewo tego, co sesja naprawdę czyta; przeczytaj ją, zanim zaufasz jakiemukolwiek licznikowi "tokens saved" s3.
  • Sekcja benchmarków w README graphify opisuje budowę bez kredytów i przebieg semantyczny, jedyny krok kosztujący wywołania modelu s5.
  • Sekcja o wyborze modelu w Superpowers, z "Turn count beats token price" i limitem pięciu rund, to część warta skopiowania do własnych definicji agentów s14.
  • Twarda bramka brainstormingu i trzy ścieżki pokazują, jak ceremonia skaluje się z zadaniem i gdzie odpala także przy poprawkach zbyt małych, by na nią zasługiwać s12.
  • Style wyjścia w dokumentacji Claude Code: styl Concise, próg v2.1.237 i dlaczego subagenci go ignorują s8.

Źródła

FAQ

Dlaczego rtk pokazuje 11.6M zaoszczędzonych tokenów, skoro ledwo rusza rachunek?

Licznik mierzy bajty wyjścia powłoki podzielone przez 4, dla poleceń, które przeszły przez hook. Wywołania Read i Grep, prompt systemowy i powtórnie wczytana historia nigdy tamtędy nie przechodzą, a JetBrains ustalił, że tylko 19.7% tego, co model czyta, da się w ten sposób skompresować.

Czy Superpowers cokolwiek kompresuje?

Nie. Czyta mniej, bo daje każdemu zadaniu świeżego subagenta z samym kontekstem tego zadania, i płaci mniej, bo przypisuje najsłabszy model, który poradzi sobie z rolą. Koszt to bramka przy każdym zadaniu.

Czy warto zainstalować caveman?

JetBrains nie znalazł spadku jakości i zmierzył 8.5% mniej tokenów wyjściowych, więc używaj go, jeśli lubisz ten styl. Styl wyjścia Concise w Claude Code od v2.1.237 daje ten sam efekt bez 1 do 1.5k tokenów wejściowych, które reguły skilla kosztują w każdej turze.

Kiedy graphify przestaje się opłacać?

Gdy graf jest nieaktualny albo pytanie wymaga przebiegu semantycznego, który kosztuje wywołania modelu. Liczba 91.8x porównuje zapytanie z czytaniem całego korpusu, więc mniejsze repo widzą mniejszą różnicę.