TL;DR
- Empat tool bekerja di empat bagian berbeda dari tagihan Claude Code: graphify pada apa yang dibaca, rtk pada output shell, Superpowers pada riwayat dan pilihan model, caveman pada apa yang ditulis agen. Urutkan berdasarkan besar bagian yang disentuh, bukan persentase di README mereka.
- Hanya Superpowers yang menggeser tagihan: subagent baru per task dan model paling lemah yang masih cukup mengubah apa yang dibaca dan siapa yang membacanya. Biayanya adalah gerbang di setiap task, bahkan yang kecil.
- graphify di urutan kedua: graf lokal berbasis tree-sitter dengan nol kredit LLM, 91.8x lebih sedikit token per query dibanding pembacaan naif korpus kami sendiri.
- rtk hanya memampatkan bagian yang bisa dilihat hook Bash. JetBrains mengukur 19.7% dari yang dibaca model bisa dimampatkan, batas atas sekitar 3% dari tagihan, dan +7.6% per task pada tes end-to-end.
- caveman mengklaim 65% dan terukur 8.5% dari token output pada pekerjaan agentik. Claude Code sudah menyertakan ide yang sama sebagai gaya output Concise.
- Dua angka utama yang sering dikutip, 11.6M token terhemat dan +7.6% per task, mengukur hal berbeda: byte output bash versus biaya task yang selesai.
Apa kata pengukuran
Peta dulu. Dokumen savings milik rtk menggambar pohon dari apa yang dibaca sebuah sesi dan menandai output bash sebagai satu-satunya bagian yang disaring proxy, lalu menyatakannya terus terang: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains memutar ulang 83 sesi baseline, 1.9 juta karakter output tool, dan membaginya jadi tiga: output shell yang bisa dimampatkan rtk 373,339 (19.7%), output shell yang tidak punya aturan 879,326 (46.3%), pembacaan file dan tool pencarian yang melewati rtk 646,613 (34.0%) s1. Read dan Grep tidak pernah melewati hook Bash. README caveman sampai ke kesimpulan yang sama dari sisi lain: membaca biasanya separuh yang lebih besar dari tagihan s7.
graphify. Repo dibuat 2026-04-03 dan pada 2026-09-02 memiliki 113,946 stars dan 11,078 forks, rilis terbaru v0.9.53, Python, Apache-2.0 s5. Baris benchmark di README berbunyi "Graph build | LLM credits | 0": kode di-parse secara lokal dengan tree-sitter untuk ~40 bahasa, komunitas dibagi dengan Leiden, tidak ada yang keluar dari mesin s5. Postingan penulisnya di r/ClaudeAI melaporkan 73k stars dan 2.2M unduhan dalam 2.5 bulan s10. graphify benchmark kami sendiri pada proyek 1,701,550 kata (sekitar 2,268,733 token jika dibaca naif) membangun 34,031 node dan 56,865 edge, biaya query rata-rata sekitar 24,702 token, 91.8x lebih sedikit token per query; per pertanyaan selisihnya berkisar dari 679.1x untuk "what is the main entry point" sampai 34.0x untuk "what connects the data layer to the api" s5. Angka 91.8x dibandingkan dengan pembacaan penuh yang naif, yang tidak dilakukan siapa pun dengan sengaja; graf juga menjadi usang saat kode berubah dan semantic pass opsional adalah satu-satunya langkah yang memakan panggilan model.
rtk. Dibuat 2026-01-22, 78,326 stars dan 4,942 forks pada 2026-09-02, rilis v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Postingan peluncurannya mengklaim "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" dan "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Di mesin kami, rtk 0.42.3 melaporkan 25599 perintah dan 11.6M token terhemat (41.6%), dengan find, read dan grep di puncak tabel By Command s4. JetBrains memasang rtk v0.43.0 persis seperti yang dikirim rtk init -g, pada Claude Code 2.1.201 dan claude-sonnet-5, dan menjalankan 86 task dua kali. Hanya 1 dari 3 perintah shell yang bisa ditulis ulang rtk (349 bisa ditulis ulang, 525 tanpa aturan, 182 dilewati, dari 1,056 perintah). Kalau semua output yang bisa dimampatkan ditekan 70%, total penghematan mentok di sekitar 3% dari tagihan; hasil terukurnya +7.6% lebih mahal per task, tanpa perbedaan pada effort tinggi s1. README sekarang mengakui hal itu: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", dan angka yang dilaporkannya diperkirakan sebagai bytes / 4 s4.
Superpowers. Dibuat 2025-10-09, 280,792 stars dan 25,164 forks pada 2026-09-02, rilis v6.3.0 dengan empat belas skill, MIT, satu perintah instalasi: /plugin install superpowers@claude-plugins-official s6. Skill brainstorming dibuka dengan gerbang keras: tanpa kode, tanpa scaffolding, tanpa skill implementasi sampai intent yang eksplisit disetujui; tiga jalur (spike, bounded, architectural) dan aturan "When in doubt between two paths, take the heavier one" s12. writing-plans mengasumsikan engineer tidak punya konteks sama sekali dan memotong pekerjaan menjadi langkah di mana "Each step is one action (2-5 minutes)" s13. subagent-driven-development memberi setiap task subagent baru yang hanya menerima konteks task itu, tidak pernah riwayat sesi, dengan review setelah setiap task dan review luas atas branch di akhir. Bagian modelnya berbunyi "Use the least powerful model that can handle each role to conserve cost", memperingatkan bahwa model yang dihilangkan akan mewarisi model sesi, dan menyatakan "Turn count beats token price". Maksimal lima ronde per task: ronde 1 sampai 3 melanjutkan implementer, ronde 4 membawa implementer baru dengan model yang lebih mampu, ronde 5 orchestrator memutuskan sendiri s14. Tidak ada kompresi sama sekali: penghematan datang dari membaca lebih sedikit riwayat dan membayar model lebih kecil untuk langkah mekanis. Penjelasan lengkapnya ada di video kami sebelumnya s11.
caveman. Dibuat 2026-04-04, 102,548 stars dan 5,967 forks pada 2026-09-02, rilis bin-v1.1.5, Go; skill-nya MIT, runtime proxy-nya BSL-1.1 s7. Tabelnya sendiri, sepuluh prompt lewat Claude API, menunjukkan rata-rata 1214 token output tanpa dan 294 dengan caveman, 65%, kasus terbaik 87% dan terburuk 22% s7. Blok IMPORTANT di README jujur: skill hanya memperpendek output, token input dan reasoning tidak berubah, dan aturannya memakan sekitar 1 sampai 1.5k token input di setiap giliran, jadi penghematan sesi penuh lebih rendah dari grafiknya s7. JetBrains menjalankan 82 task berpasangan pada Claude Code 2.1.200 dengan claude-sonnet-5 pada effort low, sekitar USD 106: "Advertised saving: 65%. Measured saving: 8.5%", 592k menjadi 542k token output, tidak ada penurunan kualitas yang terdeteksi (sign test p = 0.82), rekomendasi "use it if you like it" s2. Gaya Concise bawaan Claude Code melakukan hal yang sama: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", membutuhkan v2.1.237 atau lebih baru, dipilih lewat /config dan disimpan sebagai outputStyle di .claude/settings.local.json. Gaya hanya berlaku untuk percakapan utama; subagent menjalankan system prompt-nya sendiri s8.
Tabel verdict
| Tool | Bagian tagihan | Diklaim | Terukur | Menggeser |
|---|---|---|---|---|
| Superpowers | riwayat + model per task | tanpa angka | konteks baru per task, model paling lemah per peran | tagihan |
| graphify | apa yang dibaca | 0 kredit LLM untuk membangun | 91.8x lebih sedikit token per query vs pembacaan naif (milik kami) | tagihan, pada pembacaan |
| rtk | output shell yang bisa dimampatkan | 60-90% pada perintah | 19.7% bisa dimampatkan, batas atas sekitar 3%, +7.6% per task (JetBrains) | marginnya |
| caveman / Concise | apa yang ditulis agen | 65% | 8.5% dari token output (JetBrains) | marginnya |
Lakukan ini hari Senin
- Buka sesi panjang terakhir Anda dan hitung ke mana input pergi: berapa banyak Read dan Grep, berapa banyak output shell, berapa banyak riwayat yang diputar ulang. Tempatkan setiap tool pada bagiannya sebelum memasang apa pun.
- Pasang Superpowers dengan
/plugin install superpowers@claude-plugins-officialdan jalankan satu fitur nyata lewat brainstorming, writing-plans dan subagent-driven-development. Perhatikan context gauge orchestrator tetap datar. - Tetapkan model secara eksplisit pada setiap subagent yang Anda kirim. Model yang dihilangkan mewarisi model sesi dan Anda membayar tarif orchestrator untuk pekerjaan mekanis.
- Jalankan
/graphify .pada repo terbesar Anda, lalugraphify benchmark, dan bandingkan biaya per query dengan ukuran korpus naif yang dicetaknya. Bangun ulang graf saat kode berubah. - Jika Anda sudah memakai rtk, baca
rtk gainsebagai byte output shell, bukan uang. Padukan dengan pembagian JetBrains: berapa pun yang dihematfind,readdangrep, tool Read dan Grep tidak pernah melewati hook. - Pindah ke gaya output Concise lewat
/configsebelum menambahkan caveman; gaya itu sudah ada di Claude Code dan tidak membebani aturan skill di setiap giliran. - Simpan satu pengukuran milik Anda sendiri: biaya task sebelum dan sesudah setiap perubahan, set task yang sama, bukan hitungan byte dari satu perintah.
Bacaan lanjutan
- Metodologi lengkap JetBrains untuk rtk, dengan replay 83 sesi dan pembagian 1,056 perintah, adalah acuan untuk mengukur proxy shell apa pun s1.
- Benchmark caveman menjelaskan bagaimana 82 task berpasangan dan sign test mengubah grafik 65% menjadi 8.5% dari token output s2.
- Halaman savings-explained rtk adalah pohon paling jelas tentang apa yang sebenarnya dibaca sebuah sesi; baca sebelum memercayai penghitung "tokens saved" mana pun s3.
- Bagian benchmarks di README graphify mendokumentasikan build tanpa kredit dan semantic pass, satu-satunya langkah yang memakan panggilan model s5.
- Bagian model selection Superpowers, dengan "Turn count beats token price" dan batas lima ronde, adalah bagian yang layak disalin ke definisi agen Anda sendiri s14.
- Gerbang keras brainstorming dan tiga jalurnya menunjukkan bagaimana seremoni menyesuaikan diri dengan task, dan di mana ia ikut menyala pada perbaikan yang terlalu kecil untuk layak s12.
- Output styles di dokumentasi Claude Code: gaya Concise, batas minimal v2.1.237, dan alasan subagent mengabaikannya s8.
Sumber
- Does rtk really save tokens in Claude Code?, JetBrains. Mengapa dibaca: satu-satunya tes end-to-end untuk rtk, dengan pembagian 19.7% / 46.3% / 34.0% dari apa yang dibaca agen.
- Speak to AI agents like cavemen to save tokens, JetBrains. Mengapa dibaca: 82 task berpasangan yang menurunkan klaim 65% menjadi 8.5% tanpa menemukan penurunan kualitas.
- How RTK savings work, GitHub. Mengapa dibaca: pohon tagihan versi maintainer sendiri dan kalimat tentang 90% byte lebih sedikit.
- rtk-ai/rtk on GitHub, GitHub. Mengapa dibaca: README kini menyatakan apa yang diukur rtk dan bagaimana angkanya diperkirakan.
- Graphify-Labs/graphify on GitHub, GitHub. Mengapa dibaca: tabel benchmarks, build tanpa kredit, dan perintah
graphify benchmarkyang dipakai di sini. - obra/superpowers on GitHub, GitHub. Mengapa dibaca: plugin yang mengubah apa yang dibaca dan model mana yang membacanya.
- JuliusBrussee/caveman on GitHub, GitHub. Mengapa dibaca: tabel penghematan dan blok IMPORTANT yang melemahkannya.
- Output styles, Claude Code docs. Mengapa dibaca: gaya Concise bawaan dan batasannya pada subagent.
- rtk launch post on r/ClaudeAI, Reddit. Mengapa dibaca: klaim awal 10.2M, berguna untuk dibandingkan dengan yang diukur JetBrains.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Mengapa dibaca: penulis tentang adopsi dan kegunaan graf.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Mengapa dibaca: penjelasan lengkap kami tentang plugin ini, skill demi skill.
- Superpowers brainstorming skill (SKILL.md), GitHub. Mengapa dibaca: gerbang keras dan tiga jalur, kata demi kata.
- Superpowers writing-plans skill (SKILL.md), GitHub. Mengapa dibaca: granularitas langkah 2 sampai 5 menit yang menjaga konteks subagent tetap kecil.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Mengapa dibaca: pemilihan model per peran dan batas lima ronde.
FAQ
Mengapa rtk menampilkan 11.6M token terhemat kalau nyaris tidak menggeser tagihan?
Penghitung itu mengukur byte output shell dibagi 4, pada perintah yang melewati hook. Panggilan tool Read dan Grep, system prompt dan riwayat yang diputar ulang tidak pernah melewatinya, dan JetBrains menemukan hanya 19.7% dari yang dibaca model yang bisa dimampatkan dengan cara itu.
Apakah Superpowers memampatkan sesuatu?
Tidak. Ia membaca lebih sedikit dengan memberi setiap task subagent baru yang hanya memegang konteks task itu, dan membayar lebih murah dengan menugaskan model paling lemah yang sanggup menangani perannya. Biayanya adalah gerbang di setiap task.
Apakah caveman layak dipasang?
JetBrains tidak menemukan penurunan kualitas dan token output turun 8.5%, jadi pakai saja kalau Anda suka gayanya. Gaya output Concise di Claude Code v2.1.237 atau lebih baru memberi efek yang sama tanpa 1 sampai 1.5k token input yang dimakan aturan skill di setiap giliran.
Kapan graphify berhenti menguntungkan?
Saat graf sudah usang atau pertanyaan butuh semantic pass, yang memang memakan panggilan model. Angka 91.8x membandingkan satu query dengan membaca seluruh korpus, jadi repo yang lebih kecil melihat selisih yang lebih kecil.
AIDive