AIDive

4 Penghemat Token Claude Code Diuji, Satu Malah Bikin Boros

Oleh AIDive · Terbit

Coding agent

JetBrains bilang tidak, mesin saya bilang 11,6 juta

Pada Juli 2026 JetBrains menghabiskan sekitar $320 kredit API — 425 percobaan berbayar — untuk menguji rtk, sebuah proxy shell yang dipasang puluhan ribu developer demi menghemat token di Claude Code. Hasilnya: sesi justru 7,6% lebih mahal per tugas. Dua minggu sebelumnya tim yang sama mengukur caveman, skill yang diiklankan memangkas 65% token, dan mendapat 8,5%. Di mesin saya sendiri, rtk gain melaporkan 11,6 juta token dihemat dari 25.599 perintah.

Kedua kumpulan angka itu nyata. Keduanya hanya tidak mengukur hal yang sama: satu adalah biaya per tugas selesai, satunya byte keluaran bash.

Angka Yang diukur Sumber
+7,6% per tugas (p=0,004) Biaya menyeluruh sebuah tugas dengan rtk terpasang JetBrains, 425 percobaan, ~$320
8,5% token keluaran Penghematan caveman yang terukur pada kerja agentik JetBrains, 82 tugas berpasangan
65% Penghematan yang diiklankan caveman README caveman
11,6 jt dihemat (41,6%) Byte keluaran bash yang dikompresi rtk rtk gain, 25.599 perintah

Inilah stack-nya, empat alat: graphify, rtk, Superpowers dan caveman, total 575.612 bintang GitHub per 2026-09-02. Masing-masing menyentuh irisan tagihan yang berbeda.

Alat Bintang (2026-09-02) Bahasa Lisensi
Superpowers 280.792 Skill Markdown MIT
graphify 113.946 Python Apache-2.0
caveman 102.548 Go MIT (skill)
rtk 78.326 Rust Apache-2.0

Ke mana token sebenarnya pergi

Tagihan Claude Code punya dua sisi. Token input adalah semua yang dibaca model: keluaran setiap perintah shell, prompt Anda, prompt sistem, dan seluruh riwayat percakapan yang dikirim ulang di setiap panggilan. Token output adalah semua yang ditulis model.

Dokumentasi rtk sendiri menggambar pohon itu persis, lalu menambahkan satu kalimat yang tak pernah ada di posting peluncurannya: "Perintah yang menampilkan 90% lebih sedikit byte keluaran tidak membuat sesi Anda 90% lebih murah."

JetBrains memberi angka pada sisi baca dengan memutar ulang 83 sesi baseline, 1,9 juta karakter keluaran tool.

Irisan dari yang dibaca model Karakter Porsi
Keluaran shell yang bisa dikompresi rtk 373.339 19,7%
Keluaran shell yang tak punya aturan di rtk 879.326 46,3%
Tool baca dan cari yang melewati rtk sama sekali 646.613 34,0%

Hanya seperlima dari yang dibaca model bisa dikompresi proxy shell — tool bawaan Read, Grep dan Glob di Claude Code tidak pernah melewati hook Bash.

Dari situ muncul peta empat alat ini: graphify mengecilkan apa yang dibaca agen, rtk mengecilkan apa yang dikembalikan shell, Superpowers mengecilkan riwayat yang dibawa tiap tugas sekaligus memilih model yang membawanya, dan caveman mengecilkan apa yang diucapkan agen. Sisi baca adalah separuh yang lebih besar dari tagihan, jadi peringkat dimulai dari sana.

graphify: telusuri node, bukan baris

graphify adalah skill yang mengubah sebuah basis kode — beserta dokumen, skema SQL, konfigurasi dan PDF-nya — menjadi knowledge graph yang bisa dikueri. Anda ketik /graphify . di Claude Code, Cursor, Codex atau Gemini CLI, dan proyek dipetakan sekali supaya agen mengueri graph alih-alih menggrep berkas.

Kode diurai dengan AST tree-sitter di sekitar 40 bahasa: deterministik, tanpa panggilan LLM, tidak ada yang meninggalkan mesin. Proses build memakan nol kredit LLM. Hasilnya tiga berkas: graph.html untuk ditelusuri dengan klik, GRAPH_REPORT.md, dan graph.json — graph itu sendiri, bisa dikueri tanpa membaca ulang berkas Anda. Tiap node adalah sebuah konsep (berkas, fungsi, kelas), dan tiap edge ditandai EXTRACTED bila eksplisit di sumber atau INFERRED bila graphify yang menyimpulkannya. Node dikelompokkan jadi subsistem dengan algoritma Leiden.

Benchmark bawaan, dijalankan pada salah satu proyek kami sendiri:

Metrik Nilai
Node 34.031
Edge 56.865
Komunitas terdeteksi 967
Asal edge 76% EXTRACTED · 24% INFERRED
Pembacaan naif seluruh korpus 1.701.550 kata ≈ 2.268.733 token
Kueri graph rata-rata ~24.702 token
Pengurangan 91,8× lebih sedikit token per kueri

Per pertanyaan rentangnya lebar: 679,1× pada "what is the main entry point", 34,0× pada "what connects the data layer to the api".

Dua batasan. Perbandingannya melawan membaca semuanya, dan sesi yang digerakkan grep tidak pernah semahal itu, jadi keuntungan nyatanya lebih kecil. Dan graph jadi usang — segarkan dengan graphify update <path>, --watch, atau hook git — sementara pass semantik atas dokumen, PDF dan gambar memang memanggil model dan memang memakan token.

Pemasangan: uv tool install graphifyy (nama paketnya pakai dua y), lalu graphify install.

rtk: proxy shell diadili

rtk adalah proxy CLI antara Claude Code dan shell Anda. Perintah biasa seperti ls, cat atau git status mengembalikan derau yang harus dibaca agen sebagai token input: izin berkas, bilah progres, seratus baris tes yang lulus. rtk menjalankan perintah yang sama dan mengembalikan versi ringkas: satu biner Rust, 100+ perintah didukung, overhead di bawah 10 ms. Sebuah hook PreToolUse menulis ulang setiap panggilan Bash yang memenuhi syarat (git statusrtk git status) sebelum dijalankan, jadi agen tak perlu mengingatnya.

Posting peluncuran penulisnya mengklaim 10,2 jt token dihemat dalam dua minggu, 89,2%, dengan contoh seperti cargo test dari 155 baris jadi 3. Dasbor kami sendiri setelah 25.599 perintah:

Perintah Panggilan Token dihemat Rasio
rtk find 354 2,2 jt 46,6%
rtk read 3.504 2,2 jt 10,4%
rtk grep 2.760 1,9 jt 47,7%
rtk ps aux 24 1,1 jt 98,0%
rtk diff 39 541,1 rb 92,2%
Total 25.599 11,6 jt 41,6%

Lalu persidangannya. JetBrains memasang rtk persis apa adanya dan menjalankan 86 tugas dua kali di claude-sonnet-5.

Temuan JetBrains Nilai
Perintah shell yang bisa ditulis ulang rtk 349 dari 1.056 (1 dari 3)
Plafon penghematan total ~3% tagihan
Biaya per tugas, reasoning effort rendah +7,6% (p=0,004)
Giliran per tugas +13,8% (p=0,03)
Biaya per tugas, effort tinggi ±0%
Kualitas tugas Tidak berubah

README rtk kini menyatakannya terus terang: sampai 90% keluaran bash, "bukan hal yang sama dengan memotong tagihan Anda 90%", dan hitungannya sendiri diperkirakan sebagai bytes / 4.

Vonis: gratis, kompresinya nyata dan, dalam kata-kata JetBrains, "sering kali elegan". Simpan untuk sesi yang berat bash; jangan berharap ia menggeser tagihan.

Superpowers: rancang dulu, lalu tugas terlalu kecil untuk gagal

Superpowers adalah plugin Claude Code buatan Jesse Vincent — 280.792 bintang, empat belas skill, satu perintah pemasangan (/plugin install superpowers@claude-plugins-official). Ia menghemat token tanpa mengompresi apa pun.

Semuanya dimulai dari skill brainstorming, yang dibuka dengan gerbang keras: tidak ada kode, tidak ada scaffolding, tidak ada skill implementasi sampai sebuah niat eksplisit disetujui. Saat skill dimuat, agen berubah jadi mitra brainstorming, dan dalam praktiknya sebagian proyek dipikirkan ulang sebelum apa pun dibangun. Ini tahap yang paling penting, karena token termahal adalah yang dipakai membangun hal yang salah.

Skill ini mengklasifikasikan pekerjaan sebagai spike, perubahan terbatas, atau perubahan arsitektural, dan aturannya tertulis di berkas: "Bila ragu di antara dua jalur, ambil yang lebih berat." Ia bahkan menamai mode gagalnya, lewat bagian anti-pola berjudul "Too Simple To Need Approval". Jalur arsitektural menghasilkan spec yang Anda validasi, lalu rencana implementasi.

Keandalan datang dari rencananya. Skill writing-plans memotong pekerjaan jadi langkah satu tindakan, 2 sampai 5 menit: tulis tes yang gagal, jalankan untuk memastikan gagal, tulis kode minimal yang membuatnya lulus, jalankan tes lagi, commit. Rencana ditulis dengan asumsi insinyurnya nol konteks. Tugas sekecil itu muat di jendela konteks segar dengan sisa lega, jadi agen tak pernah sampai ke ujung tugas dengan jendela jenuh — dan jendela jenuh itulah sumber kode halusinasi.

Batasnya adalah seremoni. Berkasnya bilang ia menyesuaikan ukuran tugas, tapi gerbangnya tetap menyala untuk perbaikan satu baris, dan itu juga token.

Superpowers: satu tugas, satu subagent, satu model yang pas

Lalu rencananya berjalan, dan matematika token berubah. Satu tugas, satu subagent. Tiap subagent mulai dengan konteks segar yang hanya berisi tugasnya, tak pernah riwayat sesi, sehingga jendela orkestrator tetap kecil dan jendela subagent tetap bersih. Setelah tiap tugas orkestrator meninjau hasilnya: OK, tugas berikutnya; tidak OK, perbaikan kembali ke subagent. Maksimal lima putaran per tugas — putaran 1 sampai 3 melanjutkan implementer semula, putaran 4 menyerahkan pekerjaan ke implementer baru dengan model yang lebih mampu, putaran 5 orkestrator memutuskan sendiri.

Aturan yang membayar semuanya adalah pemilihan model: "Gunakan model paling lemah yang sanggup menangani tiap peran demi menghemat biaya." Orkestrator menilai kesulitan tiap tugas dan memilih model yang sepadan.

Jenis tugas Tingkat model
Mekanis, terspesifikasi jelas; rencana sudah memuat kodenya Model termurah / kecil
Koordinasi lintas berkas, debugging Model standar
Arsitektur, tinjauan akhir branch Model paling mampu
Model tidak disebut Mewarisi model sesi

Satu nuansa dari berkas yang sama: "Jumlah giliran mengalahkan harga token." Model murah yang butuh tiga giliran bukanlah model murah. Dalam praktik, inilah yang membuat Opus dan Fable terpakai di paket Pro $20 — model mahal hanya menyentuh segelintir tugas, bukan seluruh sesi.

Kemenangan terakhir adalah dokumentasi. Tiap spec dan rencana adalah berkas markdown yang disimpan di docs/superpowers/specs/ dan docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md, di-commit saat pekerjaan selesai. Di pipeline kanal ini sendiri, migrasi ke mesin video kami sekarang adalah satu spec plus rencana empat belas tugas yang masih bisa dibuka, disebut di sesi baru, dan dikembangkan. Tidak ada yang dikerjakan agen tanpa jejak.

caveman dan gaya Concise: bicara lebih sedikit

Irisan terakhir adalah apa yang diucapkan agen. Agen bercerita — "tentu", "dengan senang hati membantu", "masalah yang Anda alami kemungkinan disebabkan oleh" — dan itu token keluaran untuk hal yang sia-sia.

caveman adalah skill dari Julius Brussee, 102.548 bintang, yang membuat agen bicara seperti manusia gua: buang kata sandang, pengisi, basa-basi dan keraguan, lalu ikuti pola [hal] [tindakan] [alasan]. [langkah berikut]. Kode, perintah, jalur berkas dan pesan galat persis tak pernah di-caveman-kan; hanya prosa di sekitarnya. Ada tiga tingkat (/caveman lite|full|ultra) dan hook SessionStart yang menyalakannya saat mulai.

Tabelnya sendiri, sepuluh prompt lewat API Claude, rata-rata 1.214 token keluaran tanpa skill dan 294 dengan skill — 65%, kasus terbaik 87% dan terburuk 22%.

README-nya sendiri menyodorkan pemeriksaan realitas: skill ini hanya memendekkan keluaran, token input dan reasoning tidak berubah, dan aturannya sendiri memakan sekitar 1–1,5 rb token input tiap giliran. JetBrains mengukurnya pada 82 tugas agentik berpasangan, sekitar $106 kredit.

caveman Diiklankan Terukur (JetBrains)
Penghematan token keluaran 65% 8,5% (592 rb → 542 rb)
Dampak kualitas Tidak ada penurunan terdeteksi (uji tanda p=0,82)

Jaraknya bersifat struktural: keluaran agen sebagian besar adalah kode dan panggilan tool, yang memang tepat dibiarkan caveman. Rekomendasi JetBrains: "pakai kalau Anda suka. Menyenangkan, dan tidak memakan apa pun yang terukur dari sisi kualitas."

Sejak Claude Code v2.1.237 ada padanan bawaan, gaya keluaran Concise: Claude "membuka dengan hasil, melewati pembukaan dan narasi, dan menjaga respons tetap pendek secara default". Pilih di /config → Output style; tersimpan di .claude/settings.local.json dan berlaku setelah /clear atau sesi baru. Satu batas yang sama-sama berlaku: gaya keluaran hanya berlaku untuk percakapan utama — subagent menjalankan prompt sistemnya sendiri.

Vonis: apa yang menggeser tagihan, apa yang cuma menggeser pinggiran

Peringkat berdasarkan apa yang benar-benar digeser tiap alat, beserta biaya yang dibawanya.

Peringkat Alat Yang digeser Efek terukur Biayanya
1 Superpowers Riwayat per tugas + model mana yang membacanya Model mahal hanya di segelintir tugas, bukan seluruh sesi Gerbang di tiap tugas, bahkan perbaikan satu baris
2 graphify Apa yang dibaca agen 91,8× lebih sedikit token per kueri dibanding pembacaan naif korpus (proyek kami) Graph jadi usang; pass semantik memakan token
3 rtk Byte keluaran bash Plafon ~3% tagihan; +7,6% per tugas pada effort rendah dalam uji JetBrains Hanya 1 dari 3 perintah shell punya aturan
4 caveman / Concise Prosa yang ditulis agen 8,5% token keluaran, tanpa kehilangan kualitas ~1–1,5 rb token input tiap giliran

Superpowers menang, dan bukan karena kompresi apa pun: konteks segar per tugas dan model termurah yang sanggup mengerjakannya mengubah apa yang dibaca dan siapa yang membacanya. graphify kedua karena membaca lebih sedikit adalah separuh tagihan yang lebih besar. rtk nyata, gratis dan tak berbahaya, tapi dua pertiga perintah shell dan semua pembacaan berkas melewatinya. caveman, atau gaya Concise yang kini dibawa Claude Code, memangkas irisan terkecil.

Keempatnya gratis dipasang — graphify dan rtk di bawah Apache-2.0, Superpowers di bawah MIT, skill caveman di bawah MIT. Lebih dari 570.000 bintang menandakan orang menginginkan keajaiban. Versi jujurnya adalah sebuah peringkat.

Sumber

Pertanyaan yang sering diajukan

Apa cara terbaik menghemat token di Claude Code?
Mengubah apa yang dibaca agen dan model mana yang membacanya, bukan mengompresi teks. Plugin Superpowers memberi tiap tugas konteks subagent segar yang hanya berisi tugas itu, dan menugaskan model paling lemah yang sanggup menanganinya. Itu menggeser jauh lebih banyak tagihan daripada kompresor keluaran mana pun.
Apakah rtk benar-benar menurunkan biaya Claude Code?
Nyaris tidak. Kompresi keluaran shell-nya nyata, tapi JetBrains menemukan hanya 1 dari 3 perintah shell punya aturan dan hanya seperlima dari yang dibaca model bisa dikompresi, sehingga penghematannya mentok di sekitar 3% tagihan. Dalam A/B 86 tugas mereka, rtk keluar 7,6% lebih mahal per tugas pada reasoning effort rendah dan setara pada effort tinggi, dengan kualitas tak berubah.
Kenapa rtk melaporkan jutaan token dihemat kalau tagihan tidak turun?
rtk menghitung byte keluaran bash yang dihilangkannya, diperkirakan sebagai bytes/4, bukan uang. Dasbor kami menunjukkan 11,6 jt token dihemat (41,6%) dari 25.599 perintah. Dokumentasinya sendiri menyatakannya langsung: perintah yang menampilkan 90% lebih sedikit byte tidak membuat sesi Anda 90% lebih murah.
Apa itu graphify dan apakah ia menghemat token?
graphify adalah skill /graphify yang mengurai basis kode secara lokal dengan tree-sitter menjadi knowledge graph yang bisa dikueri, tanpa panggilan LLM dan tanpa kredit untuk proses build-nya. Setelah itu agen menelusuri node logis alih-alih menggrep berkas. Pada proyek kami, benchmark bawaan mengukur 91,8× lebih sedikit token per kueri dibanding membaca seluruh korpus, meski pembanding itu adalah pembacaan naif, bukan sesi yang digerakkan grep.
Apakah skill caveman layak dipasang?
Hanya kalau Anda menikmatinya. Ia mengiklankan potongan 65%, tapi JetBrains mengukur 8,5% token keluaran pada 82 tugas berpasangan, tanpa penurunan kualitas yang terdeteksi, karena kode dan panggilan tool memang dibiarkan utuh. Aturannya sendiri juga menambah sekitar 1 sampai 1,5 rb token input tiap giliran.
Apa itu gaya keluaran Concise di Claude Code?
Gaya keluaran bawaan yang tersedia sejak Claude Code v2.1.237, yang membuat Claude membuka dengan hasil, melewati pembukaan dan narasi, serta menjaga respons tetap pendek. Dipilih di /config, tersimpan di .claude/settings.local.json, dan hanya berlaku untuk percakapan utama — subagent tetap memakai prompt sistemnya sendiri.
Bagaimana Superpowers membuat Opus atau Fable terpakai di paket $20?
Skill subagent-driven-development-nya menyuruh orkestrator memakai model paling lemah yang sanggup menangani tiap peran: tingkat termurah untuk tugas mekanis yang terspesifikasi jelas, model standar untuk kerja lintas berkas dan debugging, dan model paling mampu hanya untuk arsitektur dan tinjauan akhir. Dengan begitu model mahal hanya menyentuh segelintir tugas, bukan seluruh sesi.

Video terkait