TL;DR
- 四個工具各自作用在 Claude Code 帳單的不同部分:graphify 管讀進去的內容,rtk 管 shell 輸出,Superpowers 管歷史紀錄與模型選擇,caveman 管 agent 寫出來的內容。請依它們所碰到的那一塊有多大來排名,而不是看 README 上的百分比。
- 真正能改變帳單的只有 Superpowers:每個任務用全新的 subagent,並選用夠用的最弱模型,這會改變讀了什麼、由誰來讀。代價是每個任務都要過一道關卡,連很小的任務也不例外。
- graphify 排第二:它在本機用 tree-sitter 建圖,LLM 額度為 0,在我們自己的語料上,每次查詢的 token 比單純整份讀取少 91.8x。
- rtk 只壓縮 Bash hook 看得到的那一塊。JetBrains 測得模型讀到的內容中只有 19.7% 可壓縮,帳單上限約 3%,端到端測試中每個任務反而多了 +7.6%。
- caveman 宣稱 65%,在 agent 任務上實測只減少 8.5% 的輸出 token。Claude Code 內建同樣概念的 Concise 輸出風格。
- 大家常引用的兩個數字,節省 11.6M token 與每任務 +7.6%,量的是不同的東西:一個是 bash 輸出的位元組數,一個是完成一項任務的成本。
測量結果告訴我們什麼
先看全貌。rtk 自己的 savings 文件畫出一個 session 讀取內容的樹狀圖,標明 bash 輸出是代理唯一會過濾的部分,然後直白地說:「A command showing 90% fewer output bytes does not make your session 90% cheaper」s3。JetBrains 重播了 83 個基準 session、190 萬字元的工具輸出,並分成三塊:rtk 能壓縮的 shell 輸出 373,339 (19.7%),rtk 沒有規則的 shell 輸出 879,326 (46.3%),不經過 rtk 的檔案讀取與搜尋工具 646,613 (34.0%) s1。Read 和 Grep 從不經過 Bash hook。caveman 的 README 從另一端得到相同結論:帳單中較大的那一半通常是讀取 s7。
graphify。 這個 repo 建立於 2026-04-03,2026-09-02 時有 113,946 顆星、11,078 個 fork,最新版本 v0.9.53,Python,Apache-2.0 s5。README 的基準列寫著「Graph build | LLM credits | 0」:程式碼在本機用 tree-sitter 解析,涵蓋約 40 種語言,社群用 Leiden 切分,沒有任何東西離開你的機器 s5。作者在 r/ClaudeAI 的貼文表示 2.5 個月內達到 73k 顆星與 2.2M 次下載 s10。我們用 graphify benchmark 跑一個 1,701,550 字的專案(單純整份讀取約 2,268,733 token),建出 34,031 個節點與 56,865 條邊,平均每次查詢約 24,702 token,也就是每次查詢的 token 少 91.8x;依問題而異,從「what is the main entry point」的 679.1x 到「what connects the data layer to the api」的 34.0x s5。91.8x 是對照單純整份讀取得出的,而沒人會刻意這樣做;此外程式碼一變,圖就會過時,可選的語意分析階段則是唯一要花模型呼叫費用的步驟。
rtk。 建立於 2026-01-22,2026-09-02 時有 78,326 顆星、4,942 個 fork,版本 v0.47.0,Rust,Apache-2.0,「100+ supported commands, <10ms overhead」s4。發布文宣稱「cargo test: 155 lines → 3 lines (-98%)」、「git status: 119 chars → 28 chars (-76%)」以及「Total over 2 weeks: 10.2M tokens saved (89.2%)」s9。在我們的機器上,rtk 0.42.3 回報 25599 個指令、節省 11.6M token (41.6%),By Command 表格最上面是 find、read 和 grep s4。JetBrains 照 rtk init -g 安裝的原樣使用 rtk v0.43.0,搭配 Claude Code 2.1.201 與 claude-sonnet-5,把 86 個任務各跑兩次。只有三分之一的 shell 指令是 rtk 能改寫的(1,056 個指令中,可改寫 349、無規則 525、略過 182)。就算把所有可壓縮的輸出壓掉 70%,總節省也頂多約為帳單的 3%;實測結果是每個任務貴了 +7.6%,在高 effort 下沒有差異 s1。README 現在也承認這一點:「RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%」,而且回報的數量是以 bytes / 4 估算的 s4。
Superpowers。 建立於 2025-10-09,2026-09-02 時有 280,792 顆星、25,164 個 fork,版本 v6.3.0,共十四個 skill,MIT,只要一行安裝指令:/plugin install superpowers@claude-plugins-official s6。brainstorming skill 一開始就是一道硬性關卡:在明確的意圖獲得核准之前,不寫程式碼、不建骨架、不用實作 skill;有三條路徑(spike、bounded、architectural),規則是「When in doubt between two paths, take the heavier one」s12。writing-plans 假設工程師完全沒有背景知識,並把工作切成「Each step is one action (2-5 minutes)」的步驟 s13。subagent-driven-development 讓每個任務拿到全新的 subagent,它只收到該任務的上下文,絕不會看到 session 歷史,每個任務後都有一次審查,最後還有對整個分支的全面審查。它的模型章節寫著「Use the least powerful model that can handle each role to conserve cost」,並警告若省略 model 就會繼承 session 的模型,還明言「Turn count beats token price」。每個任務最多五輪:第 1 到 3 輪繼續使用同一個實作者,第 4 輪換上更強模型的新實作者,第 5 輪由 orchestrator 自己裁決 s14。全程沒有任何壓縮:省下來的錢來自少讀歷史,以及機械性步驟改用較小的模型。完整的逐項介紹在我們先前的影片裡 s11。
caveman。 建立於 2026-04-04,2026-09-02 時有 102,548 顆星、5,967 個 fork,版本 bin-v1.1.5,Go;skill 採 MIT,proxy runtime 採 BSL-1.1 s7。它自己的表格用 Claude API 跑十個 prompt,平均輸出 token 未使用時為 1214、使用後為 294,減少 65%,最好 87%,最差 22% s7。README 的 IMPORTANT 區塊很誠實:這個 skill 只縮短輸出,輸入與推理 token 不變,而且規則每一輪大約要花 1 到 1.5k 輸入 token,所以整個 session 的節省會低於圖表上的數字 s7。JetBrains 在 Claude Code 2.1.200、claude-sonnet-5、effort low 下跑了 82 組配對任務,花費約 USD 106:「Advertised saving: 65%. Measured saving: 8.5%」,輸出 token 從 592k 降到 542k,沒有偵測到品質下降(sign test p = 0.82),建議是「use it if you like it」s2。Claude Code 內建的 Concise 風格做的是同一件事:「Claude leads with the result, skips preamble and narration, and keeps responses short by default」,需要 v2.1.237 或更新版本,透過 /config 選擇,並以 outputStyle 存在 .claude/settings.local.json。風格只套用在主對話;subagent 跑的是它自己的 system prompt s8。
判定表
| 工具 | 帳單中的哪一塊 | 宣稱 | 實測 | 影響 |
|---|---|---|---|---|
| Superpowers | 歷史紀錄 + 每個任務的模型 | 沒有數字 | 每個任務全新上下文,每個角色用最弱的可用模型 | 帳單本身 |
| graphify | 讀進去的內容 | 建圖 0 LLM 額度 | 相較單純讀取,每次查詢 token 少 91.8x(我們的測試) | 帳單中讀取的部分 |
| rtk | 可壓縮的 shell 輸出 | 指令上 60-90% | 19.7% 可壓縮,上限約 3%,每任務 +7.6% (JetBrains) | 邊際 |
| caveman / Concise | agent 寫出來的內容 | 65% | 輸出 token 8.5% (JetBrains) | 邊際 |
週一要做的事
- 打開你最近一次的長 session,數一數輸入花在哪裡:Read 和 Grep 占多少、shell 輸出占多少、重播的歷史占多少。在安裝任何東西之前,先把每個工具放到對應的那一塊。
- 用
/plugin install superpowers@claude-plugins-official安裝 Superpowers,並讓一個真實功能走完 brainstorming、writing-plans 和 subagent-driven-development。觀察 orchestrator 的上下文用量表是否維持平穩。 - 為你派出的每個 subagent 明確指定模型。省略 model 會繼承 session 的模型,機械性的工作就得付 orchestrator 等級的價錢。
- 在你最大的 repo 上執行
/graphify .,再跑graphify benchmark,把每次查詢的成本和它印出的單純語料大小做比較。程式碼變動後記得重建圖。 - 如果你已經在用 rtk,把
rtk gain當成 shell 輸出的位元組數來讀,而不是金額。搭配 JetBrains 的拆分一起看:不論find、read和grep省了多少,Read 和 Grep 工具從來沒有經過 hook。 - 在加 caveman 之前,先透過
/config切到 Concise 輸出風格;它隨 Claude Code 內建,而且不會每一輪多花 skill 規則的成本。 - 自己保留一份測量:同一組任務,每次變更前後的每任務成本,而不是單一指令的位元組數。
延伸閱讀
- JetBrains 完整的 rtk 方法論,含 83 個 session 重播與 1,056 個指令的拆分,是衡量任何 shell proxy 的參考 s1。
- caveman 的基準測試說明了 82 組配對任務加上 sign test 如何把 65% 的圖表變成輸出 token 的 8.5% s2。
- rtk 的 savings-explained 頁面是目前最清楚的「一個 session 實際讀了什麼」的樹狀圖;在相信任何「tokens saved」計數器之前先讀它 s3。
- graphify README 的基準章節記載了 0 額度的建圖,以及語意分析階段,那是唯一要花模型呼叫費用的步驟 s5。
- Superpowers 的模型選擇章節,包含「Turn count beats token price」與五輪上限,是最值得抄進你自己 agent 定義的部分 s14。
- brainstorming 的硬性關卡與三條路徑,展示了流程如何隨任務大小調整,以及它在小到不值得的修正上也會觸發的情況 s12。
- Claude Code 文件中的輸出風格:Concise 風格、v2.1.237 的版本門檻,以及 subagent 為何會忽略它 s8。
來源
- Does rtk really save tokens in Claude Code?, JetBrains. 為什麼值得讀:唯一針對 rtk 的端到端測試,附有 agent 所讀內容 19.7% / 46.3% / 34.0% 的拆分。
- Speak to AI agents like cavemen to save tokens, JetBrains. 為什麼值得讀:82 組配對任務把 65% 的宣稱降到 8.5%,且沒有發現品質損失。
- How RTK savings work, GitHub. 為什麼值得讀:維護者自己畫的帳單樹狀圖,以及關於輸出位元組少 90% 的那句話。
- rtk-ai/rtk on GitHub, GitHub. 為什麼值得讀:README 現在說明了 rtk 量的是什麼,以及數量如何估算。
- Graphify-Labs/graphify on GitHub, GitHub. 為什麼值得讀:基準表、0 額度的建圖,以及這裡使用的
graphify benchmark指令。 - obra/superpowers on GitHub, GitHub. 為什麼值得讀:這個外掛改變了讀什麼,以及由哪個模型來讀。
- JuliusBrussee/caveman on GitHub, GitHub. 為什麼值得讀:節省表格,以及削弱它的 IMPORTANT 區塊。
- Output styles, Claude Code docs. 為什麼值得讀:內建的 Concise 風格,以及它搭配 subagent 時的限制。
- rtk launch post on r/ClaudeAI, Reddit. 為什麼值得讀:最初的 10.2M 宣稱,適合拿來和 JetBrains 的實測對照。
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. 為什麼值得讀:作者談採用情形,以及圖的用途。
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. 為什麼值得讀:我們逐個 skill 完整介紹這個外掛的影片。
- Superpowers brainstorming skill (SKILL.md), GitHub. 為什麼值得讀:硬性關卡與三條路徑的原文。
- Superpowers writing-plans skill (SKILL.md), GitHub. 為什麼值得讀:2 到 5 分鐘的步驟粒度,讓 subagent 的上下文保持精簡。
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. 為什麼值得讀:依角色選擇模型,以及五輪上限。
FAQ
為什麼 rtk 顯示節省了 11.6M token,卻幾乎沒改變帳單?
這個計數器量的是經過 hook 的指令的 shell 輸出位元組數除以 4。Read 和 Grep 工具呼叫、system prompt 與重播的歷史都不會經過它,而 JetBrains 發現模型讀到的內容中只有 19.7% 能這樣壓縮。
Superpowers 有壓縮任何東西嗎?
沒有。它讓每個任務用只帶有該任務上下文的全新 subagent 來少讀,並為每個角色指派能勝任的最弱模型來少付錢。代價是每個任務都要過一道關卡。
值得安裝 caveman 嗎?
JetBrains 沒有發現品質損失,輸出 token 減少 8.5%,所以喜歡這種風格就用。Claude Code v2.1.237 或更新版本的 Concise 輸出風格能達到同樣的效果,而不用每一輪多花 skill 規則的 1 到 1.5k 輸入 token。
graphify 什麼時候就不划算了?
當圖已經過時,或問題需要語意分析階段時,那一步確實要花模型呼叫費用。91.8x 是拿一次查詢對比讀取整份語料,所以較小的 repo 差距也會比較小。
AIDive