TL;DR
- 4つのツールは、Claude Codeの請求のそれぞれ別の部分に作用します。graphifyは読み込まれる内容、rtkはシェル出力、Superpowersは履歴とモデル選択、cavemanはエージェントが書く内容です。READMEのパーセンテージではなく、作用する部分の大きさで順位をつけてください。
- 請求額そのものを動かすのはSuperpowersだけです。タスクごとに新しいサブエージェントを使い、足りる範囲で最も非力なモデルを選ぶことで、何を読むか、誰が読むかが変わります。代償は、ごく小さなタスクを含むすべてのタスクに入るゲートです。
- 2番手はgraphifyです。ローカルのtree-sitterグラフをLLMクレジット0で構築し、自社コーパスのナイーブな全読みと比べて1クエリあたりのトークンが91.8x少なくなりました。
- rtkが圧縮するのは、Bash hookから見える部分だけです。JetBrainsの測定では、モデルが読む内容のうち圧縮可能なのは19.7%で、請求額への上限は約3%、エンドツーエンドのテストではタスクあたり+7.6%でした。
- cavemanは65%を謳い、エージェント作業の出力トークンで8.5%が実測されました。Claude Codeには同じ発想がConcise出力スタイルとして標準搭載されています。
- よく引用される2つの数字、11.6Mトークン節約と+7.6%/タスクは、別のものを測っています。bashの出力バイト数と、完了したタスクのコストです。
測定結果が示すこと
まず全体像です。rtk自身のsavingsドキュメントは、セッションが読むものをツリーで描き、プロキシがフィルタできるのはbash出力だけだと示したうえで、はっきり書いています。"A command showing 90% fewer output bytes does not make your session 90% cheaper" s3。JetBrainsは83のベースラインセッション、190万文字のツール出力を再生し、3つに分けました。rtkが圧縮できるシェル出力373,339(19.7%)、ルールのないシェル出力879,326(46.3%)、rtkを通らないファイル読み取りと検索ツール646,613(34.0%)です s1。ReadとGrepはBash hookを一切通りません。cavemanのREADMEも反対側から同じ結論に達しています。請求の大きいほうの半分は、たいてい読み取りです s7。
graphify。 リポジトリは2026-04-03に作成され、2026-09-02時点で113,946スター、11,078フォーク、最新リリースはv0.9.53、Python、Apache-2.0です s5。READMEのベンチマーク行には "Graph build | LLM credits | 0" とあります。コードはtree-sitterで約40言語をローカルにパースし、コミュニティはLeidenで分割され、マシンの外には何も出ません s5。作者によるr/ClaudeAIの投稿では、2.5か月で73kスター、220万ダウンロードと報告されています s10。自社の1,701,550語のプロジェクト(ナイーブに読むと約2,268,733トークン)で graphify benchmark を実行すると、34,031ノードと56,865エッジが構築され、平均クエリコストは約24,702トークン、1クエリあたり91.8x少ないトークンでした。質問ごとの差は、"what is the main entry point" の679.1xから "what connects the data layer to the api" の34.0xまででした s5。91.8xはコーパス全体のナイーブな読み込みとの比較で、誰もわざわざそうはしません。またグラフはコードの変化とともに古くなり、任意のセマンティックパスはモデル呼び出しが発生する唯一のステップです。
rtk。 2026-01-22作成、2026-09-02時点で78,326スター、4,942フォーク、リリースv0.47.0、Rust、Apache-2.0、"100+ supported commands, <10ms overhead" s4。ローンチ投稿は "cargo test: 155 lines → 3 lines (-98%)"、"git status: 119 chars → 28 chars (-76%)"、"Total over 2 weeks: 10.2M tokens saved (89.2%)" と主張しました s9。私たちのマシンでは、rtk 0.42.3が25599コマンド、11.6Mトークン節約(41.6%)を報告し、By Commandの表の上位は find、read、grep でした s4。JetBrainsは rtk init -g が入れるままのrtk v0.43.0を、Claude Code 2.1.201とclaude-sonnet-5で使い、86タスクを2回ずつ実行しました。rtkが書き換えられるシェルコマンドは3つに1つだけです(全1,056コマンド中、書き換え可能349、ルールなし525、スキップ182)。圧縮可能な出力をすべて70%削減しても、節約の合計は請求額の約3%が頭打ちです。実測結果はタスクあたり+7.6%の割高で、高effortでは差はありませんでした s1。READMEは今ではこの点を認めています。"RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%"、そして報告される数はbytes / 4で推定されています s4。
Superpowers。 2025-10-09作成、2026-09-02時点で280,792スター、25,164フォーク、リリースv6.3.0、14のスキル、MIT、インストールは1コマンド: /plugin install superpowers@claude-plugins-official s6。brainstormingスキルは厳格なゲートで始まります。明確な意図が承認されるまで、コードも、スキャフォールディングも、実装スキルも使いません。3つの経路(spike、bounded、architectural)と、"When in doubt between two paths, take the heavier one" というルールがあります s12。writing-plansはエンジニアにコンテキストがゼロであると仮定し、作業を "Each step is one action (2-5 minutes)" のステップに分けます s13。subagent-driven-developmentは、タスクごとに新しいサブエージェントを割り当て、そのタスクのコンテキストだけを渡し、セッション履歴は渡しません。各タスクの後にレビューがあり、最後にブランチ全体の広いレビューがあります。モデルの節には "Use the least powerful model that can handle each role to conserve cost" とあり、モデルを省略するとセッションのモデルを継承すると警告し、"Turn count beats token price" と述べています。タスクごとに最大5ラウンドです。ラウンド1から3は実装者を再開し、ラウンド4はより高性能なモデルの新しい実装者を投入し、ラウンド5はオーケストレーター自身が判断します s14。圧縮はどこにもありません。節約は、履歴を読む量を減らすことと、機械的なステップに小さなモデルを使うことから生まれます。詳しい解説は以前の動画にあります s11。
caveman。 2026-04-04作成、2026-09-02時点で102,548スター、5,967フォーク、リリースbin-v1.1.5、Go。スキルはMIT、プロキシランタイムはBSL-1.1です s7。Claude APIで10個のプロンプトを試した自身の表では、出力トークンは平均で未使用1214、使用294、つまり65%、最良87%、最悪22%です s7。READMEのIMPORTANTブロックは正直です。スキルが短くするのは出力だけで、入力と推論のトークンは変わらず、ルールは毎ターン約1から1.5kの入力トークンを消費するため、セッション全体の節約はグラフより低くなります s7。JetBrainsはClaude Code 2.1.200、claude-sonnet-5、effort lowで82のペアタスクを実行し、費用は約USD 106でした。"Advertised saving: 65%. Measured saving: 8.5%"、出力トークンは592kから542k、品質低下は検出されず(符号検定 p = 0.82)、推奨は "use it if you like it" です s2。Claude Code組み込みのConciseスタイルも同じ役目を果たします。"Claude leads with the result, skips preamble and narration, and keeps responses short by default"、v2.1.237以降が必要で、/config で選び、.claude/settings.local.json に outputStyle として保存されます。スタイルはメインの会話にだけ適用され、サブエージェントは自分のシステムプロンプトで動きます s8。
評価表
| ツール | 請求のどの部分か | 宣伝値 | 実測値 | 動かすもの |
|---|---|---|---|---|
| Superpowers | 履歴とタスクごとのモデル | 数値なし | タスクごとに新しいコンテキスト、役割ごとに最も非力なモデル | 請求額 |
| graphify | 読み込まれる内容 | 構築にLLMクレジット0 | ナイーブな読み込みより1クエリあたり91.8x少ないトークン(自社) | 請求額(読み取り分) |
| rtk | 圧縮可能なシェル出力 | コマンドで60-90% | 圧縮可能19.7%、上限約3%、+7.6%/タスク(JetBrains) | 誤差の範囲 |
| caveman / Concise | エージェントが書く内容 | 65% | 出力トークンの8.5%(JetBrains) | 誤差の範囲 |
月曜にやること
- 直近の長いセッションを開き、入力がどこに使われたか数えます。ReadとGrepがどれだけ、シェル出力がどれだけ、再生された履歴がどれだけか。何かをインストールする前に、各ツールをどの部分に当てはまるか位置づけてください。
-
/plugin install superpowers@claude-plugins-officialでSuperpowersを入れ、実際の機能を1つ、brainstorming、writing-plans、subagent-driven-developmentに通します。オーケストレーターのコンテキストゲージが横ばいのままであることを確認してください。 - 起動するすべてのサブエージェントにモデルを明示します。省略するとセッションのモデルを継承し、機械的な作業にオーケストレーター級の料金を払うことになります。
- 最大のリポジトリで
/graphify .を実行し、続けてgraphify benchmarkを実行して、クエリごとのコストと表示されるナイーブなコーパスサイズを比べます。コードが変わったらグラフを再構築してください。 - すでにrtkを使っているなら、
rtk gainはお金ではなくシェル出力のバイト数として読みます。JetBrainsの内訳と合わせて見てください。find、read、grepがどれだけ節約しても、ReadとGrepのツールはhookを通っていません。 - cavemanを足す前に、
/configからConcise出力スタイルに切り替えます。Claude Codeに標準搭載で、毎ターンのスキルルールのコストがかかりません。 - 自分自身の測定を1つ持ち続けます。変更の前後のタスクコストを、同じタスクセットで比べます。1つのコマンドのバイト数ではありません。
さらに読む
- JetBrainsによるrtkの完全な方法論は、83セッションの再生と1,056コマンドの内訳を含み、あらゆるシェルプロキシを測定する際の基準になります s1。
- cavemanのベンチマークは、82のペアタスクと符号検定によって、65%のグラフが出力トークンの8.5%になる経緯を説明しています s2。
- rtkのsavings-explainedページは、セッションが実際に何を読むかを最も明快に示したツリーです。「節約トークン」のカウンターを信じる前に読んでください s3。
- graphify READMEのbenchmarksの節には、クレジット0の構築と、モデル呼び出しが発生する唯一のステップであるセマンティックパスが記載されています s5。
- Superpowersのモデル選択の節にある "Turn count beats token price" と5ラウンドの上限は、自分のエージェント定義に取り込む価値のある部分です s14。
- brainstormingのゲートと3つの経路は、儀式がタスクの大きさに応じてどう変わるかを示し、修正が小さすぎるのにゲートが働いてしまう場面も分かります s12。
- Claude Codeドキュメントの出力スタイル: Conciseスタイル、v2.1.237という下限、サブエージェントが無視する理由 s8。
出典
- Does rtk really save tokens in Claude Code?, JetBrains. 読む理由: rtkの唯一のエンドツーエンドのテストで、エージェントが読むものを19.7% / 46.3% / 34.0%に分けています。
- Speak to AI agents like cavemen to save tokens, JetBrains. 読む理由: 82のペアタスクで、品質低下を見つけることなく65%の主張を8.5%に引き下げています。
- How RTK savings work, GitHub. 読む理由: メンテナー自身による請求のツリーと、出力バイト90%減についての一文があります。
- rtk-ai/rtk on GitHub, GitHub. 読む理由: READMEが、rtkが何を測るか、カウントがどう推定されるかを明記するようになりました。
- Graphify-Labs/graphify on GitHub, GitHub. 読む理由: ベンチマーク表、クレジット0の構築、ここで使った
graphify benchmarkコマンド。 - obra/superpowers on GitHub, GitHub. 読む理由: 何を読むか、どのモデルが読むかを変えるプラグインです。
- JuliusBrussee/caveman on GitHub, GitHub. 読む理由: 節約の表と、それを弱めるIMPORTANTブロック。
- Output styles, Claude Code docs. 読む理由: 組み込みのConciseスタイルと、サブエージェントでの制約。
- rtk launch post on r/ClaudeAI, Reddit. 読む理由: 元の10.2Mという主張で、JetBrainsの測定結果と比べるのに役立ちます。
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. 読む理由: 作者による普及状況と、グラフの用途についての話。
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. 読む理由: プラグインをスキルごとに解説した完全版のウォークスルー。
- Superpowers brainstorming skill (SKILL.md), GitHub. 読む理由: ゲートと3つの経路の原文。
- Superpowers writing-plans skill (SKILL.md), GitHub. 読む理由: サブエージェントのコンテキストを小さく保つ、2から5分のステップ粒度。
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. 読む理由: 役割ごとのモデル選択と5ラウンドの上限。
FAQ
rtkは請求額をほとんど動かさないのに、なぜ11.6Mトークン節約と表示されるのですか?
カウンターが測っているのは、hookを通ったコマンドのシェル出力バイト数を4で割った値です。ReadとGrepのツール呼び出し、システムプロンプト、再生される履歴はhookを通らず、JetBrainsは、モデルが読む内容のうちこの方法で圧縮できるのは19.7%だけだと確認しました。
Superpowersは何かを圧縮しますか?
いいえ。タスクごとにそのタスクのコンテキストだけを持つ新しいサブエージェントを使うことで読む量を減らし、その役割をこなせる最も非力なモデルを割り当てることで支払いを減らします。代償は、すべてのタスクに入るゲートです。
cavemanはインストールする価値がありますか?
JetBrainsは品質低下を確認せず、出力トークンが8.5%減ったので、スタイルが気に入ったなら使って構いません。Claude Code v2.1.237以降のConcise出力スタイルなら、スキルのルールが毎ターン消費する1から1.5kの入力トークンなしで、同じ効果が得られます。
graphifyはいつ元が取れなくなりますか?
グラフが古くなったとき、またはセマンティックパスが必要な質問のときです。セマンティックパスはモデル呼び出しが発生します。91.8xという数字はクエリとコーパス全体の読み込みとの比較なので、小さいリポジトリでは差も小さくなります。
AIDive