JetBrainsはノー、私のマシンは1160万
2026年7月、JetBrainsは約320ドルのAPIクレジット(課金された試行425回)を投じてrtkを検証した。Claude Codeでトークンを節約するために数万人の開発者が入れているシェルプロキシだ。結論は、タスクあたりのコストが7.6%増えたというもの。その2週間前、同じチームは「トークンを65%削る」と謳うスキルcavemanを計測し、8.5%という数字を得ている。一方、私自身のマシンではrtk gainが25,599コマンドで1160万トークンの節約を報告する。
どちらの数字も本物だ。ただ同じものを測っていない。片方は完了タスクあたりのコスト、もう片方はbash出力のバイト数である。
| 数字 | 何を測っているか | 出典 |
|---|---|---|
| タスクあたり+7.6%(p=0.004) | rtkを入れた状態でのタスク全体のコスト | JetBrains、425試行、約320ドル |
| 出力トークンの8.5% | エージェント作業でのcavemanの実測節約 | JetBrains、82ペアのタスク |
| 65% | cavemanが謳う節約率 | caveman README |
| 1160万節約(41.6%) | rtkが圧縮したbash出力バイト | rtk gain、25,599コマンド |
これが4本のスタックだ。graphify、rtk、Superpowers、caveman。2026-09-02時点でGitHubスター合計575,612。それぞれが請求書の別々の部分に触れている。
| ツール | スター(2026-09-02) | 言語 | ライセンス |
|---|---|---|---|
| Superpowers | 280,792 | Markdownスキル | MIT |
| graphify | 113,946 | Python | Apache-2.0 |
| caveman | 102,548 | Go | MIT(スキル) |
| rtk | 78,326 | Rust | Apache-2.0 |
トークンは実際どこに消えるのか
Claude Codeの請求書には二つの側面がある。入力トークンはモデルが読むすべて――シェルコマンドの出力、あなたのプロンプト、システムプロンプト、そして呼び出しのたびに再送される会話履歴の全体。出力トークンはモデルが書くすべてだ。
rtk自身のドキュメントがまさにこの木を描き、ローンチ記事にはなかった一文を添えている。「出力バイトが90%減るコマンドは、セッションを90%安くはしない。」
JetBrainsは読み取り側に数字を与えた。ベースラインの83セッションを再生し、ツール出力190万文字を分類している。
| モデルが読むものの内訳 | 文字数 | 割合 |
|---|---|---|
| rtkが圧縮できるシェル出力 | 373,339 | 19.7% |
| rtkにルールがないシェル出力 | 879,326 | 46.3% |
| rtkを通らないファイル読み取り・検索ツール | 646,613 | 34.0% |
モデルが読むもののうち、シェルプロキシで圧縮できるのは五分の一だけだ。Claude Code組み込みのRead、Grep、GlobはBashフックを一度も通らない。
ここから4ツールの地図が引ける。graphifyはエージェントが読む量を減らし、rtkはシェルが返す量を減らし、Superpowersは各タスクが背負う履歴を減らして誰が背負うかを選び、cavemanはエージェントが話す量を減らす。読み取り側が請求書の大きい方の半分だから、ランキングはそこから始まる。
graphify: 行ではなくノードをたどる
graphifyは、コードベースを――ドキュメント、SQLスキーマ、設定ファイル、PDFごと――クエリ可能なナレッジグラフに変えるスキルだ。Claude Code、Cursor、Codex、Gemini CLIで/graphify .と打つとプロジェクトが一度マッピングされ、以後エージェントはファイルをgrepする代わりにグラフに問い合わせる。
コードは約40言語にわたりtree-sitterのASTでパースされる。決定的で、LLM呼び出しはなく、マシンの外には何も出ない。ビルドのLLMクレジットはゼロ。生成物は3ファイル――クリックして辿れるgraph.html、GRAPH_REPORT.md、そしてグラフ本体であるgraph.json。ファイルを読み直さずに問い合わせられる。各ノードは概念(ファイル、関数、クラス)で、各エッジにはソース上に明示されていた場合はEXTRACTED、graphifyが解決した場合はINFERREDのタグが付く。ノードはLeidenアルゴリズムでサブシステムにクラスタリングされる。
自社プロジェクトの一つで組み込みベンチマークを回した結果:
| 指標 | 値 |
|---|---|
| ノード | 34,031 |
| エッジ | 56,865 |
| 検出コミュニティ | 967 |
| エッジの由来 | 76% EXTRACTED · 24% INFERRED |
| コーパス全体の素朴な読み込み | 1,701,550語 ≈ 2,268,733トークン |
| グラフクエリの平均 | 約24,702トークン |
| 削減 | 1クエリあたり91.8分の1のトークン |
質問ごとの幅は大きい。「what is the main entry point」で679.1倍、「what connects the data layer to the api」で34.0倍。
限界は二つ。この比較は「全部読む」ことが基準であり、grep中心のセッションはそもそもそこまで高くなかったから、実際の利得はもっと小さい。そしてグラフは古びる。graphify update <path>、--watch、git hookで更新すること。加えて、ドキュメントやPDF、画像に対するセマンティックパスはモデルを呼び、確かにトークンを消費する。
インストールはuv tool install graphifyy(パッケージ名のyは二つ)、続いてgraphify install。
rtk: 審判にかけられたシェルプロキシ
rtkはClaude Codeとシェルの間に入るCLIプロキシだ。ls、cat、git statusのような普通のコマンドは、エージェントが入力トークンとして読まねばならないノイズを大量に返す。ファイル権限、プログレスバー、通過した100行のテスト。rtkは同じコマンドを実行し、圧縮された版を返す。Rust製バイナリ1本、100超の対応コマンド、オーバーヘッド10ms未満。PreToolUseフックが対象のBash呼び出しを実行前に書き換える(git status → rtk git status)ので、エージェントは意識しなくていい。
作者のローンチ投稿は2週間で1020万トークン節約、89.2%を主張し、cargo testが155行から3行になる例を挙げていた。25,599コマンド後の私たちのダッシュボードはこうだ:
| コマンド | 呼び出し | 節約トークン | 率 |
|---|---|---|---|
rtk find |
354 | 220万 | 46.6% |
rtk read |
3,504 | 220万 | 10.4% |
rtk grep |
2,760 | 190万 | 47.7% |
rtk ps aux |
24 | 110万 | 98.0% |
rtk diff |
39 | 54.11万 | 92.2% |
| 合計 | 25,599 | 1160万 | 41.6% |
そして審判。JetBrainsはrtkを配布されたままの設定で入れ、claude-sonnet-5上で86タスクを2回走らせた。
| JetBrainsの所見 | 値 |
|---|---|
| rtkが書き換えられるシェルコマンド | 1,056中349(3回に1回) |
| 総節約の上限 | 請求書の約3% |
| タスクあたりコスト、reasoning effort低 | +7.6%(p=0.004) |
| タスクあたりのターン数 | +13.8%(p=0.03) |
| タスクあたりコスト、effort高 | ±0% |
| タスク品質 | 変化なし |
rtkのREADMEは今やはっきり書いている。bash出力の最大90%であって、「請求書を90%削ることと同じではない」。しかも自前のカウントはbytes / 4の推定値だ。
評決:無料で、圧縮は本物、JetBrainsの言葉を借りれば「しばしば趣味が良い」。bash中心のセッション用に入れておけばいい。ただし請求書を動かすことは期待しないこと。
Superpowers: まず枠組み、次に失敗しようがない小さなタスク
SuperpowersはJesse VincentによるClaude Codeプラグインだ。スター280,792、スキル14本、インストールはコマンド1つ(/plugin install superpowers@claude-plugins-official)。何も圧縮せずにトークンを節約する。
すべてはbrainstormingスキルから始まる。ファイルの冒頭は硬いゲートだ。明示的な意図が承認されるまで、コードもスキャフォールディングも実装スキルも禁止。スキルが読み込まれるとエージェントはブレストの相棒になり、実際に何かを作る前にプロジェクトのいくつかの部分が考え直される。ここが最も重要な段階だ。最も高くつくトークンは、間違ったものを作るために使われたトークンだから。
スキルは作業をspike、限定的な変更、アーキテクチャ的変更に分類し、ルールはファイルに書かれている。「二つの道で迷ったら、重い方を取れ。」失敗のかたちにも名前が付いていて、「Too Simple To Need Approval」というアンチパターンの節がある。アーキテクチャの道は、あなたが検証するspecを生み、その後に実装計画を生む。
信頼性は計画から来る。writing-plansスキルは作業を1アクション、2〜5分のステップに切る。失敗するテストを書く、走らせて失敗を確認する、通す最小のコードを書く、テストを再実行する、コミットする。計画は「エンジニアの文脈はゼロ」という前提で書かれる。そこまで小さなタスクなら新しいコンテキストウィンドウに余裕をもって収まるので、エージェントが飽和したウィンドウでタスクの終わりに到達することがない。ハルシネーションしたコードは、飽和したウィンドウから出てくる。
限界は儀式そのものだ。ファイルは「タスクに応じてスケールする」と言うが、1行の修正でもゲートは発動し、それもトークンを食う。
Superpowers: 1タスク、1サブエージェント、見合うモデル1つ
そして計画が走り出すと、トークンの計算が変わる。1タスク、1サブエージェント。各サブエージェントは自分のタスクだけを含む新しいコンテキストで起動し、セッション履歴は決して持たない。だからオーケストレーターのウィンドウは小さいままで、サブエージェントのウィンドウはきれいなままだ。タスクごとにオーケストレーターが結果をレビューする。OKなら次のタスク、NGなら修正をサブエージェントに戻す。1タスクにつき最大5ラウンド。ラウンド1〜3は元の実装者を継続し、ラウンド4ではより高性能なモデルの新しい実装者に渡し、ラウンド5ではオーケストレーター自身が裁定する。
すべての支払いを賄うルールがモデル選択だ。「コストを抑えるため、各ロールをこなせる最も非力なモデルを使え。」オーケストレーターは各タスクの難度を評価し、見合うモデルを選ぶ。
| タスクの型 | モデル階層 |
|---|---|
| 機械的で仕様が明確、計画にコードが既にある | 最安・小型モデル |
| 複数ファイルの調整、デバッグ | 標準モデル |
| アーキテクチャ、ブランチの最終レビュー | 最高性能モデル |
| モデル未指定 | セッションのモデルを継承 |
同じファイルにある一つのニュアンス。「ターン数はトークン単価に勝る。」3ターンかかる安いモデルは安くない。実務上、これがOpusやFableを月20ドルのProプランで使えるものにしている。高価なモデルはセッション全体ではなく、ひと握りのタスクにだけ触れる。
最後の利点はドキュメントだ。すべてのspecと計画はdocs/superpowers/specs/とdocs/superpowers/plans/YYYY-MM-DD-<feature-name>.mdに保存されるMarkdownファイルで、作業の終わりにコミットされる。このチャンネル自身のパイプラインでも、現行の動画エンジンへの移行はspecと14タスクの計画として残っていて、今でも開いて新しいセッションで参照し、その上に積み上げられる。エージェントがやったことで追跡されていないものは何もない。
cavemanとConciseスタイル: 少なく語る
最後の一切れは、エージェントが何を話すかだ。エージェントは語る。「もちろんです」「喜んでお手伝いします」「お困りの問題はおそらく〜が原因です」。これは何も生まない出力トークンである。
cavemanはJulius Brusseeによるスキルで、スター102,548。エージェントを原始人のように話させる。冠詞、埋め草、社交辞令、ぼかしを落とし、[もの] [動作] [理由]。[次の一手]。のパターンに従わせる。コード、コマンド、ファイルパス、正確なエラーメッセージには一切手を付けず、その周りの散文だけを縮める。3段階(/caveman lite|full|ultra)と、起動時に有効化するSessionStartフックを備える。
自前の表によれば、Claude API経由の10プロンプトで、スキルなしの出力トークンは平均1,214、ありは294――65%。最良で87%、最悪で22%。
現実確認もREADME自身が用意している。このスキルは出力を短くするだけで、入力トークンとリーズニングトークンは変わらず、スキル自身のルールが毎ターン約1〜1.5kの入力トークンを食う。JetBrainsは82ペアのエージェントタスクで、約106ドルのクレジットをかけて計測した。
| caveman | 公称 | 実測(JetBrains) |
|---|---|---|
| 出力トークンの節約 | 65% | 8.5%(59.2万 → 54.2万) |
| 品質への影響 | — | 検出可能な劣化なし(符号検定 p=0.82) |
このギャップは構造的なものだ。エージェントの出力は大半がコードとツール呼び出しで、cavemanはそこを正しく触らない。JetBrainsの推奨はこうだ。「気に入ったなら使えばいい。楽しいし、品質面で測れるコストはない。」
そしてClaude Code v2.1.237以降、組み込みの相当機能がある。出力スタイルConciseだ。Claudeは「結果から始め、前置きと語りを飛ばし、既定で回答を短く保つ」。/config → Output styleで選ぶと.claude/settings.local.jsonに保存され、/clearか新しいセッションから効く。両者に共通する限界が一つ。出力スタイルはメインの会話にしか適用されず、サブエージェントは自前のシステムプロンプトで動く。
評決: 請求を動かすもの、誤差しか動かさないもの
各ツールが実際に動かすもので順位を付け、それぞれが背負うコストも並べる。
| 順位 | ツール | 動かすもの | 実測の効果 | コスト |
|---|---|---|---|---|
| 1 | Superpowers | タスクごとの履歴+それを読むモデル | 高価なモデルがセッション全体でなくひと握りのタスクだけを担当 | あらゆるタスクにゲート、1行修正でも |
| 2 | graphify | エージェントが読むもの | コーパスの素朴な読み込みに対し1クエリ91.8分の1のトークン(自社プロジェクト) | グラフが古びる。セマンティックパスはトークンを使う |
| 3 | rtk | bash出力のバイト | 上限は請求書の約3%。JetBrains検証ではeffort低でタスクあたり+7.6% | ルールがあるのはシェルコマンド3回に1回だけ |
| 4 | caveman / Concise | エージェントが書く散文 | 出力トークンの8.5%、品質低下なし | 毎ターン約1〜1.5kの入力トークン |
勝者はSuperpowersで、しかも圧縮のおかげではない。タスクごとの新しいコンテキストと、仕事をこなせる最も安いモデル。この二つが「何が読まれるか」と「誰が読むか」を変える。graphifyが2位なのは、読む量を減らすことが請求書の大きい方の半分だからだ。rtkは本物で、無料で、無害だが、シェルコマンドの三分の二とすべてのファイル読み取りはそこを通らない。cavemanと、Claude Codeが今や同梱するConciseスタイルは、一番小さい一切れを削る。
4本ともインストールは無料――graphifyとrtkはApache-2.0、SuperpowersはMIT、cavemanスキルはMIT。57万を超えるスターは、人々が奇跡を求めていることを示している。正直な答えはランキングだ。
AIDive