8つのリポジトリ、1プロジェクト、87回の実行
今月、Claude Codeの必須リストにはどれも同じ8つのGitHubリポジトリが載っている。Chisle、Ouroboros、Reticle、Caliper、Anti-Slop、UI Skills、img2threejs、FWC SwiftUI Skillsだ。合計で3万7000スター超え。こうしたリストは、各リポジトリが何を謳っていて、どう導入するかしか教えてくれない。全部まとめて入れて計測した人はいない。
そこで8つ全部を、テストが111本通る実際のReactプロジェクトに導入した。そのうちの1つは、マシン上の9つの他のAIツールの設定に自分自身を書き込んだ。1つはソースコードのたった1行のせいで、一度も実行しなかった。そして3つはClaude Codeにサーバーを接続したが、63回の実行の中で一度も呼び出されなかった。
| 検証内容 | 数値 |
|---|---|
| 導入したリポジトリ数 | 8 |
| 総実行回数 | 87 |
| 総費用 | 約6ドル |
| プロジェクト | Reactアプリ1本、テスト111本通過 |
| モデル | 1 |
| 期間 | 1日 |
残りを貫く問いは3つ。それぞれの起動コストはいくらか、実際に出力を変えたのは何か、そして残す価値があるのはどれか、だ。
打つ前にかかるコスト
起動コストとは、最初のメッセージを送る前にClaude Codeがコンテキストに読み込む分量のことだ。空のプロジェクトでも約1万7000トークンあり、これを毎ターン払うことになる。各インストールを測るために、Claudeに一言だけ返信させて請求額を確認した。単位はドルではなくトークンにしている。キャッシュの有無だけで、同じ条件の2回の実行でも料金が10倍違うことがあるからだ。
| インストール | 追加された起動トークン |
|---|---|
| Chisle | 約3,500 |
| Ouroboros | 約1,600 |
| Reticle | 約900 |
| img2threejs(33KBの指示ファイル) | 107 |
| Anti-Slop(ヘルパースキル) | 95 |
| UI Skills | 37 |
| それ以外 | それぞれ100〜300 |
| 8つ合計 | 7,000未満 |
8つのうち2つは、そもそもWeb開発者向けではない。img2threejsは写真を3Dシーンに変換するもので、FWC SwiftUI SkillsはAppleアプリ向けだ。この2つはコストだけを計測した。その3Dスキルは33キロバイトの指示ファイルを同梱していながら、コストはわずか107トークンで済む。呼び出すまではスキルの説明文しか読み込まれないからだ。
サーバーも安くなった。Claude Codeは今ではサーバーのツール名だけを読み込み、詳細はオンデマンドで取得する。ツール1個あたり約45トークンで、そのツールが何をするかは関係ない。8つ全部を入れても、コストは単純に足し算されるだけで、掛け算にはならない。
Claude Codeにはプラグインのこのコストを事前に試算するコマンドがあり、フックは無料として扱われる。このマシンで毎日使っているプラグインについて、それは約540トークンと試算した。実測は744トークンだった。起動フックがセッションに直接出力を書き込んでいるからだ。
これらのリポジトリが高くつくのは起動時ではない。ターンのほうだ。
同じタスクを、あり・なしで
ベンチマークは、実際に開発者が任せるであろう3つのタスクだ。URLの組み立て方に潜むバグ、読了時間を表示する機能、そしてフォームの文字数カウンターである。各タスクは、リポジトリを1つだけ入れた状態、8つ全部入れた状態、何も入れない状態のそれぞれで、毎回3回ずつ実行した。判定にはエージェントが見ることのないテストに加え、プロジェクト自身のテストスイートと型チェッカーを使った。どの実行でも許可されたツールの固定リストは同じで、権限チェックの回避は一切していない。
| 結果 | 数値 |
|---|---|
| タスク実行回数 | 63 |
| 合格数 | 63 |
| 新規型エラー | 0 |
| 接続された3サーバーへの呼び出し | 0 |
| バグ修正(ベースライン) | 7ターン、27秒 |
| フォームタスク(ベースライン) | 22ターン、約1分 |
何かのせいでClaudeがタスクに失敗することはなく、何かのおかげで本来失敗するはずのタスクに合格することもなかった。
このうち3つのリポジトリは、ツールが詰まったサーバーを接続する。63回の実行で、Claudeはそれらのツールを一度も呼び出さなかった。デザインの助言や視覚的なテストに出番があるよう書いたフォームタスクでも同じだった。公平のために言うと、2つは本来の役目を果たす機会自体がなかった。Reticleは実行中のアプリとブラウザをペアリングする必要があるが、そのペアリングがクラッシュした。Ouroborosはマシン全体に及ぶセットアップを必要とするが、それは与えなかった。
ばらつきは非常に大きい。同じプロンプト、同じインストールでも、ある実行では4,300トークン書き出し、別の実行では7,100トークンだった。自身のばらつきを上回った結果は2件だけで、どちらも最も短いタスクでのことだ。前後比較のデモを1回見せたところで何も証明にならない。
Chisleの52%、実際のコーディングでは
Chisleは出力を圧縮するプラグインで、8つの中で唯一、具体的な数字を約束している。ベンチマークによれば、請求額は52%まで下がるという。3つのタスクで実測したところ、出力量はベースラインの94%だった。README自身がその理由を説明している。あの数字はツールを使わない単発プロンプトの数字であり、セッション全体のコストではない、と。
| 指標 | 数値 |
|---|---|
| Chisleのベンチマークの主張 | 出力52% |
| Chisleの3タスクでの実測 | ベースラインの94% |
| 日常使いの簡潔化プラグイン、同じタスク | 113%(ばらつきの範囲内) |
| バグ修正1件:読み込みトークン | 95,000 |
| バグ修正1件:書き込みトークン | 1,700 |
実際のコーディングセッションでは、出力は請求額のうちの小さな部分でしかない。Chisleは起動時にルールを読み込み、送るすべてのプロンプトにリマインダーを添付する。そのため3タスク中2タスクで、ベースラインより高くついた。節約できる分よりも、そのルール自体の重さのほうが大きいのだ。ツール出力を圧縮する機能はすべてのセッションで動いていたが、一度も節約を記録しなかった。
どちらのプラグインも、測定可能な節約は一切なかった。あるChisleユーザーは173セッションにわたって同じ結果を見出しており、開発者はそのバグはすでに修正済みだと述べている。公平を期すなら、Chisleは自分自身の損失を公表しているし、ファイル処理も丁寧に堅牢化されている。
ここから得られる教訓はこうだ。毎ターン喋るプラグインこそ、いちばん高くつく。
プロジェクトの外まで手を伸ばすインストール
インストール範囲とは、リポジトリのセットアップが実行フォルダの外までどれだけ及ぶかということだ。ここではすべて、意図的に1つのフォルダの中だけにインストールし、マシンの他の部分には手を触れないようにした。
ところがReticleのセットアップコマンドには別の思惑があった。そのログ自身によれば、VS Code、Copilot、Warp、Kiro、Amazon Q、Cline、Ampほかもう1つを合わせた8個の他のエージェントに、自らを登録していた。Geminiでは自分自身を事前承認していた。Claude Codeの設定には、自分のツールを承認するルールを追加していた。これらは何も隠されておらず、すべてソースコードに書かれている。インストーラーは自分の動作を包み隠さず表示し、アンインストールコマンドも用意されている。だが与えたのは、1つのプロジェクトに対する、1回のyesフラグだけだった。
Caliperは本来、計測用のツールになるはずだった。そのハーネスはあらゆる権限チェックを切った状態でClaudeを起動し、それを変更する手段はない。しかもログイン情報をテスト実行ごとにコピーする。結局一度も実行せず、代わりに独自のランナーを用意した。
| リポジトリ | プロジェクト内にきれいにインストールできるか | 備考 |
|---|---|---|
| Anti-Slop | Yes | ファイルをコピーするだけ |
| UI Skills | Yes | リモートのスキルライブラリ |
| img2threejs | Yes | スキルの1つ |
| FWC SwiftUI Skills | Yes | プレーンテキスト |
| Reticle | 部分的 | 他の8エージェントに登録、自己承認ルールあり |
| Chisle | No | グローバルのみ、起動時に更新確認、生のツール出力をディスクに保存 |
| Ouroboros | No | マシン全体のみ、デフォルトで使用状況を報告、インストーラーがインターネットからスクリプトをシェルへパイプできる |
| Caliper | 未実行 | 権限チェックがオフ、認証情報が実行ごとにコピーされる |
どれもマルウェアではない。ただ、あなたがそのツールをどこでも使いたいはずだという前提に立った利便性なのだ。何かをインストールする前には、フック、インストールスクリプト、サーバー設定の3つを必ず開いて見ること。
重ねるとどうなるか
積み重ねるとは、8つ全部を一緒にインストールした状態のことだ。クラッシュもエラーもなく、コストはほぼそのまま足し合わされる。ただし1つの落とし穴に1時間費やした。スクリプトによる実行では、プロジェクトのサーバーが誰も出せない承認を待ち続けるため、ほとんど無料に見えてしまう。ここに載せたサーバーの数値はすべて、その問題を修正した上で測り直したものだ。
リポジトリ同士が交わるのはフックだ。フックとは、決まったタイミングでClaude Codeが実行するスクリプトで、その出力はそのままモデルの前に置かれることがある。この中の3つのツールを組み込んだ状態では、起動時に3本、さらに毎プロンプトごとに3本のスクリプトが動く。ごく普通に打った1つの文が、2つのメモを添えられた状態でモデルに届いた。1つは簡潔に書けという指示、もう1つはプロジェクト内では完了できないセットアップ手順を要求するものだ。この2つ目のメモは、キーワードのどれかを含むプロンプトが来るたびに毎回戻ってくる。
ツール名が衝突することはない。どのサーバーも自分のツールに接頭辞を付けているからだ。フックについては公式ドキュメントが確認している。複数のフックがコンテキストを追加すると、Claudeはそのすべての値を受け取る、と。
2026年5月のある研究は、スキルを大量に積んだときにエージェントに何が起きるかを計測している。約200個のスキルを入れると、合格率は最大21%低下し、その低下の大半は、エージェントが正しいスキルではなく見た目の似たスキルを選んでしまうことに起因していた。8つのリポジトリはスキル10個分であり、その水準にはほど遠い。何十個も入れている人は、その水準に近い。
コードを変えた唯一のリポジトリ
Anti-Slopはプラグインではなく、プロジェクトにコピーして使うlintルール集だ。インストールするパッケージは存在せず、作者はルールをコピーして自分好みに変えることを想定している。リンターはモデルの外でコードを読むため、コンテキストのコストはかからない。ヘルパースキルに95トークン、ターンごとの追加コストはゼロだ。
フォームタスクでは、Claudeは新しいフィールドをコンポーネントに配線する必要があった。そこで上の行をそのままコピーし、安全でない型キャストごと持ち込んでしまった。Anti-Slopはそれを3回中3回とも検出した。これはレビュアーが見逃しがちな種類のミスだ。周りのコードと同じ見た目をしているからである。
| Anti-Slopの検出内容 | 数値 |
|---|---|
| 安全でない型キャストの検出 | 3回中3回 |
| 正しい6行の関数での空行不足の検出 | 3回中2回 |
| 未変更のプロジェクトでの検出件数 | 109 |
| うちスタイルルール2件が占める割合 | 83% |
| その他のルール | 16 |
空行の指摘は好みの問題であってバグではなく、このリンターは一度に1ファイルしか読まない。コストは初日から現れる。残り16個のルールを評価する前に、まずこの2つのスタイルルールについて自分の方針を決めておくことだ。1つ注意点がある。ルールはモジュールとして提供されているため、プロジェクト側もモジュールとして宣言していないと、リンターがクラッシュする。
UI Skillsは維持コストが最も安い。デザインスキルのリモートライブラリに37トークンで、今回の実行での呼び出し回数はゼロだった。7月には18個のリンク切れがあったが、この動画の撮影当日の朝に300個すべてをテストしたところ、壊れているものは1つもなかった。
残すもの、そして自分の環境の点検法
8つのリポジトリを仕分けした。予想では3つ残るはずだった。だがデータが示したのは、その資格を勝ち取ったもの1つと、残しておいても損はないもの3つだった。
| リポジトリ | 評価 |
|---|---|
| Anti-Slop | 資格あり:ほぼ無コストで、毎回本物のミスを検出した |
| UI Skills | 残して損なし:37トークン、何とも衝突しない |
| img2threejs、FWC SwiftUI Skills | 呼び出す予定があるなら残して損なし:合わせて数百トークン |
| Chisle | 実際のコーディング作業では、節約分よりコストが上回った |
| Caliper | 一度も実行しなかった |
| Reticle、Ouroboros | マシン全体を要求し、本来の仕事をこなす場面を一度も見なかったため、何のためのツールなのか評価できない |
Ouroboros自身のメンテナーは、実行の約40%が失敗していると報告している。
この検証の限界は重要だ。1つのReactプロジェクト、1つのモデル、3つのタスク、それぞれ3回ずつの実行である。これだけばらつきが大きいと、小さな効果は見えなくなる。それでもデータがはっきりさせたことがある。土台はすでに高いということだ。これらのツールがあってもなくても、Claudeはすべてをクリアした。そして、呼ばれるのを待ってコンテキストに座っているだけのツールは、ほとんど呼ばれない。使われるには、それを積極的に使うワークフローが必要になる。
自分の環境なら2分で点検できる。1つのコマンドで、今何が読み込まれているかがわかる。1つのコマンドでプラグインのコストを試算できるが、フックは無料扱いになる点は忘れないこと。1つのコマンドで、各スキルのコストと使用頻度がわかる。そして何かをインストールする前には、フック、インストールスクリプト、サーバー設定を必ず開いて確認すること。
AIDive