AIDive

JevはClaude Codeを安くしない、自社ベンチマークが証明

AIDive · 公開

コーディングエージェントAI モデル

イントロ: ヒントであってコスト削減ではない

Jevは Claude Code を安くしない。ゲートウェイ自身のベンチマークがそれを示している。本稿では jev-gateway のコードとそのベンチマークリポジトリを読み、実際の Claude Code セッションの手前にロギングプロキシを置いて、ルーターが何を受け取るのかを確かめる。

Jev は TypeSafe の意思決定モデルだ。ミリ秒単位で確率を返すモデルで、1週間で6本の動画によって Claude Code に組み込まれた。売り文句は「最安のエージェント型コーディングループ」。ゲートウェイ自身の数字は、ルーティングをオンにした機能タスクで Opus 5 のリクエストが47%増え、所要時間が83%増えることを示している。

ミリ秒で答えるルーターが、なぜ Claude Code を遅くするのか。答えはコード1行に集約される。Claude Code の内部で Jev が受け取るのはたった二文であり、通常のセッションは毎回のコールで40個のツールを渡している。

Jevとは何か、波が何を売っているか

Jev は TypeSafe の意思決定モデルだ。テキストは一切生成しない。型付きの質問を投げると、選択肢・スコア・Yes/No確率のいずれかで答える。ベンダーが公表する数字は次のとおり。

項目 数値
入力価格 100万トークンあたり$0.04
出力価格 無料(「課金するには安すぎる」)
レイテンシー 70〜500ミリ秒
ホームページの見出し 194倍速く、445倍安い

その見出しの下のブログ記事は、この2つの倍率は実世界での成果の上振れであり、2つのフロンティアモデルの平均と比較した数字だと述べている。著者自身、その比較がそれらのモデルに有利に働くと認めている。

5日間で6本の動画が Jev を Claude Code に組み込んだ。最大のものは13万9千回再生で、最安のエージェント型コーディングループだと謳う。この波を支える2つのリポジトリがある。Claude Code と Codex 向けのローカルプロキシで、5日前に作られ181スターを集めた jev-gateway、そしてその前日に作られ6,400スターを集めたコンパクションプラグイン fast-jev-compaction だ。Claude Code が接続する先はゲートウェイなので、読み解きはそこから始まる。

環境変数ひとつ、一行のコード:ヒントモード

jev-gateway は Claude Code と Anthropic API の間に立つ。環境変数ひとつ、ANTHROPIC_BASE_URL をローカルポートに向けるだけで Claude Code を起動する。それ以外は何も変わらない。ソース内のコメントによれば、ゲートウェイ用の認証情報は存在せず、Pro や Max のログインはそのまま機能し続ける。

アダプター内(src/adapters/messages.ts の99行目)の一行が、Jev に何を許すかを決めている。

steer: thinking || cached ? "hint" : "tool_choice"

拡張思考がオンのとき、またはキャッシュ済みの会話のとき、ゲートウェイはヒントしか出せない。それ以外ではツールを強制する。この行の上のコメントがその理由を説明している。拡張思考が有効な間は API が強制ツールを拒否し、tool_choice を変更すると Claude Code が毎ターン読み直すキャッシュ済み会話が無効になる。

実際のリクエストがどう見えるかを確かめるため、60行のロギングプロキシが同種のポートでゲートウェイの座を奪い、Claude Code をそこ経由で起動して、実際のリポジトリで1回リクエストを送ってみた。リクエストには thinking: adaptive と3つのキャッシュマーカーが含まれ、tool_choice は存在せず、クリーンインストールでは24個のツールが同乗していた。ゲートウェイのその一行をこのリクエストに当てはめると、強制パスは一度も発動しない。Claude Code のすべての呼び出しがヒントモードに落ち着く。README にもそう書かれている。期待できるのは大きなツールリストでのツール選択の改善であって、コストやレイテンシーの低下ではない。

ヒントの正体:二文、そして届かない場所

Claude Code の内部で Jev にできるのは、最後のメッセージに付け足す二文だけだ。「ルーティングモデルはこのツールが今もっとも適切な選択だと提案しています。合わなければ無視してください。」介入はそれだけ。モデルはそれを自由に無視でき、tool_choice は auto のままだ。

Anthropic のドキュメントによれば、ツールの強制は選択肢にない。強制ツールは Opus 5.5 と Fable 5.1 では400エラーを返し、他のモデルでは手動の思考設定でエラーになる。tool_choice の変更も除外される。プロンプトキャッシングのドキュメントは、それが長いセッションで最大の部分を占めるメッセージキャッシュを無効化すると述べている。ツールの説明文を編集すると、ツール・システム・メッセージのキャッシュ全体が無効になる。

リクエストへの変更 プロンプトキャッシュへの影響
最後のユーザーメッセージにヒントを付け足す キャッシュされたプレフィックスは変わらない
tool_choice を変更する メッセージキャッシュが無効化される
ツール定義を編集する ツール・システム・メッセージすべてが無効化される

ゲートウェイのコメントは、なぜヒントを最後に置くのかを説明している。キャッシュされたプレフィックスは、Claude Code が次のターンで再送する内容とバイト単位で同一のまま保たれる。その手前にはガードがある。最後のメッセージがユーザーのものでない場合、リクエストはそのまま素通りする。今回捕捉した2つのリクエストはどちらも、Claude Code 自身が付け足すシステムブロックで終わっていた。一方は環境リマインダー、もう一方はフックの出力だ。この形では、ヒントの行き場がない。他のターンではきちんと届く。ツールの結果はユーザーメッセージとして戻ってくるからで、ベンチマークは Jev が Claude Code リクエストの3分の1から半分を操っていると数えている。

誰も引用しないベンチマーク

ゲートウェイ自身のベンチマーク jev-gateway-bench が、冒頭の問いに答えている。120セッション、各セルにつき5回の試行を、誰もが使うのと同じ Claude Code、同じサブスクリプションで実施した。MCP サーバーもプラグインもスキルも使っていない。小さなチェスエンジンでの2つのタスク、5つのバグを仕込んだバグ探しと、代数記法を追加する機能追加だ。

モデル、タスク ルーティングON vs OFF
Opus 5、機能追加 入力トークン+61%、リクエスト+47%、時間+83%(それでも5/5解決)
Sonnet 5、機能追加 入力トークン+16%、時間+37%
Sonnet 5、バグ探し 入力トークン−48%、時間−25%

著者自身の言葉を借りれば、ルーティングが報われるのはデバッグの場面だ。その説明がそのまま問いへの答えになる。ゲートウェイは Claude 系モデルに対してヒントしか出せないため、合わないヒントは無料で無視される代わりに遠回りのコストになる。

Codex は強制版を受け取る。Jev は Codex のリクエストの76〜100%を決定した。Claude Code の3分の1から半分に対して、だ。もう一方のハーネスにいたある1モデルは安くなったが間違えた。5つ解けるところを3つしか解けなかった。安くて間違っているのは節約ではない。

制約は現実にある。各セルにつき5回の試行は小さなサンプルであり、対象は1つのおもちゃのチェスエンジンにすぎず、誰も追試していない。入力の大半はキャッシュされているため、入力の節約は出力の節約ほどの価値を持たない。

自分のセッションが渡すもの:クリーン24、フル40

通常の Claude Code セッションは、毎回のコールでルーターに何を渡しているのか。プロキシのログが答える。40個のツールだ。同じリポジトリ、同じ単語1つのプロンプトで、2つの構成を比較した。空の設定で MCP サーバーを使わないクリーンインストールと、サーバーやプラグインをそろえた通常のセットアップだ。

クリーンインストール 通常のセットアップ
リクエスト内のツール数 24 40(うち16はMCPサーバーとプラグイン由来)
課金対象のプレフィックストークン 47,411 57,277
出力トークン 4 4
「ok」1回のAPI換算コスト $0.07 $1.15

請求されるのはこのツール一覧そのものだ。もっとも重い定義は最初から組み込まれている。シェルツールだけで12,000文字、エージェントツールはほぼ9,000文字ある。

ベンチマークの脚注では、クリーンインストールで6個のツールと7,000トークン、フル装備の1構成で285個のツールが観測されていた。今日のクリーンな Claude Code は組み込みツールがはるかに多く、フル装備のケースはむしろ珍しくなっている。ほとんどの MCP ツールは検索ツールの背後に置かれ、遅延読み込みされるため、ルーターが目にするツール一覧は小さいままだ。その大きさがどうであれ、ゲートウェイはそのツール一覧を毎回のリクエストで Jev に送っている。リポジトリの未解決issueは、ほとんどの回答が捨てられる前にそのフルコストが支払われていると指摘する。そこにあるのは Jev のせいでも、Jev が直せる話でもない。

用途別の結論

Claude Code 内でのルーティング。ノーだ。モデルが無視してよいヒントにすぎず、両方の Claude モデルで機能追加を遅くし、唯一の勝ち筋はデバッグにある。例外は非常に大きなツール一覧でのバグ探しの日であり、それは README 自身が挙げているケースだ。

コンパクションプラグイン fast-jev-compaction。まだだ。アーリーアクセスのフックフラグが必要で、未解決issueは一部のビルドでフックが登録されないと報告しており、あるコンパクションの後にはモデルが「作業完了」という報告を9回書き、そのすべてが捏造だった。実務者のほうが先にたどり着いていた。このプラグインの最上位スレッドは491ポイントを集め、そこでの最大の反論は速度ではなく、トランスクリプトを第三者に送ることの利用規約だ。

Codex。そここそが本当の標的だ。そこではゲートウェイがツールを強制し、Jev はリクエストのほぼすべてを操り、バグ探しは出力トークンが57%少なくて済んだ。

用途 結論
Claude Code内でのルーティング ノー(非常に大きなツール一覧でのバグ探しを除く)
fast-jev-compaction まだ
Codex イエス

この波が正しかった点がひとつある。サブスクリプションのログインは一切動かず、ゲートウェイが変えるのは URL だけだ。この検証の限界は、各セルにつき5回の試行、1つのチェスエンジン、誰も追試していないベンチマークリポジトリ、そして自分自身でルーティングを使ったセッションがないことだ。測定したのはツール一覧とリクエストであって、Jev そのものではない。Jev 自体は安い。高くつくのは遠回りのほうだ。

出典

よくある質問

JevはClaude Codeを安くしてくれる?
いいえ。jev-gatewayはClaude Code内ではヒントしか出せず、自社ベンチマークでもルーティングをオンにした機能タスクでOpus 5の入力トークンが61%増、リクエストが47%増、時間が83%増えている。Sonnet 5も同じ傾向で、唯一の成果はバグ探しでの入力トークン48%減だった。
Jevとは何?
JevはTypeSafeの意思決定モデルだ。テキストは生成せず、型付きの質問に対して70〜500ミリ秒で選択肢・スコア・Yes/No確率のいずれかを返す。価格は入力100万トークンあたり$0.04で、出力は無料。
jev-gatewayはClaude Codeの何を変える?
変わるのは環境変数ひとつ、ANTHROPIC_BASE_URLをローカルプロキシに向けるだけで、ProやMaxのログインはそのまま使える。アダプター内の一行が、思考がオンかキャッシュ済みの会話であればヒントモードにするよう決めていて、それは実質すべてのClaude Codeリクエストに当てはまる。
Claude Codeのヒントモードとは?
最後のユーザーメッセージに付け足される二文のことだ。ルーティングモデルはこのツールが今もっとも適切だと提案しています、合わなければ無視してください、という内容で、モデルは自由に無視でき、tool_choiceはautoのままになる。拡張思考中はツールの強制がエラーになり、tool_choiceの変更はプロンプトキャッシュを無効化するためだ。
Claude Codeのリクエストはツールをいくつ送っている?
Claude Code 2.1.280でロギングプロキシを使って計測したところ、クリーンインストールでは24個のツールと47,411のプレフィックストークン、MCPサーバーとプラグインを備えた通常のセットアップでは40個のツールと57,277のプレフィックストークンが、わずか4トークンの答えのために送られていた。
fast-jev-compactionは入れる価値がある?
まだない。アーリーアクセスのフックフラグが必要で、未解決issueは一部のビルドでフックが登録されないと報告しており、あるコンパクションの後にモデルが作業完了の報告を9回、すべて捏造で書いたという報告もある。コミュニティの最上位スレッドの主な反論は速度ではなく、トランスクリプトを第三者に送信することの利用規約だ。

関連動画