AIDive

動画パック

DeepSeek Harness と V4 Pro: アーキテクチャ解説、料金表、結論の表、情報源

10 分で読めます

TL;DR

  • DeepSeek Harness (dsh) は MIT ライセンスのコーディングエージェントです。モデル、ツール、サンドボックス、ストレージ、ループ、UI のすべてがプラグインで、設定だけで差し替えられます。リポジトリはすでに 21,000 を超えるスターと 12,000 を超えるコミットを集めています。
  • いちばん強いアイデアは追記専用のセッションログです。セッションが迷走したら、トランスクリプトをスクロールする代わりにイベント単位で再生できます。
  • DeepSeek V4 Pro 0813 は SWE-bench Verified で約 80.6% を主張しており、Claude Opus 4.6 は 80.8% です。スコアはすべて自己申告で、第三者が再現した例はまだありません。
  • ローンチ価格は入力が 100 万トークンあたり $0.435、出力が $0.87 です。8 月 16 日から API はピークとオフピークの課金に移り、ピーク時の出力は最大 $3.96 まで上がりますが、それでも Opus 5 の約 4 分の 1 です。
  • dsh は 0.1 の開発者プレビューで、README は破壊的変更を予告しています。ツールを作る人は今週インストール、コストを削りたい人は 8 月 16 日の料金で V4 Pro を個人プロジェクトで試し、Claude Code を毎日使っている人はそのままで大丈夫です。

情報源が語ること

アーキテクチャ

ハーネス全体は Cordis というカーネルの上に載っています。公式ページによると、あらゆる機能は設定の中で選択、差し替え、拡張でき、ハーネスのコードには触れません s8。これは Claude Code の skills や MCP サーバーより広い範囲です。Claude Code ではエージェントの外縁を拡張しますが、dsh ではサンドボックス、セッションストレージ、ループそのものを組み替えられます s1。GitHub の dsh-plugin トピックにはコミュニティのプラグインがすでに並んでおり、DeepSeek 以外のモデルでハーネスを動かすモデルプラグインも含まれています s10。

インストールはコマンド 1 つです。npx @deepseek-ai/dsh web でポート 3080 にローカルの Web UI が立ち上がり、アカウントは不要で、同じコードベースがターミナルモードも担います。リポジトリ全体のクローンとビルドは pnpm コマンド 4 つです s2。

dsh には 4 つの実行モードがあります。Standard は完全なコーディングエージェントです (ファイル編集、シェル、検索、計画)。Code はモデルが TypeScript を書いて複数ステップの処理を自分で組み立て、ツール呼び出しを 1 つずつ連鎖させないので、長いタスクでの API 往復が減ります。Minimal はエージェントを bash とファイルエディタだけに削ぎ落とし、主に素のモデルのベンチマーク用です。Creator は独自のプリセットを作るためのもので、ランタイムをライブで確認できます s8。

モデルが見るものはすべて追記専用のセッションログに入ります。プロンプト、推論、ツール呼び出し、コンテキストへの注入です。このログがハーネスの信頼できる唯一の情報源なので、どのセッションもイベントストリームから再開、フォーク、検索、再生できます s1。

モデル

V4 Pro 0813 は Mixture-of-Experts モデルで、コンテキストウィンドウは 1M トークン、出力は最大 384,000 トークン、ツール呼び出しと JSON 出力に対応します s4。DeepSeek の API は Anthropic API 互換をうたっているため、Claude 向けに書いたツールもベース URL とキーを変えるだけで V4 Pro に向けられます s3。

DeepSeek 自身の数字では、Max バリアントは SWE-bench Verified で約 80.6%、Claude Opus 4.6 は 80.8% です。Terminal Bench 2.1 と、Opus 4.8 との比較でいくつかのエージェント系ベンチマークに勝ったとも主張しています。Artificial Analysis のインデックスでは V4 Pro は 53、Opus 5 は 63、Fable 5 は 62 です。速度は V4 Pro が毎秒 83 トークンで、Opus 5 は 52 です s5。

これらのスコアはどれも第三者に再現されていません。ベンチマークは最初に DeepSeek 公式の WeChat グループで出回り、次にモデレーターに削除された Reddit の投稿、その後 Hacker News の ASCII 表として広まりました。公式の発表ページはなく、オープンウェイトも未確認ですが、4 月の V4 Pro と 7 月の V4 Flash はどちらも最終的に Hugging Face に公開されました。実際に触った観察は今のところ 1 つだけです。同じ描画プロンプトで 3 つの推論レベルがまったく異なる 3 通りの結果を出しました。ほかのモデルでは見たことのない挙動です s5。

価格

ローンチ時の V4 Pro は入力が 100 万トークンあたり $0.435、出力が $0.87 で、1M コンテキストも標準料金で課金され、長文コンテキストの割増はありません s3。Claude Opus 5 は入力 $5、出力 $25、Fable 5 は $10 と $50、Sonnet 5 は $2 と $10 です s6。つまり V4 Pro は Opus 5 より入力で約 11 倍、出力で 28 倍安く、Sonnet 5 と比べても 4 倍から 11 倍安くなります s3。

入力 50,000 トークン、出力 15,000 トークンの典型的なエージェントセッションは、ローンチ価格で Opus 5 なら約 $0.62、V4 Pro なら $0.035 です。エージェントにとって見えにくいコストはキャッシュです。ハーネスは毎ターン同じコンテキストを再送するため、入力トークンの大半は読み直しです。キャッシュヒットは Opus 5 で 100 万トークンあたり $0.50 s6、DeepSeek では $0.0036 で、比率は 138 対 1 です。エージェントが最も多く使う場所でこれだけ差が開きます s3。

ローンチの 3 日後、8 月 16 日から API はピークとオフピークの課金に切り替わります。オフピークの V4 Pro は入力 $0.66、出力 $1.98 に上がります。ピーク (UTC の 1h から 4h、および 6h から 10h) は $1.32 と $3.96 です s3。ピーク時の出力はローンチ当日の 4.5 倍で、355% の値上げです。最悪の料金でも V4 Pro は Opus 5 の約 4 分の 1 です s6。ピーク時間帯は中国の勤務日に合わせてあるので、cron ジョブやヨーロッパの夜間実行はオフピークに寄せられますが、午後にライブでコーディングすると一部のピーク枠に当たります。

反応

Hacker News の投稿は 1 日で 990 ポイントを超えました s7。Bloomberg はこのローンチを、Claude モデルに結びついた Anthropic のハーネスである Claude Code への正面からの挑戦と報じました s9。

結論

項目 維持、試す、見送り 理由
dsh のプラグインアーキテクチャ 試す サンドボックス、ストレージ、ループがすべて差し替え可能で、今いちばん面白いハーネス設計
dsh の再生できるセッションログ 試す エージェントが迷走したとき、トランスクリプトを読むよりイベント単位の再生が優れている
dsh をメインの作業環境にする 今は見送り 0.1 の開発者プレビュー、README が破壊的変更を予告、本番での実績なし
個人プロジェクトでの V4 Pro 試す 1M コンテキスト、Anthropic API 互換、キャッシュヒット $0.0036
本番での V4 Pro 待つ スコアは自己申告のみ、発表ページなし、ウェイト未確認
試算表にローンチ価格を使う 見送り 8 月 16 日で終了。オフピーク $0.66/$1.98、ピーク $1.32/$3.96 で試算する
日々の作業の Claude Code 維持 検証済みのモデルスコア、成熟したエコシステム、定額プラン

月曜にやること

  • npx @deepseek-ai/dsh web を実行し、127.0.0.1:3080 を開いて、使い捨てのリポジトリで Standard モードを 30 分試す。
  • 同じタスクを Code モードに切り替え、Standard モードと API 往復の回数を比べる。
  • わざと失敗させ、セッションログを問題が起きたイベントまで再生して、Claude Code のトランスクリプトを読む場合と比べる。
  • Anthropic 互換の既存スクリプトを 1 つ、V4 Pro のキーを使って DeepSeek のベース URL に向け、ツール呼び出しと JSON 出力が動くか確認する。
  • 8 月 16 日の料金でコスト見積もりを作り直す。オフピーク $0.66/$1.98、ピーク $1.32/$3.96 で、どの実行が UTC の 1h から 4h または 6h から 10h に当たるかを印を付ける。
  • 138 対 1 のキャッシュ比率を信じる前に、実際のエージェントセッション 1 つでキャッシュヒット率を測る。
  • GitHub の dsh-plugin トピックを見て、今使っているモデルを dsh 内で動かすモデルプラグインが出ないか確認する。
  • Claude Code をデフォルトのままにして、第三者が SWE-bench Verified の再現結果を公開したら再評価するようカレンダーにリマインダーを入れる。

さらに読む

  • クイックスタートを読み、pnpm で dsh をソースからビルドして、Web モードとターミナルモードが 1 つのコードベースをどう共有しているか確認する s2。
  • プラグインを書く前に Cordis カーネルと "Everything is a Plugin" の節を調べる。組み替えが起きるのはプリセットの仕組みだからだ s8。
  • dsh-plugin トピックを追い、最初に出てくるコミュニティプラグインがモデル、サンドボックス、ストレージのどれかを見る。エコシステムの向かう先がわかる s10。
  • 80.6% という数字をどこかで引用する前に、WeChat から Reddit、Hacker News へと渡ったベンチマークの経路を読む s5。
  • DeepSeek に直接アカウントを作らず V4 Pro を使いたいなら、OpenRouter の掲載ページで 384,000 出力トークンの上限とプロバイダーの内訳を確認する s4。
  • Claude のキャッシュ料金ページと DeepSeek のキャッシュヒット行を比べる。エージェントの請求額が最も開くのはターンごとのキャッシュだ s6。
  • Hacker News のスレッドを見て、初期のプラグイン作者と、プレビュービルド間の破壊的変更の最初の報告を探す s7。

情報源

FAQ

dsh を Claude モデルで動かせますか?

ハーネスはモデルプラグインを通じて DeepSeek 以外のモデルも受け付けます。dsh-plugin トピックにはすでにいくつか並んでいます。ローンチの両面は別々に試せます。今のモデルで dsh を動かすか、今のハーネスで Anthropic 互換 API 経由の V4 Pro を動かすかです。

28 倍の価格差は本当ですか?

ローンチ価格では本当です。出力 100 万トークンあたり $0.87 対 $25 です。8 月 16 日からはピーク時間帯で差が約 4 倍に縮まるので、予算は後の料金表で組んでください。

SWE-bench の 80.6% を信用しないほうがいいのはなぜですか?

DeepSeek 自身の数字で、WeChat グループと ASCII 表から出てきたもので、発表ページも独立した再現もまだありません。正確かもしれませんが、DeepSeek の外で確かめた人はいません。

追記専用ログは実際に何を変えますか?

エージェントがツール呼び出し 42 回目で迷走したら、そのイベントまでセッションを再生して、モデルのコンテキストに何があったかを正確に確認できます。平らなトランスクリプトから復元する必要はありません。