TL;DR
- DeepSeek Harness (dsh) は MIT ライセンスのコーディングエージェントです。モデル、ツール、サンドボックス、ストレージ、ループ、UI のすべてがプラグインで、設定だけで差し替えられます。リポジトリはすでに 21,000 を超えるスターと 12,000 を超えるコミットを集めています。
- いちばん強いアイデアは追記専用のセッションログです。セッションが迷走したら、トランスクリプトをスクロールする代わりにイベント単位で再生できます。
- DeepSeek V4 Pro 0813 は SWE-bench Verified で約 80.6% を主張しており、Claude Opus 4.6 は 80.8% です。スコアはすべて自己申告で、第三者が再現した例はまだありません。
- ローンチ価格は入力が 100 万トークンあたり $0.435、出力が $0.87 です。8 月 16 日から API はピークとオフピークの課金に移り、ピーク時の出力は最大 $3.96 まで上がりますが、それでも Opus 5 の約 4 分の 1 です。
- dsh は 0.1 の開発者プレビューで、README は破壊的変更を予告しています。ツールを作る人は今週インストール、コストを削りたい人は 8 月 16 日の料金で V4 Pro を個人プロジェクトで試し、Claude Code を毎日使っている人はそのままで大丈夫です。
情報源が語ること
アーキテクチャ
ハーネス全体は Cordis というカーネルの上に載っています。公式ページによると、あらゆる機能は設定の中で選択、差し替え、拡張でき、ハーネスのコードには触れません s8。これは Claude Code の skills や MCP サーバーより広い範囲です。Claude Code ではエージェントの外縁を拡張しますが、dsh ではサンドボックス、セッションストレージ、ループそのものを組み替えられます s1。GitHub の dsh-plugin トピックにはコミュニティのプラグインがすでに並んでおり、DeepSeek 以外のモデルでハーネスを動かすモデルプラグインも含まれています s10。
インストールはコマンド 1 つです。npx @deepseek-ai/dsh web でポート 3080 にローカルの Web UI が立ち上がり、アカウントは不要で、同じコードベースがターミナルモードも担います。リポジトリ全体のクローンとビルドは pnpm コマンド 4 つです s2。
dsh には 4 つの実行モードがあります。Standard は完全なコーディングエージェントです (ファイル編集、シェル、検索、計画)。Code はモデルが TypeScript を書いて複数ステップの処理を自分で組み立て、ツール呼び出しを 1 つずつ連鎖させないので、長いタスクでの API 往復が減ります。Minimal はエージェントを bash とファイルエディタだけに削ぎ落とし、主に素のモデルのベンチマーク用です。Creator は独自のプリセットを作るためのもので、ランタイムをライブで確認できます s8。
モデルが見るものはすべて追記専用のセッションログに入ります。プロンプト、推論、ツール呼び出し、コンテキストへの注入です。このログがハーネスの信頼できる唯一の情報源なので、どのセッションもイベントストリームから再開、フォーク、検索、再生できます s1。
モデル
V4 Pro 0813 は Mixture-of-Experts モデルで、コンテキストウィンドウは 1M トークン、出力は最大 384,000 トークン、ツール呼び出しと JSON 出力に対応します s4。DeepSeek の API は Anthropic API 互換をうたっているため、Claude 向けに書いたツールもベース URL とキーを変えるだけで V4 Pro に向けられます s3。
DeepSeek 自身の数字では、Max バリアントは SWE-bench Verified で約 80.6%、Claude Opus 4.6 は 80.8% です。Terminal Bench 2.1 と、Opus 4.8 との比較でいくつかのエージェント系ベンチマークに勝ったとも主張しています。Artificial Analysis のインデックスでは V4 Pro は 53、Opus 5 は 63、Fable 5 は 62 です。速度は V4 Pro が毎秒 83 トークンで、Opus 5 は 52 です s5。
これらのスコアはどれも第三者に再現されていません。ベンチマークは最初に DeepSeek 公式の WeChat グループで出回り、次にモデレーターに削除された Reddit の投稿、その後 Hacker News の ASCII 表として広まりました。公式の発表ページはなく、オープンウェイトも未確認ですが、4 月の V4 Pro と 7 月の V4 Flash はどちらも最終的に Hugging Face に公開されました。実際に触った観察は今のところ 1 つだけです。同じ描画プロンプトで 3 つの推論レベルがまったく異なる 3 通りの結果を出しました。ほかのモデルでは見たことのない挙動です s5。
価格
ローンチ時の V4 Pro は入力が 100 万トークンあたり $0.435、出力が $0.87 で、1M コンテキストも標準料金で課金され、長文コンテキストの割増はありません s3。Claude Opus 5 は入力 $5、出力 $25、Fable 5 は $10 と $50、Sonnet 5 は $2 と $10 です s6。つまり V4 Pro は Opus 5 より入力で約 11 倍、出力で 28 倍安く、Sonnet 5 と比べても 4 倍から 11 倍安くなります s3。
入力 50,000 トークン、出力 15,000 トークンの典型的なエージェントセッションは、ローンチ価格で Opus 5 なら約 $0.62、V4 Pro なら $0.035 です。エージェントにとって見えにくいコストはキャッシュです。ハーネスは毎ターン同じコンテキストを再送するため、入力トークンの大半は読み直しです。キャッシュヒットは Opus 5 で 100 万トークンあたり $0.50 s6、DeepSeek では $0.0036 で、比率は 138 対 1 です。エージェントが最も多く使う場所でこれだけ差が開きます s3。
ローンチの 3 日後、8 月 16 日から API はピークとオフピークの課金に切り替わります。オフピークの V4 Pro は入力 $0.66、出力 $1.98 に上がります。ピーク (UTC の 1h から 4h、および 6h から 10h) は $1.32 と $3.96 です s3。ピーク時の出力はローンチ当日の 4.5 倍で、355% の値上げです。最悪の料金でも V4 Pro は Opus 5 の約 4 分の 1 です s6。ピーク時間帯は中国の勤務日に合わせてあるので、cron ジョブやヨーロッパの夜間実行はオフピークに寄せられますが、午後にライブでコーディングすると一部のピーク枠に当たります。
反応
Hacker News の投稿は 1 日で 990 ポイントを超えました s7。Bloomberg はこのローンチを、Claude モデルに結びついた Anthropic のハーネスである Claude Code への正面からの挑戦と報じました s9。
結論
| 項目 | 維持、試す、見送り | 理由 |
|---|---|---|
| dsh のプラグインアーキテクチャ | 試す | サンドボックス、ストレージ、ループがすべて差し替え可能で、今いちばん面白いハーネス設計 |
| dsh の再生できるセッションログ | 試す | エージェントが迷走したとき、トランスクリプトを読むよりイベント単位の再生が優れている |
| dsh をメインの作業環境にする | 今は見送り | 0.1 の開発者プレビュー、README が破壊的変更を予告、本番での実績なし |
| 個人プロジェクトでの V4 Pro | 試す | 1M コンテキスト、Anthropic API 互換、キャッシュヒット $0.0036 |
| 本番での V4 Pro | 待つ | スコアは自己申告のみ、発表ページなし、ウェイト未確認 |
| 試算表にローンチ価格を使う | 見送り | 8 月 16 日で終了。オフピーク $0.66/$1.98、ピーク $1.32/$3.96 で試算する |
| 日々の作業の Claude Code | 維持 | 検証済みのモデルスコア、成熟したエコシステム、定額プラン |
月曜にやること
-
npx @deepseek-ai/dsh webを実行し、127.0.0.1:3080 を開いて、使い捨てのリポジトリで Standard モードを 30 分試す。 - 同じタスクを Code モードに切り替え、Standard モードと API 往復の回数を比べる。
- わざと失敗させ、セッションログを問題が起きたイベントまで再生して、Claude Code のトランスクリプトを読む場合と比べる。
- Anthropic 互換の既存スクリプトを 1 つ、V4 Pro のキーを使って DeepSeek のベース URL に向け、ツール呼び出しと JSON 出力が動くか確認する。
- 8 月 16 日の料金でコスト見積もりを作り直す。オフピーク $0.66/$1.98、ピーク $1.32/$3.96 で、どの実行が UTC の 1h から 4h または 6h から 10h に当たるかを印を付ける。
- 138 対 1 のキャッシュ比率を信じる前に、実際のエージェントセッション 1 つでキャッシュヒット率を測る。
- GitHub の dsh-plugin トピックを見て、今使っているモデルを dsh 内で動かすモデルプラグインが出ないか確認する。
- Claude Code をデフォルトのままにして、第三者が SWE-bench Verified の再現結果を公開したら再評価するようカレンダーにリマインダーを入れる。
さらに読む
- クイックスタートを読み、pnpm で dsh をソースからビルドして、Web モードとターミナルモードが 1 つのコードベースをどう共有しているか確認する s2。
- プラグインを書く前に Cordis カーネルと "Everything is a Plugin" の節を調べる。組み替えが起きるのはプリセットの仕組みだからだ s8。
- dsh-plugin トピックを追い、最初に出てくるコミュニティプラグインがモデル、サンドボックス、ストレージのどれかを見る。エコシステムの向かう先がわかる s10。
- 80.6% という数字をどこかで引用する前に、WeChat から Reddit、Hacker News へと渡ったベンチマークの経路を読む s5。
- DeepSeek に直接アカウントを作らず V4 Pro を使いたいなら、OpenRouter の掲載ページで 384,000 出力トークンの上限とプロバイダーの内訳を確認する s4。
- Claude のキャッシュ料金ページと DeepSeek のキャッシュヒット行を比べる。エージェントの請求額が最も開くのはターンごとのキャッシュだ s6。
- Hacker News のスレッドを見て、初期のプラグイン作者と、プレビュービルド間の破壊的変更の最初の報告を探す s7。
情報源
- deepseek-ai/deepseek-harness, GitHub. 読む理由: README の警告、スター数とコミット数、セッションログの設計がここにある。
- DeepSeek Harness quickstart guide, DeepSeek. 読む理由: 1 行のインストールと、4 コマンドのソースビルド。
- DeepSeek API pricing, DeepSeek. 読む理由: ローンチ価格、8 月 16 日からのピーク/オフピーク料金表、Anthropic 互換の注記。
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. 読む理由: コンテキスト、出力、機能の上限が 1 枚のカードにまとまっている。
- First impressions of DeepSeek V4 Pro, Simon Willison. 読む理由: ベンチマークの数字がどこから来たかを丁寧にたどった唯一の記事。
- Claude model pricing, Anthropic. 読む理由: このパックの倍率すべての根拠になっている Opus 5、Fable 5、Sonnet 5 の料金。
- Hacker News discussion of the dsh launch, Hacker News. 読む理由: 実務者の反応と、最初のプラグイン実験。
- DeepSeek Harness home page, DeepSeek. 読む理由: DeepSeek 自身による、プラグインモデル、Cordis、4 つの実行モードの説明。
- Claude Code product page, Anthropic. 読む理由: 既存勢力の自己紹介で、機能ごとの比較に役立つ。
- GitHub topic dsh-plugin, GitHub. 読む理由: コミュニティプラグインの最新リスト。
FAQ
dsh を Claude モデルで動かせますか?
ハーネスはモデルプラグインを通じて DeepSeek 以外のモデルも受け付けます。dsh-plugin トピックにはすでにいくつか並んでいます。ローンチの両面は別々に試せます。今のモデルで dsh を動かすか、今のハーネスで Anthropic 互換 API 経由の V4 Pro を動かすかです。
28 倍の価格差は本当ですか?
ローンチ価格では本当です。出力 100 万トークンあたり $0.87 対 $25 です。8 月 16 日からはピーク時間帯で差が約 4 倍に縮まるので、予算は後の料金表で組んでください。
SWE-bench の 80.6% を信用しないほうがいいのはなぜですか?
DeepSeek 自身の数字で、WeChat グループと ASCII 表から出てきたもので、発表ページも独立した再現もまだありません。正確かもしれませんが、DeepSeek の外で確かめた人はいません。
追記専用ログは実際に何を変えますか?
エージェントがツール呼び出し 42 回目で迷走したら、そのイベントまでセッションを再生して、モデルのコンテキストに何があったかを正確に確認できます。平らなトランスクリプトから復元する必要はありません。
AIDive