AIDive

DeepSeek 出手打 Claude Code:Harness + V4 Pro

AIDive · 發布

編碼 agentAI 模型

DeepSeek 同一天出手兩次

2026 年 8 月 13 日,DeepSeek 一次推出兩項產品。DeepSeek Harness 是一個 MIT 授權的開源程式代理,直接瞄準 Claude Code — Bloomberg 直白地形容為對 Anthropic 的挑戰。同一天,DeepSeek V4 Pro(build 0813)進入正式供應,具備一百萬 token 的 context window,輸入每百萬 token 不到半美元。

市場立刻注意到了。模型的 Hacker News 貼文一天內衝破 990 分,Harness 的 repository 已經超過 21,000 顆 GitHub 星。一個工具加一個模型、同一天發布 — 這正是造就 Claude Code 的公式。

我們用一行 npx 指令裝上 DeepSeek Harness,讀完文件,把 DeepSeek 公布的每個數字都走過一遍。這篇文章談「一切皆外掛」的架構、在基準測試與價格上 V4 Pro 對 Claude 的成色,以及誰該搬家、誰該再等。

代理 harness 到底是什麼

harness 就是包住模型的整套機制,讓它真的能在你的電腦上工作:串起呼叫的迴圈、模型被允許使用的工具、情境管理、權限,以及介面。模型決定,harness 執行 — 這句短短的話就是全部的分工。

當你在 Claude Code 打下指令,模型從不自己碰你的磁碟。它請 harness 讀檔案、跑指令,或啟動測試;harness 檢查是否允許,執行之後把結果交回去。每個程式代理都是這樣運作的。

Claude Code 是 Anthropic 接上 Claude 模型的 harness,Codex 是 OpenAI 接上 GPT 的 harness。DeepSeek 從沒有官方版 — 模型跑在別人的工具裡。這就是 8 月 13 日改變的事:DeepSeek 不再只賣引擎,現在賣整輛車。

一切皆外掛:dsh 內部

DeepSeek Harness — 文件簡稱它 dsh — 建立在一個核心想法上:一切皆外掛。這不是行銷口號,是真正的架構。模型是外掛。工具是外掛。技能、工作階段、沙箱、儲存、迴圈、排程,連介面都是外掛。官方文件說明,你可以在設定裡挑選、替換或擴充任何能力,不必動 harness 的原始碼。

底層全部立在 Cordis 上,那是 DeepSeek 在一篇可組合性論文裡描述的核心。專案有真正的份量:超過 12,000 次提交、一個 Discord 伺服器,以及 GitHub 上專屬的 dsh-plugin 標籤,社群外掛已經開始出現。實際結果是 harness 沒有凍住的核心 — 你想換沙箱、換工作階段儲存或換模型,就改設定,不是改程式碼。

安裝只要一行指令:npx @deepseek-ai/dsh web 會在本機 3080 埠打開網頁介面。開始不用帳號、不用安裝程式 — npm 套件就夠了。如果你偏好從原始碼建置,整個 repo 可以 clone,用 pnpm 四行指令編譯。

dsh 內建四種執行模式,架構上的賭注就在這裡顯現:

  • Standard 模式是完整程式代理:檔案編輯、shell、搜尋與規劃 — 直接對應 Claude Code。
  • Code 模式讓模型產生 TypeScript 來自行編排多步驟操作,而不是一個一個串工具呼叫,在長任務上省下往返、延遲與 token。
  • Minimal 模式把代理縮到 bash 加一個檔案編輯器,主要用來測純模型。
  • Creator 模式用來打造自己的預設組合,可以檢視執行期,即時做外掛實驗。

最後一塊是可追溯性。模型看到的一切都寫進一份只可追加的工作階段日誌 — 只能往後加,永遠不能改寫歷史。那份日誌是 harness 的事實來源,你可以從中續跑、分支、搜尋,或重播任何一次工作階段。當你的代理在第 42 次工具呼叫翻車,你不用翻逐字稿;你把工作階段重播到轉折點,精準看到模型看到了什麼。這是作業系統式的思考,不是又一層 API 包裝。

V4 Pro:harness 背後的引擎

DeepSeek V4 Pro,build 0813,是離開預覽、進入正式供應的模型,已經能透過 DeepSeek API 或 OpenRouter 使用。它是 mixture-of-experts 模型:每個 token 只會啟動網路的一部分,所以你用小模型的算力成本拿到大模型的能力。規格表:一百萬 token 的 context window、最多 384,000 輸出 token、工具呼叫,以及 JSON 輸出。

有一個細節在這裡加倍重要:DeepSeek API 主打 Anthropic API 相容。一個為 Claude 寫的工具,只要換 base URL 和金鑰就能和 V4 Pro 對話。

在基準測試上,DeepSeek 宣稱分數逼近頂端:

基準測試 DeepSeek V4 Pro Claude
SWE-bench Verified 約 80.6%(Max 版本) 80.8%(Opus 4.6)
Terminal Bench 2.1 宣稱勝出 Opus 4.8
Artificial Analysis 指數 53 63(Opus 5)
速度(token/秒) 83 52

但有個細節會改變你讀這些數字的方式:沒有任何一個分數被第三方複現過。流通的一切都追回 DeepSeek,或抄自 DeepSeek 的文章。Simon Willison 指出,這些基準測試最早在 DeepSeek 官方 WeChat 群裡流傳,被抄進一則被版主刪掉的 Reddit 貼文,最後變成 Hacker News 上的 ASCII 表格。他也提到沒有官方公告頁,開放權重也未獲確認 — 雖然四月的 V4 Pro 和七月的 V4 Flash 都上了 Hugging Face,所以釋出看來有可能。他的鵜鶘測試至少顯示了不尋常的地方:三種推理層級產生了三隻天差地遠的鵜鶘。這模型大概很好;只是眼下,說這話的只有 DeepSeek。

與 Claude 的價格落差

價格是 DeepSeek 下手最重的地方。發布時,V4 Pro 透過 DeepSeek API 收每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元。

模型 輸入(美元/百萬 token) 輸出(美元/百萬 token)
DeepSeek V4 Pro(發布價) 0.435 0.87
Claude Sonnet 5 2 10
Claude Opus 5 5 25
Claude Fable 5 10 50

以發布價計,V4 Pro 在輸入上比 Opus 5 便宜約 11 倍,在輸出上便宜 28 倍。連 Anthropic 的省錢選項 Sonnet 5 都還貴上四到十一倍。

以一次典型的程式代理工作階段(輸入 50,000 token、輸出 15,000)來算,Opus 5 大約要 0.62 美元;V4 Pro 以發布價約 0.035 美元。對代理來說,隱藏的支出是快取,因為 harness 每一輪迴圈都會重送同樣的情境:一次快取命中在 Opus 5 是每百萬 0.50 美元,在 DeepSeek 約 0.0036 美元。

只是這個地板價有到期日,而且很近。從 8 月 16 日起 — 也就是發布後三天 — API 改成尖峰與離峰計費:

費率時段 輸入(美元/百萬) 輸出(美元/百萬)
發布(至 8 月 16 日) 0.435 0.87
離峰 0.66 1.98
尖峰(UTC 1–4 點、6–10 點) 1.32 3.96

這禮拜大家在比的價格至少漲一半,輸出更是漲到四倍以上。就算是最差的費率,V4 Pro 仍比 Opus 5 便宜近四倍,所以論點站得住 — 但 Hacker News 上流傳的數字是三天後結束的促銷。時段對代理也很重要:尖峰跟著中國的上班日,所以夜間 cron 能吃到離峰,下午寫程式則會吃到尖峰時段。

它能取代 Claude Code 嗎?

架構上,dsh 有 Claude Code 沒有的論據。當你的代理出軌,Claude Code 讓你翻逐字稿;dsh 讓你逐一事件重播那次工作階段。外掛系統比 Anthropic 的技能和 MCP 伺服器走得更遠,因為它也涵蓋沙箱、儲存,以及迴圈本身 — 在 Claude Code 你擴充代理,在 dsh 你可以重新組裝它。harness 也接受 DeepSeek 以外的模型,而 Claude Code 仍鎖在 Claude,除非你走非官方代理。

另一邊,Claude Code 有成熟度,而且份量很重:數萬個團隊、數個月的正式使用,技能、hooks 與整合的龐大生態系,分數經獨立評測者驗證過的模型,以及讓你免於帳單驚嚇的訂閱制存取,而 dsh 每個 token 都計費。

dsh 是 0.1 版的開發者預覽,README 用大寫寫著會有破壞相容性的變更。但 Anthropic API 相容代表你其實不必選邊站:保留你的 harness,把部分流程指向 V4 Pro,或用你已經在用的模型試 dsh。dsh 是 Claude Code 遇過最有說服力的挑戰者 — 而且是一個 0.1 的挑戰者對上在位的冠軍。

搬家前的陷阱

在解除安裝任何東西前,有三個限制要衡量。

第一,dsh 是開發者預覽,會無預警破壞相容性,你這禮拜寫的外掛下個月可能載不進來。今天把日常流程建在上面,就是同意經常修它。

第二,V4 Pro 的每個基準都是自行申報。沒有獨立複現,沒有公告頁,數字冒自一個 WeChat 群。它們也許準確,但 DeepSeek 之外還沒有人知道。

第三,造成話題的價格是借來的時間。從 8 月 16 日起,時段計費把輸出推到尖峰每百萬 3.96 美元 — 是發布當天價格的四倍半。dsh 給你對代理架構的完全自由,卻幾乎沒有保證一個月後什麼還成立。如果你的代理堆疊在跑你的生意,這週不是搬家的時候。

所以,搬還是不搬?

我們用了一天後的看法可以歸成三種人。如果你在做 harness 或代理工具,這禮拜就裝 dsh:全外掛架構和可重播的日誌是現在最有意思的兩個想法,一行 npx 指令就能讓你有立場。如果你只是想讓代理任務的 API 帳單小一點,在側邊專案上測 V4 Pro — 但用 8 月 16 日的費率算,並在改動正式環境前等分數的獨立確認。

如果 Claude Code 撐著你每天的工作,就留著。這次發布沒有任何理由讓你從能用的工具換到一個預告會壞掉的 0.1。好消息是,這波攻擊逼所有人動起來:不論你用哪個代理,它的價格現在真有機會下降。

來源

常見問題

DeepSeek Harness(dsh)是什麼?
DeepSeek Harness,簡稱 dsh,是 DeepSeek 於 2026 年 8 月 13 日以 MIT 授權釋出的開源程式代理。它是 DeepSeek 版的 Claude Code,建立在「一切皆外掛」的架構上,模型、工具、沙箱、儲存,連介面都能在設定裡替換。
代理 harness 是什麼?
harness 是包住 AI 模型、讓它能在你電腦上工作的整套機制:串起呼叫的迴圈、模型可用的工具、情境管理、權限與介面。模型決定,harness 執行 — Claude Code 是 Anthropic 給 Claude 的 harness,Codex 是 OpenAI 給 GPT 的 harness。
怎麼安裝 DeepSeek Harness?
執行 `npx @deepseek-ai/dsh web`,網頁介面就會在本機 3080 埠打開。開始不需要帳號或安裝程式,repo 也能用 pnpm 四行指令從原始碼建置。
DeepSeek V4 Pro 比 Claude 好嗎?
DeepSeek 宣稱接近平手:SWE-bench Verified 約 80.6% 對上 Claude Opus 4.6 的 80.8%,速度是每秒 83 token 對 52,不過 Artificial Analysis 指數上 Opus 5 以 63 比 53 領先。這些分數都還沒有被獨立複現 — 所有公布的數字都追回 DeepSeek 自己。
DeepSeek V4 Pro 比 Claude 便宜多少?
以發布價計(輸入每百萬 0.435 美元、輸出 0.87 美元),V4 Pro 輸入約為 Claude Opus 5 的十一分之一、輸出約二十八分之一。從 2026 年 8 月 16 日起,尖峰/離峰計費把價格拉到輸入 0.66–1.32 美元、輸出 1.98–3.96 美元,即使在最差費率下仍約為 Opus 5 的四分之一。
我該從 Claude Code 換到 DeepSeek Harness 嗎?
日常正式工作還不用。dsh 是 0.1 開發者預覽,README 警告會有破壞相容性的變更,而 V4 Pro 的基準也未經驗證。如果你在做代理工具,值得裝來看看;而 V4 Pro 因為 Anthropic API 相容,值得在側邊專案上測試。

相關影片