AIDive

影片資料包

DeepSeek Harness 與 V4 Pro:架構筆記、價目表、結論表與來源

閱讀約 10 分鐘

TL;DR

  • DeepSeek Harness(dsh)是採用 MIT 授權的程式設計代理,模型、工具、沙箱、儲存、迴圈和 UI 全都是外掛,可以在設定裡自由替換。這個儲存庫已有超過 21,000 顆星和超過 12,000 次提交。
  • 最強的點子是只能追加的工作階段日誌:代理出軌時,你可以逐事件重播,而不是翻整份對話紀錄。
  • DeepSeek V4 Pro 0813 宣稱在 SWE-bench Verified 拿到約 80.6%,Claude Opus 4.6 是 80.8%。所有分數都是自行回報,目前沒有任何獨立機構重現過。
  • 上線定價為每百萬輸入 token $0.435、輸出 $0.87。8 月 16 日起 API 改為尖峰與離峰計費,尖峰輸出最高漲到 $3.96,仍然比 Opus 5 便宜大約四倍。
  • dsh 是 0.1 開發者預覽版,README 明說會有破壞性變更。做工具的人這週可以裝來試,想省錢的人可以在副專案上用 8 月 16 日的費率測 V4 Pro,每天用 Claude Code 的人維持現狀就好。

來源怎麼說

架構

整個 harness 建立在一個叫 Cordis 的核心之上,官方頁面說每項能力都能在設定裡選擇、替換或擴充,完全不用動 harness 的程式碼 s8。這比 Claude Code 的 skills 和 MCP 伺服器涵蓋得更廣:在 Claude Code 裡你是從邊緣擴充代理,在 dsh 裡你可以重組沙箱、工作階段儲存,甚至迴圈本身 s1。GitHub 主題 dsh-plugin 已經列出社群外掛,其中包括讓 harness 跑在 DeepSeek 以外模型上的模型外掛 s10。

安裝只要一行指令:npx @deepseek-ai/dsh web 會在連接埠 3080 啟動本機網頁 UI,不需要帳號,同一套程式碼也提供終端機模式。複製並建置完整儲存庫需要四個 pnpm 指令 s2。

dsh 內建四種執行模式。Standard 是完整的程式設計代理(檔案編輯、shell、搜尋、規劃)。Code 讓模型自己寫 TypeScript 來編排多步驟操作,而不是一個一個串接工具呼叫,長任務因此能減少 API 往返。Minimal 把代理精簡到只剩 bash 加檔案編輯器,主要用來測試模型本身的實力。Creator 用來建立自己的預設組合,並即時檢視執行環境 s8。

模型看到的一切都會寫進只能追加的工作階段日誌:提示詞、推理、工具呼叫、上下文注入。這份日誌是 harness 的唯一事實來源,所以任何工作階段都能從事件串流中恢復、分叉、搜尋或重播 s1。

模型

V4 Pro 0813 是混合專家模型,具備 1M token 的上下文視窗、最多 384,000 個輸出 token,並支援工具呼叫和 JSON 輸出 s4。DeepSeek API 標榜相容 Anthropic API,所以為 Claude 寫的工具只要換掉 base URL 和金鑰,就能改用 V4 Pro s3。

DeepSeek 自己的數字顯示,Max 版本在 SWE-bench Verified 約為 80.6%,Claude Opus 4.6 則是 80.8%,並宣稱在 Terminal Bench 2.1 和多項代理基準上勝過 Opus 4.8。在 Artificial Analysis 指數上,V4 Pro 是 53,Opus 5 是 63,Fable 5 是 62。速度方面,V4 Pro 每秒輸出 83 個 token,Opus 5 是 52 個 s5。

這些分數沒有一項被第三方重現過。基準數字最先出現在 DeepSeek 官方微信群,接著是一則被版主刪除的 Reddit 貼文,然後是 Hacker News 上的 ASCII 表格。目前沒有官方公告頁,開放權重也未確認,不過四月的 V4 Pro 和七月的 V4 Flash 最後都上了 Hugging Face。到目前為止唯一的實測觀察是:同一個繪圖提示詞,三種推理等級產生三種截然不同的結果,這是其他模型沒看過的現象 s5。

定價

上線時 V4 Pro 每百萬輸入 token $0.435,每百萬輸出 token $0.87,1M 上下文以標準費率計費,沒有長上下文加價 s3。Claude Opus 5 是輸入 $5、輸出 $25,Fable 5 是 $10 和 $50,Sonnet 5 是 $2 和 $10 s6。換算下來,V4 Pro 的輸入比 Opus 5 便宜約 11 倍,輸出便宜 28 倍,比 Sonnet 5 也還便宜 4 到 11 倍 s3。

一個典型的代理工作階段,50,000 個輸入 token 加 15,000 個輸出 token,用上線費率計算,在 Opus 5 上約 $0.62,在 V4 Pro 上約 $0.035。代理最隱形的一項是快取:harness 每一輪都會重送同樣的上下文,所以大部分輸入 token 都是重複讀取。快取命中在 Opus 5 上是每百萬 $0.50 s6,在 DeepSeek 是 $0.0036,比例達 138 比 1,而且正好落在代理花最多錢的地方 s3。

從上線三天後的 8 月 16 日起,API 改成尖峰與離峰計費。離峰時 V4 Pro 漲到輸入 $0.66、輸出 $1.98。尖峰時段(UTC 1 點到 4 點、6 點到 10 點)是 $1.32 和 $3.96 s3。尖峰輸出是上線首日費率的四點五倍,漲幅 355%。即使在最糟的費率下,V4 Pro 仍比 Opus 5 便宜近四倍 s6。尖峰時段對應中國的上班時間,所以排程任務和歐洲的夜間執行可以排在離峰,而下午的即時寫程式則會碰到部分尖峰時段。

反應

Hacker News 的貼文一天內突破 990 分 s7。Bloomberg 把這次發表描述為對 Claude Code 的直接挑戰,而 Claude Code 是 Anthropic 綁定 Claude 模型的 harness s9。

結論

項目 保留、試試或跳過 原因
dsh 外掛架構 試試 沙箱、儲存和迴圈都能替換,是目前最有意思的 harness 設計
dsh 可重播的工作階段日誌 試試 代理出軌時,逐事件重播比讀對話紀錄好用
把 dsh 當日常主力 暫時跳過 0.1 開發者預覽版,README 明說會有破壞性變更,沒有正式環境的紀錄
副專案用 V4 Pro 試試 1M 上下文、相容 Anthropic API、快取命中 $0.0036
正式環境用 V4 Pro 等等 分數只有自行回報,沒有公告頁,權重未確認
把上線定價放進試算表 跳過 8 月 16 日到期,請用離峰 $0.66/$1.98、尖峰 $1.32/$3.96 來估算
日常工作用 Claude Code 保留 模型分數有驗證、生態系成熟、固定月費訂閱

週一要做的事

  • 執行 npx @deepseek-ai/dsh web,開啟 127.0.0.1:3080,在一個可以丟掉的儲存庫裡用 Standard 模式玩三十分鐘。
  • 同一個任務改用 Code 模式,和 Standard 模式比較 API 往返次數。
  • 故意讓它失敗,然後把工作階段日誌重播到出錯的那個事件,再和閱讀 Claude Code 對話紀錄的體驗比較。
  • 把一支現有的相容 Anthropic 的腳本指向 DeepSeek 的 base URL,換上 V4 Pro 金鑰,確認工具呼叫和 JSON 輸出仍然正常。
  • 用 8 月 16 日的費率重算成本:離峰 $0.66/$1.98,尖峰 $1.32/$3.96,並標出你的哪些執行落在 UTC 1 點到 4 點或 6 點到 10 點。
  • 在相信 138 比 1 的快取比例之前,先量一次真實代理工作階段的快取命中占比。
  • 關注 GitHub 的 dsh-plugin 主題,看有沒有能在 dsh 裡跑你目前所用模型的模型外掛。
  • 繼續以 Claude Code 為預設,並設一個行事曆提醒,等第三方發表 SWE-bench Verified 的重現結果再重新評估。

延伸閱讀

  • 閱讀快速入門,並用 pnpm 從原始碼建置 dsh,看看網頁和終端機模式如何共用同一套程式碼 s2。
  • 在寫外掛之前,先研究 Cordis 核心和「Everything is a Plugin」那一節,重組就發生在預設組合系統裡 s8。
  • 追蹤 dsh-plugin 主題,看哪些社群外掛最先出現:模型、沙箱或儲存,會告訴你生態系往哪裡走 s10。
  • 在任何地方引用 80.6% 這個數字之前,先讀一下基準數字從微信到 Reddit 再到 Hacker News 的流傳過程 s5。
  • 如果想不開 DeepSeek 帳號就用 V4 Pro,可以到 OpenRouter 的頁面確認 384,000 輸出 token 的上限和供應商組合 s4。
  • 把 Claude 的快取定價頁和 DeepSeek 的快取命中項目放在一起比較,每一輪的快取正是代理帳單差距最大的地方 s6。
  • 瀏覽 Hacker News 討論串,找早期的外掛作者,以及預覽版之間破壞性變更的第一批回報 s7。

來源

FAQ

我可以用 Claude 模型跑 dsh 嗎?

這個 harness 透過模型外掛接受 DeepSeek 以外的模型,dsh-plugin 主題下已經列出一些。這次發表的兩半可以分開測試:用你目前的模型跑 dsh,或是用你目前的 harness 透過相容 Anthropic 的 API 接 V4 Pro。

28 倍的價差是真的嗎?

以上線費率來說是真的:每百萬輸出 token $0.87 對 $25。從 8 月 16 日起,尖峰時段價差縮小到大約 4 倍,所以預算請依後來的價目表編。

為什麼不該相信 80.6% 的 SWE-bench 分數?

這是 DeepSeek 自己的數字,經由微信群和 ASCII 表格流出,沒有公告頁,目前也沒有獨立重現。它可能是準確的,但 DeepSeek 以外沒有人查證過。

只能追加的日誌在實務上改變了什麼?

當代理在第 42 次工具呼叫出軌時,你可以把工作階段重播到那個事件,確切看到模型當時的上下文裡有什麼,而不必從扁平的對話紀錄裡重建。