TL;DR
- DeepSeek Harness (dsh) là một coding agent giấy phép MIT, trong đó model, tool, sandbox, storage, loop và UI đều là plugin mà bạn thay đổi ngay trong config. Repository hiện đã có hơn 21,000 sao và hơn 12,000 commit.
- Ý tưởng mạnh nhất là session log chỉ ghi thêm (append-only): khi một phiên chạy lệch hướng, bạn phát lại từng event thay vì cuộn qua cả đoạn transcript.
- DeepSeek V4 Pro 0813 tự công bố khoảng 80.6% trên SWE-bench Verified, so với 80.8% của Claude Opus 4.6. Mọi điểm số đều do chính DeepSeek công bố; chưa có bên độc lập nào tái hiện được con số nào.
- Giá ra mắt là $0.435 cho mỗi triệu token input và $0.87 cho output. Từ ngày 16 tháng 8, API chuyển sang tính giá giờ cao điểm và thấp điểm, giá output lên tới $3.96 vào giờ cao điểm, vẫn rẻ hơn Opus 5 khoảng bốn lần.
- dsh mới ở bản developer preview 0.1 và README đã nói trước sẽ có breaking change. Người làm tool nên cài trong tuần này, người muốn cắt chi phí nên thử V4 Pro trên một side project với bảng giá ngày 16 tháng 8, còn người dùng Claude Code hằng ngày thì cứ giữ nguyên.
Các nguồn nói gì
Kiến trúc
Toàn bộ harness dựa trên một kernel tên Cordis, và trang chính thức mô tả mọi khả năng là thứ bạn có thể chọn, thay thế hoặc mở rộng trong config mà không đụng tới code của harness s8. Phạm vi đó rộng hơn skills và MCP server của Claude Code: ở Claude Code bạn mở rộng agent từ phía rìa, còn ở dsh bạn có thể tái cấu trúc cả sandbox, session storage và chính loop s1. Topic dsh-plugin trên GitHub đã liệt kê các plugin cộng đồng, gồm cả plugin model cho phép harness chạy với những model không phải của DeepSeek s10.
Cài đặt chỉ cần một lệnh: npx @deepseek-ai/dsh web khởi động web UI cục bộ ở cổng 3080, không cần tài khoản, và cùng code base đó phục vụ chế độ terminal. Clone và build toàn bộ repository mất bốn lệnh pnpm s2.
dsh có bốn chế độ thực thi. Standard là coding agent đầy đủ (sửa file, shell, tìm kiếm, lập kế hoạch). Code cho model viết TypeScript để tự điều phối các thao tác nhiều bước thay vì nối từng tool call một, giúp giảm số lượt gọi API ở các task dài. Minimal rút agent xuống chỉ còn bash cộng một trình sửa file, chủ yếu để benchmark model trần. Creator dùng để dựng preset riêng, có kiểm tra runtime trực tiếp s8.
Mọi thứ model nhìn thấy đều đi vào một session log chỉ ghi thêm: prompt, reasoning, tool call, phần context được chèn vào. Log đó là nguồn sự thật của harness, nên bất kỳ phiên nào cũng có thể được tiếp tục, fork, tìm kiếm hoặc phát lại từ luồng event s1.
Model
V4 Pro 0813 là model mixture-of-experts với context window 1M token, tối đa 384,000 token output, hỗ trợ tool call và output JSON s4. API của DeepSeek quảng cáo tương thích với Anthropic API, nên một tool viết cho Claude có thể nhắm sang V4 Pro chỉ bằng cách đổi base URL và key s3.
Số liệu của chính DeepSeek đặt biến thể Max ở khoảng 80.6% trên SWE-bench Verified, so với 80.8% của Claude Opus 4.6, kèm các chiến thắng được tuyên bố trên Terminal Bench 2.1 và vài benchmark agent so với Opus 4.8. Trên chỉ số Artificial Analysis, V4 Pro đạt 53 trong khi Opus 5 là 63 và Fable 5 là 62. Về tốc độ, nó xuất 83 token mỗi giây, còn Opus 5 là 52 s5.
Chưa có điểm nào trong số đó được bên thứ ba tái hiện. Các benchmark lần đầu lan truyền trong nhóm WeChat chính thức của DeepSeek, rồi trong một bài Reddit bị moderator gỡ, rồi dưới dạng bảng ASCII trên Hacker News. Không có trang thông báo chính thức và open weights chưa được xác nhận, dù V4 Pro hồi tháng 4 và V4 Flash hồi tháng 7 cuối cùng đều lên Hugging Face. Quan sát thực tế duy nhất cho tới nay: ba mức reasoning cho ba kết quả hoàn toàn khác nhau trên cùng một prompt vẽ hình, điều chưa thấy ở model nào khác s5.
Giá
Lúc ra mắt, V4 Pro có giá $0.435 mỗi triệu token input và $0.87 mỗi triệu token output, và context 1M được tính theo giá chuẩn, không phụ phí long-context s3. Claude Opus 5 là $5 input và $25 output, Fable 5 là $10 và $50, Sonnet 5 là $2 và $10 s6. Như vậy V4 Pro rẻ hơn Opus 5 khoảng 11 lần ở input và 28 lần ở output, và vẫn rẻ hơn Sonnet 5 từ 4 đến 11 lần s3.
Một phiên agent điển hình với 50,000 token input và 15,000 token output tốn khoảng $0.62 trên Opus 5 và $0.035 trên V4 Pro theo giá ra mắt. Khoản ẩn của agent là cache: harness gửi lại cùng một context ở mỗi lượt, nên phần lớn token input là đọc lại. Một cache hit tốn $0.50 mỗi triệu trên Opus 5 s6 và $0.0036 trên DeepSeek, tỷ lệ 138 trên 1, đúng ở chỗ agent tiêu nhiều nhất s3.
Từ ngày 16 tháng 8, ba ngày sau khi ra mắt, API chuyển sang tính giá giờ cao điểm và thấp điểm. Giờ thấp điểm, V4 Pro tăng lên $0.66 input và $1.98 output. Giờ cao điểm, từ 1h đến 4h và từ 6h đến 10h UTC, là $1.32 và $3.96 s3. Output giờ cao điểm gấp bốn lần rưỡi giá ngày ra mắt, tăng 355%. Ngay cả ở mức giá tệ nhất, V4 Pro vẫn rẻ hơn Opus 5 gần bốn lần s6. Giờ cao điểm trùng với ngày làm việc ở Trung Quốc, nên cron job và các lần chạy ban đêm theo giờ châu Âu có thể nhắm vào giờ thấp điểm, còn việc code trực tiếp buổi chiều sẽ chạm vào một số khung cao điểm.
Phản hồi
Bài đăng trên Hacker News vượt 990 điểm chỉ trong một ngày s7. Bloomberg mô tả đợt ra mắt này là lời thách thức trực tiếp với Claude Code, harness của Anthropic gắn với các model Claude s9.
Kết luận
| Hạng mục | Giữ, thử hay bỏ | Lý do |
|---|---|---|
| Kiến trúc plugin của dsh | Thử | Sandbox, storage và loop đều thay được; thiết kế harness thú vị nhất hiện nay |
| Session log phát lại được của dsh | Thử | Phát lại từng event tốt hơn đọc transcript khi agent đi lệch |
| dsh làm công cụ chính hằng ngày | Tạm bỏ qua | Bản developer preview 0.1, README báo trước sẽ có breaking change, chưa có thành tích production |
| V4 Pro trên side project | Thử | Context 1M, tương thích Anthropic API, cache hit $0.0036 |
| V4 Pro trong production | Chờ | Điểm số chỉ do chính hãng công bố, không có trang thông báo, weights chưa xác nhận |
| Giá ra mắt trong bảng tính của bạn | Bỏ | Hết hạn ngày 16 tháng 8; hãy tính theo $0.66/$1.98 giờ thấp điểm và $1.32/$3.96 giờ cao điểm |
| Claude Code cho công việc hằng ngày | Giữ | Điểm model đã được kiểm chứng, hệ sinh thái trưởng thành, thuê bao cố định |
Việc cần làm vào thứ Hai
- Chạy
npx @deepseek-ai/dsh web, mở 127.0.0.1:3080 và dành ba mươi phút ở chế độ Standard trên một repo thử nghiệm. - Chuyển cùng task đó sang chế độ Code và đếm số lượt gọi API so với chế độ Standard.
- Cố tình gây lỗi, rồi phát lại session log tới event nơi mọi thứ hỏng và so sánh với việc đọc một transcript của Claude Code.
- Trỏ một script tương thích Anthropic hiện có sang base URL của DeepSeek với key V4 Pro và kiểm tra tool call cùng output JSON vẫn chạy.
- Dựng lại ước tính chi phí theo bảng giá ngày 16 tháng 8: $0.66/$1.98 giờ thấp điểm, $1.32/$3.96 giờ cao điểm, và đánh dấu những lần chạy nào rơi vào 1h đến 4h hoặc 6h đến 10h UTC.
- Đo tỷ lệ cache hit trên một phiên agent thật trước khi tin vào tỷ lệ cache 138 trên 1.
- Theo dõi topic dsh-plugin trên GitHub để tìm plugin model chạy được model bạn đang dùng bên trong dsh.
- Giữ Claude Code làm mặc định và đặt lời nhắc lịch để đánh giá lại khi có bên thứ ba công bố bản tái hiện SWE-bench Verified.
Đọc thêm
- Đọc quickstart và build dsh từ source bằng pnpm để thấy chế độ web và terminal dùng chung một code base như thế nào s2.
- Nghiên cứu kernel Cordis và phần "Everything is a Plugin" trước khi viết plugin, vì hệ thống preset là nơi diễn ra việc tái cấu trúc s8.
- Theo dõi topic dsh-plugin để xem plugin cộng đồng nào xuất hiện trước: model, sandbox hay storage cho biết hệ sinh thái đang đi về đâu s10.
- Đọc chuỗi truyền tay từ WeChat sang Reddit rồi Hacker News của các con số benchmark trước khi trích dẫn con số 80.6% ở bất cứ đâu s5.
- Xem trang OpenRouter để biết mức trần 384,000 token output và danh sách provider nếu bạn muốn dùng V4 Pro mà không cần tài khoản DeepSeek trực tiếp s4.
- So sánh trang giá cache của Claude với dòng cache hit của DeepSeek; cache theo từng lượt là nơi hóa đơn agent chênh nhau nhiều nhất s6.
- Lướt thread Hacker News để tìm những tác giả plugin đầu tiên và các báo cáo đầu tiên về breaking change giữa các bản preview s7.
Nguồn
- deepseek-ai/deepseek-harness, GitHub. Vì sao nên đọc: cảnh báo trong README, số sao và số commit, cùng thiết kế session log đều nằm ở đây.
- DeepSeek Harness quickstart guide, DeepSeek. Vì sao nên đọc: cách cài một dòng lệnh và cách build từ source bằng bốn lệnh.
- DeepSeek API pricing, DeepSeek. Vì sao nên đọc: giá ra mắt, bảng giá cao điểm và thấp điểm từ ngày 16 tháng 8, và ghi chú về khả năng tương thích Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Vì sao nên đọc: giới hạn context, output và tính năng gói gọn trong một thẻ.
- First impressions of DeepSeek V4 Pro, Simon Willison. Vì sao nên đọc: bài duy nhất truy nguồn cẩn thận các con số benchmark đến từ đâu.
- Claude model pricing, Anthropic. Vì sao nên đọc: mức giá Opus 5, Fable 5 và Sonnet 5 đứng sau mọi hệ số nhân trong bộ tài liệu này.
- Hacker News discussion of the dsh launch, Hacker News. Vì sao nên đọc: phản ứng của người làm thực tế và những thử nghiệm plugin đầu tiên.
- DeepSeek Harness home page, DeepSeek. Vì sao nên đọc: mô hình plugin, Cordis và bốn chế độ thực thi theo cách DeepSeek mô tả.
- Claude Code product page, Anthropic. Vì sao nên đọc: cách đối thủ đương nhiệm tự mô tả mình, hữu ích để so sánh từng tính năng.
- GitHub topic dsh-plugin, GitHub. Vì sao nên đọc: danh sách trực tiếp các plugin cộng đồng.
FAQ
Tôi có chạy dsh với model Claude được không?
Harness chấp nhận các model không phải của DeepSeek thông qua plugin model, và topic dsh-plugin đã liệt kê một vài cái. Hai nửa của đợt ra mắt có thể thử riêng: dsh với model hiện tại của bạn, hoặc harness hiện tại của bạn với V4 Pro qua API tương thích Anthropic.
Chênh lệch giá 28x có thật không?
Theo giá ra mắt thì có: $0.87 so với $25 mỗi triệu token output. Từ ngày 16 tháng 8, khoảng cách thu hẹp còn khoảng 4x vào giờ cao điểm, nên hãy lập ngân sách theo bảng giá sau.
Vì sao không nên tin điểm SWE-bench 80.6%?
Đó là con số của chính DeepSeek, xuất hiện qua một nhóm WeChat và một bảng ASCII, không có trang thông báo và chưa có bản tái hiện độc lập. Có thể nó chính xác; chỉ là chưa ai ngoài DeepSeek kiểm tra.
Append-only log thay đổi điều gì trong thực tế?
Khi agent đi lệch ở tool call thứ 42, bạn phát lại phiên tới đúng event đó và thấy chính xác model có gì trong context, thay vì dựng lại từ một transcript phẳng.
AIDive