AIDive

वीडियो पैक

DeepSeek Harness और V4 Pro: architecture नोट्स, कीमत तालिका, निष्कर्ष तालिका और स्रोत

10 मिनट पढ़ें

TL;DR

  • DeepSeek Harness (dsh) MIT लाइसेंस वाला coding agent है, जिसमें models, tools, sandboxes, storage, loops और UI सब plugins हैं और config में बदले जा सकते हैं। रिपॉजिटरी के 21,000 से ज़्यादा stars और 12,000 से ज़्यादा commits पहले ही हो चुके हैं।
  • सबसे मज़बूत विचार append-only session log है: भटके हुए session को transcript स्क्रॉल करने के बजाय event दर event दोबारा चलाया जा सकता है।
  • DeepSeek V4 Pro 0813 SWE-bench Verified पर करीब 80.6% का दावा करता है, जबकि Claude Opus 4.6 का 80.8% है। हर स्कोर खुद का बताया हुआ है; किसी स्वतंत्र पक्ष ने अभी तक कोई स्कोर दोहराया नहीं है।
  • लॉन्च कीमत $0.435 प्रति मिलियन input tokens और output के लिए $0.87 है। 16 अगस्त से API peak और off-peak बिलिंग पर चली जाती है और peak पर output $3.96 तक पहुँच जाता है, जो फिर भी Opus 5 से लगभग चार गुना सस्ता है।
  • dsh 0.1 developer preview है और उसका README breaking changes का वादा करता है। Tool बनाने वाले इसे इसी हफ़्ते इंस्टॉल करें, लागत घटाने वाले V4 Pro को 16 अगस्त की दरों पर किसी side project में आज़माएँ, और रोज़ Claude Code इस्तेमाल करने वाले उसी पर टिके रहें।

स्रोत क्या कहते हैं

Architecture

पूरा harness Cordis नाम के kernel पर टिका है, और आधिकारिक पेज हर क्षमता को ऐसी चीज़ बताता है जिसे harness का कोड छुए बिना config में चुना, बदला या बढ़ाया जा सकता है s8। यह Claude Code के skills और MCP servers से ज़्यादा है: Claude Code में आप agent को उसके किनारों पर बढ़ाते हैं, जबकि dsh में sandbox, session storage और खुद loop को भी नए सिरे से जोड़ा जा सकता है s1। GitHub topic dsh-plugin पर community plugins की सूची पहले से है, जिसमें ऐसे model plugins भी हैं जो harness को DeepSeek के अलावा दूसरे models पर चलाते हैं s10।

इंस्टॉलेशन एक कमांड में होता है: npx @deepseek-ai/dsh web पोर्ट 3080 पर लोकल web UI शुरू करता है, किसी account की ज़रूरत नहीं, और वही कोडबेस terminal mode भी चलाता है। पूरा रिपॉजिटरी clone करके build करने में चार pnpm कमांड लगते हैं s2।

dsh चार execution modes के साथ आता है। Standard पूरा coding agent है (file edits, shell, search, planning)। Code में model TypeScript लिखता है जो कई चरणों वाले ऑपरेशन खुद orchestrate करती है, tool calls को एक-एक करके जोड़ने के बजाय, इससे लंबे कामों में API round trips घटते हैं। Minimal agent को bash और file editor तक सीमित कर देता है, मुख्यतः सादे model को benchmark करने के लिए। Creator अपने presets बनाने के लिए है, जिसमें runtime को लाइव देखा जा सकता है s8।

Model जो कुछ देखता है वह सब append-only session log में जाता है: prompts, reasoning, tool calls, context injections। यही log harness का source of truth है, इसलिए कोई भी session event stream से resume, fork, search या replay किया जा सकता है s1।

Model

V4 Pro 0813 एक mixture-of-experts model है, जिसमें 1M-token context window, 384,000 तक output tokens, tool calls और JSON output हैं s4। DeepSeek API Anthropic API compatibility का दावा करती है, इसलिए Claude के लिए लिखा गया tool सिर्फ़ base URL और key बदलकर V4 Pro को target कर सकता है s3।

DeepSeek के अपने आँकड़े Max variant को SWE-bench Verified पर करीब 80.6% पर रखते हैं, जबकि Claude Opus 4.6 का 80.8% है, और Terminal Bench 2.1 तथा Opus 4.8 के मुकाबले कई agent benchmarks में जीत के दावे हैं। Artificial Analysis index पर V4 Pro 53 पर है, जबकि Opus 5 63 पर और Fable 5 62 पर। गति में यह 83 tokens प्रति सेकंड देता है, जहाँ Opus 5 52 देता है s5।

इनमें से किसी स्कोर को किसी तीसरे पक्ष ने दोहराया नहीं है। Benchmarks पहले DeepSeek के आधिकारिक WeChat group में घूमे, फिर एक Reddit पोस्ट में जिसे moderators ने हटा दिया, फिर Hacker News पर ASCII table के रूप में। कोई आधिकारिक घोषणा पेज नहीं है और open weights की पुष्टि नहीं हुई है, हालाँकि अप्रैल का V4 Pro और जुलाई का V4 Flash दोनों आख़िरकार Hugging Face पर आए। अब तक का इकलौता hands-on अवलोकन: एक ही drawing prompt पर तीन reasoning levels ने तीन बिल्कुल अलग नतीजे दिए, जो किसी और model में नहीं दिखा s5।

Pricing

लॉन्च पर V4 Pro की कीमत $0.435 प्रति मिलियन input tokens और $0.87 प्रति मिलियन output tokens है, और 1M context standard दर पर बिल होता है, लंबे context का कोई अतिरिक्त शुल्क नहीं s3। Claude Opus 5 $5 input और $25 output पर है, Fable 5 $10 और $50 पर, Sonnet 5 $2 और $10 पर s6। यानी V4 Pro input में Opus 5 से करीब 11 गुना और output में 28 गुना सस्ता है, और Sonnet 5 से भी 4 से 11 गुना सस्ता s3।

50,000 input tokens और 15,000 output tokens वाला एक सामान्य agent session लॉन्च दरों पर Opus 5 में करीब $0.62 और V4 Pro में $0.035 का पड़ता है। Agents के लिए छिपी हुई लाइन cache है: harness हर turn में वही context दोबारा भेजता है, इसलिए ज़्यादातर input tokens दोबारा पढ़े जाते हैं। Opus 5 पर cache hit $0.50 प्रति मिलियन s6 और DeepSeek पर $0.0036 का है, यानी 138 बनाम एक का अनुपात, ठीक वहाँ जहाँ agent सबसे ज़्यादा खर्च करता है s3।

लॉन्च के तीन दिन बाद, 16 अगस्त से, API peak और off-peak बिलिंग पर चली जाती है। Off-peak में V4 Pro $0.66 input और $1.98 output हो जाता है। Peak में, यानी 1h से 4h और 6h से 10h UTC के बीच, यह $1.32 और $3.96 है s3। Peak output लॉन्च-दिन की दर से साढ़े चार गुना है, यानी 355% की बढ़ोतरी। सबसे बुरी दर पर भी V4 Pro, Opus 5 से लगभग चार गुना सस्ता रहता है s6। Peak घंटे चीन के कामकाजी दिन से मेल खाते हैं, इसलिए cron jobs और यूरोप की रात की runs को off-peak पर रखा जा सकता है, जबकि दोपहर की लाइव coding कुछ peak slots में पड़ेगी।

प्रतिक्रिया

Hacker News पोस्ट एक दिन में 990 points पार कर गई s7। Bloomberg ने इस लॉन्च को Claude Code के लिए सीधी चुनौती बताया, जो Anthropic का harness है और Claude models से बँधा है s9।

निष्कर्ष

हिस्सा रखें, आज़माएँ या छोड़ें क्यों
dsh की plugin architecture आज़माएँ Sandbox, storage और loop सब बदले जा सकते हैं; इस समय का सबसे दिलचस्प harness design
dsh का replay होने वाला session log आज़माएँ Agent के भटकने पर transcript पढ़ने से बेहतर है event दर event replay
dsh रोज़ के काम के लिए अभी छोड़ें 0.1 developer preview, README breaking changes का वादा करता है, production में कोई track record नहीं
Side projects में V4 Pro आज़माएँ 1M context, Anthropic API compatibility, $0.0036 cache hits
Production में V4 Pro रुकें स्कोर सिर्फ़ खुद के बताए हुए, घोषणा पेज नहीं, weights की पुष्टि नहीं
आपकी spreadsheet में लॉन्च कीमत छोड़ें 16 अगस्त को ख़त्म; off-peak के लिए $0.66/$1.98 और peak के लिए $1.32/$3.96 से मॉडल करें
रोज़ के काम के लिए Claude Code रखें सत्यापित model स्कोर, परिपक्व ecosystem, flat subscription

सोमवार को यह करें

  • npx @deepseek-ai/dsh web चलाएँ, 127.0.0.1:3080 खोलें और किसी फ़ालतू repo पर Standard mode में तीस मिनट बिताएँ।
  • वही काम Code mode में चलाएँ और API round trips की गिनती Standard mode से मिलाएँ।
  • जानबूझकर कोई विफलता पैदा करें, फिर session log को उस event तक replay करें जहाँ गड़बड़ हुई और उसकी तुलना Claude Code transcript पढ़ने से करें।
  • अपनी एक मौजूदा Anthropic-compatible script को V4 Pro key के साथ DeepSeek base URL पर पॉइंट करें और जाँचें कि tool calls और JSON output अब भी चलते हैं।
  • अपना लागत अनुमान 16 अगस्त की दरों से दोबारा बनाएँ: off-peak के लिए $0.66/$1.98, peak के लिए $1.32/$3.96, और चिह्नित करें कि आपकी कौन-सी runs 1h से 4h या 6h से 10h UTC में पड़ती हैं।
  • 138 बनाम एक cache अनुपात पर भरोसा करने से पहले एक असली agent session में अपना cache-hit हिस्सा मापें।
  • GitHub topic dsh-plugin पर नज़र रखें कि कोई ऐसा model plugin आए जो आपका मौजूदा model dsh के अंदर चलाए।
  • Claude Code को default रखें और कैलेंडर रिमाइंडर लगाएँ कि जब कोई तीसरा पक्ष SWE-bench Verified का reproduction छापे तब दोबारा आकलन करें।

आगे बढ़ें

  • Quickstart पढ़ें और pnpm से dsh को source से build करें, ताकि दिखे कि web और terminal modes एक ही कोडबेस कैसे साझा करते हैं s2।
  • Plugin लिखने से पहले Cordis kernel और "Everything is a Plugin" सेक्शन पढ़ें, क्योंकि preset system में ही नए सिरे से जोड़ना होता है s8।
  • dsh-plugin topic को फ़ॉलो करें कि कौन-से community plugins पहले आते हैं: models, sandboxes या storage बताते हैं कि ecosystem किस ओर जा रहा है s10।
  • 80.6% का आँकड़ा कहीं भी उद्धृत करने से पहले benchmark संख्याओं की WeChat से Reddit से Hacker News तक की श्रृंखला पढ़ें s5।
  • अगर आप सीधे DeepSeek account के बिना V4 Pro चाहते हैं, तो 384,000 output-token की सीमा और provider mix के लिए OpenRouter listing देखें s4।
  • Claude की cache pricing वाले पेज की तुलना DeepSeek की cache hit लाइन से करें; प्रति-turn cache वही जगह है जहाँ agent बिल सबसे ज़्यादा अलग होते हैं s6।
  • शुरुआती plugin लेखकों और preview builds के बीच breaking changes की पहली रिपोर्टों के लिए Hacker News thread देखें s7।

स्रोत

  • deepseek-ai/deepseek-harness, GitHub. क्यों पढ़ें: README की चेतावनी, stars और commits की गिनती, और session-log का design यहीं है।
  • DeepSeek Harness quickstart guide, DeepSeek. क्यों पढ़ें: एक लाइन का install और चार कमांड वाला source build।
  • DeepSeek API pricing, DeepSeek. क्यों पढ़ें: लॉन्च दरें, 16 अगस्त का peak और off-peak grid, और Anthropic compatibility का नोट।
  • DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. क्यों पढ़ें: context, output और feature सीमाएँ एक कार्ड में।
  • First impressions of DeepSeek V4 Pro, Simon Willison. क्यों पढ़ें: benchmark संख्याएँ कहाँ से आईं, इसका इकलौता सावधान ब्योरा।
  • Claude model pricing, Anthropic. क्यों पढ़ें: इस pack के हर गुणक के पीछे की Opus 5, Fable 5 और Sonnet 5 दरें।
  • Hacker News discussion of the dsh launch, Hacker News. क्यों पढ़ें: practitioners की प्रतिक्रियाएँ और पहले plugin प्रयोग।
  • DeepSeek Harness home page, DeepSeek. क्यों पढ़ें: plugin model, Cordis और चार execution modes, जैसा DeepSeek उन्हें बताता है।
  • Claude Code product page, Anthropic. क्यों पढ़ें: मौजूदा खिलाड़ी की अपनी framing, feature दर feature तुलना के लिए उपयोगी।
  • GitHub topic dsh-plugin, GitHub. क्यों पढ़ें: community plugins की लाइव सूची।

FAQ

क्या मैं dsh को Claude model के साथ चला सकता हूँ?

Harness model plugins के ज़रिए DeepSeek के अलावा दूसरे models स्वीकार करता है, और dsh-plugin topic पर कुछ पहले से सूचीबद्ध हैं। लॉन्च के दोनों हिस्से अलग-अलग परखे जा सकते हैं: dsh अपने मौजूदा model के साथ, या अपना मौजूदा harness Anthropic-compatible API के ज़रिए V4 Pro के साथ।

क्या 28x कीमत का अंतर असली है?

लॉन्च दरों पर हाँ: प्रति मिलियन output tokens $0.87 बनाम $25। 16 अगस्त से peak घंटों में यह अंतर घटकर करीब 4x रह जाता है, इसलिए बजट बाद वाले grid पर बनाएँ।

80.6% SWE-bench स्कोर पर भरोसा क्यों न करें?

यह DeepSeek का अपना आँकड़ा है, जो WeChat group और ASCII table के ज़रिए सामने आया, बिना घोषणा पेज के और अब तक बिना किसी स्वतंत्र reproduction के। हो सकता है यह सही हो; DeepSeek के बाहर किसी ने इसे जाँचा नहीं है।

Append-only log व्यवहार में क्या बदलता है?

जब agent tool call 42 पर भटकता है, तो आप session को उसी event तक replay करके ठीक-ठीक देख सकते हैं कि model के context में क्या था, बजाय इसके कि उसे सपाट transcript से दोबारा जोड़ें।