AIDive

Video paketi

DeepSeek Harness ve V4 Pro: mimari notları, fiyat tablosu, karar tablosu ve kaynaklar

10 dk okuma

TL;DR

  • DeepSeek Harness (dsh), modellerin, araçların, sandbox'ların, depolamanın, döngülerin ve arayüzün hepsinin config'de değiştirebildiğiniz plugin olduğu, MIT lisanslı bir kodlama ajanıdır. Depo şimdiden 21,000'den fazla yıldız ve 12,000'den fazla commit sayıyor.
  • En güçlü fikir yalnızca eklemeli oturum günlüğü: yoldan çıkmış bir oturumu transkriptte kaydırmak yerine olay olay yeniden oynatırsınız.
  • DeepSeek V4 Pro 0813, SWE-bench Verified'da yaklaşık %80.6 iddia ediyor; Claude Opus 4.6 için bu değer %80.8. Tüm skorlar kendi bildirimi; bağımsız biri henüz hiçbirini yeniden üretmedi.
  • Lansman fiyatı milyon girdi token'ı başına $0.435, çıktı için $0.87. 16 Ağustos'tan itibaren API, yoğun ve yoğun olmayan saat faturalamasına geçiyor ve çıktı yoğun saatte $3.96'ya kadar çıkıyor; bu yine de Opus 5'ten kabaca dört kat ucuz.
  • dsh, README'sinde kırıcı değişiklikler vaat eden 0.1 sürümlü bir developer preview. Araç geliştiriciler bu hafta kursun, maliyet kısmak isteyenler V4 Pro'yu 16 Ağustos fiyatlarıyla bir yan projede denesin, her gün Claude Code kullananlar olduğu yerde kalsın.

Kaynaklar ne diyor

Mimari

Harness'in tamamı Cordis adlı bir çekirdeğe dayanıyor ve resmi sayfa her yeteneği, harness koduna dokunmadan yapılandırmada seçebileceğiniz, değiştirebileceğiniz veya genişletebileceğiniz bir şey olarak tanımlıyor s8. Bu, Claude Code'un skills ve MCP sunucularından daha kapsamlı: Claude Code'da ajanı kenarlarından genişletirsiniz, dsh'de sandbox'ı, oturum depolamasını ve döngünün kendisini yeniden kurabilirsiniz s1. dsh-plugin adlı bir GitHub konusu şimdiden topluluk plugin'lerini listeliyor; bunların arasında harness'i DeepSeek dışındaki modellerle çalıştıran model plugin'leri de var s10.

Kurulum tek komut: npx @deepseek-ai/dsh web, 3080 portunda yerel bir web arayüzü başlatır, hesap gerekmez ve aynı kod tabanı terminal modunu da çalıştırır. Tüm depoyu klonlayıp derlemek dört pnpm komutu tutuyor s2.

dsh dört çalıştırma modu sunuyor. Standard tam bir kodlama ajanı (dosya düzenleme, shell, arama, planlama). Code, modelin araç çağrılarını tek tek zincirlemek yerine çok adımlı işlemleri kendi yazdığı TypeScript ile yönetmesini sağlar ve uzun görevlerde API gidiş gelişlerini azaltır. Minimal, ajanı yalnızca bash ve bir dosya düzenleyiciye indirger; esas olarak çıplak modeli ölçmek için. Creator, canlı çalışma zamanı incelemesiyle kendi preset'lerinizi kurmak içindir s8.

Modelin gördüğü her şey yalnızca eklemeli bir oturum günlüğüne girer: prompt'lar, akıl yürütme, araç çağrıları, bağlam enjeksiyonları. Bu günlük harness'in tek doğruluk kaynağıdır; bu yüzden her oturum olay akışından sürdürülebilir, çatallanabilir, aranabilir veya yeniden oynatılabilir s1.

Model

V4 Pro 0813, 1M token bağlam penceresi, en fazla 384,000 çıktı token'ı, araç çağrıları ve JSON çıktısı olan bir mixture-of-experts modeli s4. DeepSeek API'si Anthropic API uyumluluğu ilan ediyor; yani Claude için yazılmış bir araç, base URL ve anahtar değiştirilerek V4 Pro'yu hedefleyebilir s3.

DeepSeek'in kendi rakamları Max varyantını SWE-bench Verified'da yaklaşık %80.6'ya koyuyor; Claude Opus 4.6 için bu %80.8. Ayrıca Terminal Bench 2.1'de ve Opus 4.8'e karşı birkaç ajan benchmark'ında iddia edilen üstünlükler var. Artificial Analysis endeksinde V4 Pro 53'te, Opus 5 63'te, Fable 5 62'de. Hızda V4 Pro saniyede 83 token üretirken Opus 5 52 üretiyor s5.

Bu skorların hiçbiri üçüncü bir tarafça yeniden üretilmedi. Benchmark'lar önce DeepSeek'in resmi WeChat grubunda, sonra moderatörlerin sildiği bir Reddit gönderisinde, sonra Hacker News'te bir ASCII tablosu olarak dolaştı. Resmi bir duyuru sayfası yok ve açık ağırlıklar doğrulanmadı; ancak Nisan'daki V4 Pro ve Temmuz'daki V4 Flash ikisi de sonunda Hugging Face'e çıktı. Şimdiye kadarki tek uygulamalı gözlem: aynı çizim prompt'unda üç akıl yürütme seviyesi üç tamamen farklı sonuç verdi; bu, başka hiçbir modelde görülmemiş bir şey s5.

Fiyatlandırma

Lansmanda V4 Pro milyon girdi token'ı başına $0.435, milyon çıktı token'ı başına $0.87 tutuyor ve 1M bağlam, uzun bağlam ek ücreti olmadan standart fiyattan faturalanıyor s3. Claude Opus 5 girdide $5 ve çıktıda $25, Fable 5 $10 ve $50, Sonnet 5 $2 ve $10 s6. Bu, V4 Pro'yu girdide Opus 5'ten yaklaşık 11 kat, çıktıda 28 kat ucuz yapıyor; Sonnet 5'ten de hâlâ 4 ila 11 kat ucuz s3.

50,000 girdi ve 15,000 çıktı token'lık tipik bir ajan oturumu lansman fiyatlarıyla Opus 5'te yaklaşık $0.62, V4 Pro'da $0.035 tutuyor. Ajanlar için gizli kalem cache: harness her turda aynı bağlamı yeniden gönderir, bu yüzden girdi token'larının çoğu yeniden okumadır. Bir cache isabeti Opus 5'te milyon başına $0.50 s6, DeepSeek'te $0.0036; yani ajanın en çok harcadığı yerde 138'e bir oran s3.

Lansmandan üç gün sonra, 16 Ağustos'ta API yoğun ve yoğun olmayan saat faturalamasına geçiyor. Yoğun olmayan saatte V4 Pro girdide $0.66'ya, çıktıda $1.98'e çıkıyor. Yoğun saatte, UTC 1h ile 4h arasında ve 6h ile 10h arasında, fiyat $1.32 ve $3.96 s3. Yoğun saat çıktısı lansman günü fiyatının dört buçuk katı, yani %355 artış. En kötü fiyatta bile V4 Pro Opus 5'ten neredeyse dört kat ucuz kalıyor s6. Yoğun saatler Çin'in mesai gününe denk geliyor; bu yüzden cron işleri ve Avrupa gece çalıştırmaları yoğun olmayan saatleri hedefleyebilir, öğleden sonraki canlı kodlama ise bazı yoğun dilimlere denk gelir.

Karşılama

Hacker News gönderisi bir günde 990 puanı geçti s7. Bloomberg lansmanı, Anthropic'in Claude modellerine bağlı harness'i olan Claude Code'a doğrudan meydan okuma olarak çerçeveledi s9.

Karar

Parça Tut, dene veya geç Neden
dsh plugin mimarisi Dene Sandbox, depolama ve döngü değiştirilebilir; şu anın en ilginç harness tasarımı
dsh yeniden oynatılabilir oturum günlüğü Dene Ajan yoldan çıktığında olay olay yeniden oynatma, transkript okumaktan iyidir
dsh günlük ana araç olarak Şimdilik geç 0.1 developer preview, README kırıcı değişiklik vaat ediyor, üretim geçmişi yok
Yan projelerde V4 Pro Dene 1M bağlam, Anthropic API uyumluluğu, $0.0036 cache isabeti
Üretimde V4 Pro Bekle Skorlar yalnızca kendi bildirimi, duyuru sayfası yok, ağırlıklar doğrulanmadı
Tablonuzdaki lansman fiyatı Geç 16 Ağustos'ta bitiyor; yoğun olmayan $0.66/$1.98 ve yoğun $1.32/$3.96 ile modelleyin
Günlük iş için Claude Code Tut Doğrulanmış model skorları, olgun ekosistem, sabit abonelik

Pazartesi bunu yap

  • npx @deepseek-ai/dsh web çalıştırın, 127.0.0.1:3080'i açın ve atılabilir bir depoda Standard modunda otuz dakika geçirin.
  • Aynı görevi Code moduna geçirin ve API gidiş gelişlerini Standard modla karşılaştırın.
  • Bir hatayı zorla tetikleyin, sonra oturum günlüğünü işin ters gittiği olaya kadar yeniden oynatın ve bunu bir Claude Code transkriptini okumakla kıyaslayın.
  • Anthropic uyumlu mevcut bir betiği bir V4 Pro anahtarıyla DeepSeek base URL'sine yöneltin ve araç çağrıları ile JSON çıktısının hâlâ çalıştığını kontrol edin.
  • Maliyet tahmininizi 16 Ağustos fiyatlarıyla yeniden kurun: yoğun olmayan $0.66/$1.98, yoğun $1.32/$3.96; hangi çalıştırmalarınızın UTC 1h-4h veya 6h-10h aralığına düştüğünü işaretleyin.
  • 138'e bir cache oranına güvenmeden önce gerçek bir ajan oturumunda cache isabet payınızı ölçün.
  • Mevcut modelinizi dsh içinde çalıştıran bir model plugin'i için dsh-plugin GitHub konusunu izleyin.
  • Claude Code'u varsayılan tutun ve üçüncü bir taraf SWE-bench Verified yeniden üretimi yayımladığında yeniden değerlendirmek için takvime hatırlatıcı koyun.

Daha fazlası

  • Web ve terminal modlarının tek kod tabanını nasıl paylaştığını görmek için quickstart'ı okuyun ve dsh'yi pnpm ile kaynaktan derleyin s2.
  • Plugin yazmadan önce Cordis çekirdeğini ve "Everything is a Plugin" bölümünü inceleyin; yeniden kompozisyonun gerçekleştiği yer preset sistemi s8.
  • Hangi topluluk plugin'lerinin önce çıktığını görmek için dsh-plugin konusunu izleyin: modeller, sandbox'lar veya depolama ekosistemin nereye gittiğini söyler s10.
  • 80.6% rakamını herhangi bir yerde alıntılamadan önce benchmark sayılarının WeChat, Reddit, Hacker News zincirindeki yolunu okuyun s5.
  • V4 Pro'yu doğrudan DeepSeek hesabı olmadan kullanmak istiyorsanız 384,000 çıktı token'ı tavanı ve sağlayıcı karışımı için OpenRouter kaydına bakın s4.
  • Claude cache fiyat sayfasını DeepSeek'in cache isabet satırıyla karşılaştırın; ajan faturalarının en çok ayrıştığı yer tur başına cache s6.
  • Erken plugin yazarları ve preview sürümleri arasındaki ilk kırıcı değişiklik raporları için Hacker News başlığına göz atın s7.

Kaynaklar

FAQ

dsh'yi bir Claude modeliyle çalıştırabilir miyim?

Harness, DeepSeek dışındaki modelleri model plugin'leri üzerinden kabul ediyor ve dsh-plugin konusu şimdiden bazılarını listeliyor. Lansmanın iki yarısı ayrı ayrı test edilir: mevcut modelinizle dsh, ya da mevcut harness'inizle Anthropic uyumlu API üzerinden V4 Pro.

28 kat fiyat farkı gerçek mi?

Lansman fiyatlarında evet: milyon çıktı token'ı başına $0.87'e karşı $25. 16 Ağustos'tan itibaren fark yoğun saatlerde kabaca 4 kata düşüyor, bu yüzden bütçeyi sonraki tabloya göre yapın.

80.6% SWE-bench skoruna neden güvenmemeli?

Bu DeepSeek'in kendi rakamı; bir WeChat grubu ve bir ASCII tablosu üzerinden ortaya çıktı, duyuru sayfası yok ve şimdiye kadar bağımsız bir yeniden üretim yok. Doğru olabilir; DeepSeek dışında kimse kontrol etmedi.

Yalnızca eklemeli günlük pratikte neyi değiştirir?

Bir ajan 42. araç çağrısında yoldan çıktığında, oturumu o olaya kadar yeniden oynatır ve düz bir transkriptten yeniden kurmak yerine modelin bağlamında tam olarak ne olduğunu görürsünüz.