AIDive

Paket video

DeepSeek Harness dan V4 Pro: catatan arsitektur, tabel harga, tabel vonis, dan sumber

10 menit baca

TL;DR

  • DeepSeek Harness (dsh) adalah coding agent berlisensi MIT yang model, tool, sandbox, penyimpanan, loop, dan UI-nya semua berupa plugin yang bisa Anda tukar lewat konfigurasi. Repositorinya sudah punya lebih dari 21,000 bintang dan lebih dari 12,000 commit.
  • Ide terkuatnya adalah session log append-only: Anda memutar ulang sesi yang melenceng event demi event, bukan menggulir transkrip.
  • DeepSeek V4 Pro 0813 mengklaim sekitar 80.6% di SWE-bench Verified, dibandingkan 80.8% untuk Claude Opus 4.6. Semua skor dilaporkan sendiri; belum ada pihak independen yang mereproduksinya.
  • Harga peluncuran adalah $0.435 per juta token input dan $0.87 untuk output. Mulai 16 Agustus API beralih ke tarif peak dan off-peak, dan output naik hingga $3.96 saat peak, tetap sekitar empat kali lebih murah dari Opus 5.
  • dsh masih developer preview 0.1 dan README-nya menjanjikan breaking change. Pembuat tool sebaiknya memasangnya minggu ini, yang ingin memangkas biaya sebaiknya menguji V4 Pro di proyek sampingan dengan tarif 16 Agustus, dan pengguna harian Claude Code sebaiknya tetap bertahan.

Apa kata sumber

Arsitektur

Seluruh harness bertumpu pada kernel bernama Cordis, dan halaman resminya menggambarkan setiap kapabilitas sebagai sesuatu yang bisa dipilih, ditukar, atau diperluas lewat konfigurasi tanpa menyentuh kode harness s8. Cakupannya lebih luas dari skill dan MCP server di Claude Code: di Claude Code Anda memperluas agent di tepinya, sedangkan di dsh Anda bisa menyusun ulang sandbox, penyimpanan sesi, bahkan loop itu sendiri s1. Topik GitHub dsh-plugin sudah mendaftar plugin komunitas, termasuk plugin model yang membuat harness berjalan dengan model selain milik DeepSeek s10.

Instalasinya satu perintah: npx @deepseek-ai/dsh web menjalankan web UI lokal di port 3080 tanpa akun, dan basis kode yang sama melayani mode terminal. Meng-clone dan membangun repositori lengkap membutuhkan empat perintah pnpm s2.

dsh hadir dengan empat mode eksekusi. Standard adalah coding agent lengkap (edit file, shell, pencarian, perencanaan). Code membuat model menulis TypeScript yang mengorkestrasi operasi multi-langkah sendiri, alih-alih merangkai tool call satu per satu, sehingga mengurangi round trip API pada tugas panjang. Minimal memangkas agent menjadi bash plus editor file, terutama untuk membenchmark model polos. Creator dipakai untuk membangun preset sendiri dengan inspeksi runtime langsung s8.

Semua yang dilihat model masuk ke session log append-only: prompt, reasoning, tool call, injeksi konteks. Log itu adalah sumber kebenaran harness, sehingga setiap sesi bisa dilanjutkan, di-fork, dicari, atau diputar ulang dari aliran event s1.

Modelnya

V4 Pro 0813 adalah model mixture-of-experts dengan jendela konteks 1M token, hingga 384,000 token output, tool call, dan output JSON s4. API DeepSeek mengiklankan kompatibilitas dengan Anthropic API, jadi tool yang ditulis untuk Claude bisa menargetkan V4 Pro hanya dengan mengganti base URL dan key s3.

Angka DeepSeek sendiri menempatkan varian Max di sekitar 80.6% pada SWE-bench Verified dibandingkan 80.8% untuk Claude Opus 4.6, dengan klaim menang di Terminal Bench 2.1 dan beberapa benchmark agent melawan Opus 4.8. Pada indeks Artificial Analysis, V4 Pro ada di 53 sementara Opus 5 di 63 dan Fable 5 di 62. Soal kecepatan, outputnya 83 token per detik sedangkan Opus 5 52 s5.

Tak satu pun skor itu pernah direproduksi pihak ketiga. Benchmark pertama beredar di grup WeChat resmi DeepSeek, lalu di postingan Reddit yang dihapus moderator, lalu sebagai tabel ASCII di Hacker News. Tidak ada halaman pengumuman resmi dan open weights belum dikonfirmasi, meskipun V4 Pro bulan April dan V4 Flash bulan Juli sama-sama akhirnya muncul di Hugging Face. Satu-satunya pengamatan langsung sejauh ini: tiga level reasoning menghasilkan tiga hasil yang sangat berbeda pada prompt gambar yang sama, hal yang tidak terlihat pada model lain mana pun s5.

Harga

Saat peluncuran V4 Pro berharga $0.435 per juta token input dan $0.87 per juta token output, dan konteks 1M ditagih dengan tarif standar tanpa biaya tambahan konteks panjang s3. Claude Opus 5 ada di $5 input dan $25 output, Fable 5 di $10 dan $50, Sonnet 5 di $2 dan $10 s6. Artinya V4 Pro sekitar 11 kali lebih murah dari Opus 5 untuk input dan 28 kali untuk output, dan tetap 4 sampai 11 kali lebih murah dari Sonnet 5 s3.

Satu sesi agent tipikal dengan 50,000 token input dan 15,000 token output menghabiskan sekitar $0.62 di Opus 5 dan $0.035 di V4 Pro dengan tarif peluncuran. Baris tersembunyi untuk agent adalah cache: harness mengirim ulang konteks yang sama di setiap giliran, jadi sebagian besar token input adalah pembacaan ulang. Satu cache hit berharga $0.50 per juta di Opus 5 s6 dan $0.0036 di DeepSeek, rasio 138 banding satu tepat di tempat agent paling banyak mengeluarkan biaya s3.

Mulai 16 Agustus, tiga hari setelah peluncuran, API beralih ke penagihan peak dan off-peak. Saat off-peak, V4 Pro naik menjadi $0.66 input dan $1.98 output. Saat peak, antara 1h dan 4h serta antara 6h dan 10h UTC, tarifnya $1.32 dan $3.96 s3. Output peak adalah empat setengah kali tarif hari peluncuran, kenaikan 355%. Bahkan pada tarif terburuk V4 Pro masih hampir empat kali lebih murah dari Opus 5 s6. Jam peak sesuai dengan hari kerja di Tiongkok, jadi cron job dan proses malam hari di Eropa bisa diarahkan ke off-peak, sementara coding langsung di sore hari akan terkena beberapa slot peak.

Respons publik

Postingan Hacker News melewati 990 poin dalam satu hari s7. Bloomberg membingkai peluncuran ini sebagai tantangan langsung bagi Claude Code, harness milik Anthropic yang terikat pada model Claude s9.

Vonis

Bagian Pertahankan, coba, atau lewati Alasan
Arsitektur plugin dsh Coba Sandbox, penyimpanan, dan loop semuanya bisa ditukar; desain harness paling menarik saat ini
Session log dsh yang bisa diputar ulang Coba Replay event demi event mengalahkan membaca transkrip saat agent melenceng
dsh sebagai alat harian Lewati dulu Developer preview 0.1, README menjanjikan breaking change, belum punya rekam jejak produksi
V4 Pro di proyek sampingan Coba Konteks 1M, kompatibel dengan Anthropic API, cache hit $0.0036
V4 Pro di produksi Tunggu Skor hanya dilaporkan sendiri, tanpa halaman pengumuman, weights belum dikonfirmasi
Tarif peluncuran di spreadsheet Anda Lewati Berakhir 16 Agustus; hitung dengan $0.66/$1.98 off-peak dan $1.32/$3.96 peak
Claude Code untuk kerja harian Pertahankan Skor model terverifikasi, ekosistem matang, langganan flat

Lakukan ini hari Senin

  • Jalankan npx @deepseek-ai/dsh web, buka 127.0.0.1:3080 dan habiskan tiga puluh menit di mode Standard pada repo percobaan.
  • Pindahkan tugas yang sama ke mode Code dan hitung round trip API dibandingkan mode Standard.
  • Paksa terjadi kegagalan, lalu putar ulang session log sampai ke event tempat kesalahan terjadi dan bandingkan dengan membaca transkrip Claude Code.
  • Arahkan satu skrip yang sudah kompatibel dengan Anthropic ke base URL DeepSeek dengan key V4 Pro dan periksa apakah tool call dan output JSON masih berfungsi.
  • Susun ulang estimasi biaya Anda dengan tarif 16 Agustus: $0.66/$1.98 off-peak, $1.32/$3.96 peak, dan tandai proses mana yang jatuh di 1h sampai 4h atau 6h sampai 10h UTC.
  • Ukur porsi cache hit Anda pada satu sesi agent nyata sebelum memercayai rasio cache 138 banding satu.
  • Pantau topik GitHub dsh-plugin untuk plugin model yang menjalankan model Anda saat ini di dalam dsh.
  • Tetap jadikan Claude Code sebagai default dan pasang pengingat kalender untuk mengevaluasi ulang begitu pihak ketiga menerbitkan reproduksi SWE-bench Verified.

Lebih jauh

  • Baca quickstart dan bangun dsh dari sumber dengan pnpm untuk melihat bagaimana mode web dan terminal berbagi satu basis kode s2.
  • Pelajari kernel Cordis dan bagian "Everything is a Plugin" sebelum menulis plugin, karena sistem preset adalah tempat penyusunan ulang terjadi s8.
  • Ikuti topik dsh-plugin untuk melihat plugin komunitas mana yang muncul lebih dulu: model, sandbox, atau penyimpanan menunjukkan arah ekosistem s10.
  • Baca rantai perpindahan angka benchmark dari WeChat ke Reddit lalu Hacker News sebelum mengutip angka 80.6% di mana pun s5.
  • Periksa listing OpenRouter untuk batas 384,000 token output dan campuran provider jika Anda ingin V4 Pro tanpa akun DeepSeek langsung s4.
  • Bandingkan halaman harga cache Claude dengan baris cache hit DeepSeek; cache per giliran adalah tempat tagihan agent paling berbeda s6.
  • Telusuri thread Hacker News untuk penulis plugin awal dan laporan pertama tentang breaking change antar build preview s7.

Sumber

FAQ

Bisakah saya menjalankan dsh dengan model Claude?

Harness menerima model selain milik DeepSeek lewat plugin model, dan topik dsh-plugin sudah mendaftar beberapa. Dua sisi peluncuran ini bisa diuji terpisah: dsh dengan model Anda saat ini, atau harness Anda saat ini dengan V4 Pro lewat API yang kompatibel dengan Anthropic.

Apakah selisih harga 28x itu nyata?

Pada tarif peluncuran, ya: $0.87 melawan $25 per juta token output. Mulai 16 Agustus selisihnya menyusut menjadi sekitar 4x pada jam peak, jadi susun anggaran dengan grid yang belakangan.

Mengapa tidak memercayai skor SWE-bench 80.6%?

Itu angka DeepSeek sendiri, muncul lewat grup WeChat dan tabel ASCII, tanpa halaman pengumuman dan tanpa reproduksi independen sejauh ini. Mungkin akurat; belum ada orang di luar DeepSeek yang memeriksanya.

Apa yang berubah dalam praktik dengan log append-only?

Saat agent melenceng di tool call 42, Anda memutar ulang sesi sampai event itu dan melihat persis apa yang ada di konteks model, alih-alih merekonstruksinya dari transkrip datar.