DeepSeek memukul dua kali di hari yang sama
Pada 13 Agustus 2026, DeepSeek merilis dua produk sekaligus. DeepSeek Harness adalah coding agent open source berlisensi MIT yang membidik langsung Claude Code — Bloomberg menyebutnya terus terang sebagai tantangan untuk Anthropic. Di hari yang sama, DeepSeek V4 Pro (build 0813) masuk ketersediaan umum, dengan context window satu juta token seharga kurang dari setengah dolar per juta token input.
Pasar langsung menyadarinya. Postingan Hacker News modelnya tembus 990 poin dalam satu hari, dan repositori Harness sudah lewat 21.000 bintang GitHub. Satu tool plus satu model, dirilis di hari yang sama — itu persis formula yang membuat Claude Code jadi besar.
Kami memasang DeepSeek Harness dengan satu perintah npx, membaca dokumentasinya, dan menelusuri setiap angka yang DeepSeek rilis. Artikel ini membahas arsitektur "semua adalah plugin", seberapa V4 Pro sanggup melawan Claude di benchmark dan harga, serta siapa yang sebaiknya pindah dan siapa yang menunggu.
Apa sebenarnya agent harness itu
Harness adalah seluruh mesin yang membungkus sebuah model agar bisa benar-benar bekerja di komputermu: loop yang merangkai panggilan, tool yang boleh dipakai model, manajemen konteks, izin, dan antarmuka. Model memutuskan, harness menjalankan — kalimat pendek itu adalah seluruh pembagian kerjanya.
Saat kamu mengetik instruksi di Claude Code, model tidak pernah menyentuh diskmu. Ia meminta harness membaca file, menjalankan perintah, atau menjalankan tes; harness memeriksa apakah itu diizinkan, menjalankannya, lalu mengembalikan hasilnya. Setiap coding agent bekerja seperti ini.
Claude Code adalah harness Anthropic yang tersambung ke model Claude, dan Codex harness OpenAI yang tersambung ke GPT. DeepSeek tak pernah punya yang resmi — modelnya jalan di tool orang lain. Itulah yang diubah 13 Agustus: DeepSeek berhenti menjual mesinnya saja dan kini menjual mobil utuh.
Semua adalah plugin: di dalam dsh
DeepSeek Harness — disingkat dsh di dokumentasi — dibangun di atas satu ide inti: semua adalah plugin. Itu bukan slogan marketing, itu arsitektur sesungguhnya. Model adalah plugin. Tool adalah plugin. Skill, sesi, sandbox, storage, loop, scheduling, bahkan antarmuka: semua plugin. Dokumentasi resminya menyatakan kamu bisa memilih, menukar, atau memperluas kemampuan apa pun di konfigurasi, tanpa mengubah kode sumber harness.
Di baliknya semua bertumpu pada Cordis, kernel yang DeepSeek jelaskan di paper riset soal composability. Proyek ini berbobot nyata: 12.000 lebih commit, satu server Discord, dan tag dsh-plugin khusus di GitHub tempat plugin komunitas mulai bermunculan. Konsekuensi praktisnya, harness ini tak punya inti yang beku — kalau kamu mau sandbox lain, storage sesi lain, atau model lain, kamu ubah config-nya, bukan kodenya.
Instalasinya satu perintah: npx @deepseek-ai/dsh web membuka antarmuka web lokal di port 3080. Tanpa akun untuk mulai, tanpa installer — paket npm sudah cukup. Kalau kamu lebih suka build dari sumber, seluruh repo bisa di-clone dan dikompilasi dengan pnpm dalam empat perintah.
dsh membawa empat mode runtime, dan di sinilah taruhan arsitekturnya terlihat:
- Mode Standard adalah coding agent penuh: edit file, shell, pencarian, dan perencanaan — setara langsung dengan Claude Code.
- Mode Code membuat model menghasilkan TypeScript yang mengorkestrasi operasi banyak langkah sendiri, bukan merangkai tool call satu per satu, yang memangkas bolak-balik, latensi, dan token di tugas panjang.
- Mode Minimal memangkas agent jadi bash dan satu editor file, terutama untuk benchmark model mentah.
- Mode Creator untuk membangun preset sendiri, dengan inspeksi runtime dan eksperimen plugin langsung.
Bagian terakhir adalah keterlacakan. Semua yang dilihat model masuk ke session log append-only — kamu hanya bisa menambah di akhir, tak pernah menulis ulang riwayat. Log itu sumber kebenaran harness, dan dari sana kamu bisa melanjutkan, fork, mencari, atau memutar ulang sesi mana pun. Saat agent-mu melenceng di tool call keempat puluh dua, kamu tak mengaduk transkrip; kamu putar ulang sesi sampai titik balik dan lihat persis apa yang model lihat. Itu cara berpikir sistem operasi, bukan wrapper API lagi.
V4 Pro: mesin di balik harness
DeepSeek V4 Pro, build 0813, adalah model yang keluar dari preview dan masuk ketersediaan umum, sudah bisa dipakai lewat API DeepSeek atau OpenRouter. Ini model mixture-of-experts: hanya sebagian jaringan yang aktif per token, jadi kamu dapat kemampuan model besar dengan biaya komputasi model kecil. Spesifikasinya: context window satu juta token, hingga 384.000 token output, tool call, dan output JSON.
Satu detail bernilai ganda di cerita ini: API DeepSeek mengiklankan kompatibilitas API Anthropic. Tool yang ditulis untuk bicara ke Claude bisa bicara ke V4 Pro dengan menukar base URL dan key.
Di benchmark, DeepSeek mengklaim skor mendekati puncak:
| Benchmark | DeepSeek V4 Pro | Claude |
|---|---|---|
| SWE-bench Verified | ~80,6% (varian Max) | 80,8% (Opus 4.6) |
| Terminal Bench 2.1 | klaim menang | Opus 4.8 |
| Indeks Artificial Analysis | 53 | 63 (Opus 5) |
| Kecepatan (token/detik) | 83 | 52 |
Tapi satu detail mengubah cara kamu membaca semua angka itu: belum satu skor pun direproduksi pihak ketiga. Semua yang beredar berasal dari DeepSeek atau artikel yang menyalin DeepSeek. Simon Willison menunjuk bahwa benchmark itu mula-mula beredar di grup WeChat resmi DeepSeek, lalu disalin ke postingan Reddit yang dihapus moderator, dan berakhir sebagai tabel ASCII di Hacker News. Ia juga mencatat tak ada halaman pengumuman resmi, dan open weights belum dipastikan — walau V4 Pro April dan V4 Flash Juli sama-sama mendarat di Hugging Face, jadi rilis tampak mungkin. Uji pelikan-nya setidaknya menunjukkan sesuatu yang tak biasa: tiga level reasoning menghasilkan tiga pelikan yang benar-benar berbeda. Modelnya mungkin sangat bagus; sekarang, hanya DeepSeek yang mengatakannya.
Jurang harga dengan Claude
Harga adalah tempat DeepSeek memukul paling keras. Saat peluncuran, V4 Pro berharga $0,435 per juta token input dan $0,87 per juta token output lewat API DeepSeek.
| Model | Input ($/M token) | Output ($/M token) |
|---|---|---|
| DeepSeek V4 Pro (harga peluncuran) | $0,435 | $0,87 |
| Claude Sonnet 5 | $2 | $10 |
| Claude Opus 5 | $5 | $25 |
| Claude Fable 5 | $10 | $50 |
Dengan harga peluncuran, V4 Pro sekitar 11 kali lebih murah dari Opus 5 di input dan 28 kali di output. Bahkan Sonnet 5, opsi hemat Anthropic, tetap empat sampai sebelas kali lebih mahal.
Untuk sesi coding agent khas dengan 50.000 token masuk dan 15.000 keluar, Opus 5 berbiaya sekitar $0,62; V4 Pro dengan harga peluncuran sekitar $0,035. Pos tersembunyi untuk agent adalah cache, karena harness mengirim ulang konteks yang sama tiap putaran loop: satu cache hit berbiaya $0,50 per juta di Opus 5 dan sekitar $0,0036 per juta di DeepSeek.
Hanya saja harga dasar ini punya tanggal kedaluwarsa, dan sudah dekat. Mulai 16 Agustus — tiga hari setelah peluncuran — API pindah ke penagihan peak dan off-peak:
| Periode tarif | Input ($/M) | Output ($/M) |
|---|---|---|
| Peluncuran (sampai 16 Agustus) | $0,435 | $0,87 |
| Off-peak | $0,66 | $1,98 |
| Peak (1–4 dan 6–10 UTC) | $1,32 | $3,96 |
Harga yang semua orang bandingkan minggu ini naik minimal separuh, dan di output melonjak lebih dari empat kali. Bahkan di tarif terburuk, V4 Pro tetap hampir empat kali lebih murah dari Opus 5, jadi argumennya bertahan — tapi angka yang beredar di Hacker News itu promo yang habis tiga hari lagi. Jadwalnya juga penting bagi agent: jam peak mengikuti hari kerja Tiongkok, jadi cron malam bisa kena off-peak sementara coding sore melahap jendela peak.
Bisakah menggantikan Claude Code?
Soal arsitektur, dsh punya argumen yang tak dimiliki Claude Code. Saat agent-mu melenceng, Claude Code membiarkanmu mengaduk transkrip; dsh membiarkanmu memutar ulang sesi event demi event. Sistem plugin-nya lebih jauh dari skill dan server MCP milik Anthropic, karena mencakup juga sandbox, storage, dan loop itu sendiri — di Claude Code kamu memperluas agent, di dsh kamu bisa menyusunnya ulang. Harness ini juga menerima model selain milik DeepSeek, sementara Claude Code terkunci ke Claude kecuali kamu lewat proxy tak resmi.
Di sisi lain, Claude Code punya kematangan, dan itu berat bobotnya: berbulan-bulan produksi di puluhan ribu tim, ekosistem besar skill, hook, dan integrasi, model yang skornya diverifikasi evaluator independen, dan akses langganan yang melindungi dari kejutan tagihan, sementara dsh menagih tiap token.
dsh adalah developer preview versi 0.1, dan README-nya menulis dengan huruf besar bahwa akan ada perubahan yang memutus kompatibilitas. Tapi kompatibilitas API Anthropic berarti kamu sebenarnya tak harus memilih pihak: pertahankan harness-mu dan arahkan workflow ke V4 Pro, atau coba dsh dengan model yang sudah kamu pakai. dsh adalah penantang paling kredibel yang pernah dihadapi Claude Code — dan ia penantang 0.1 melawan juara bertahan.
Jebakan sebelum pindah
Ada tiga batas yang perlu ditimbang sebelum mencopot apa pun.
Pertama, dsh adalah developer preview yang memutus kompatibilitas tanpa peringatan, jadi plugin yang kamu tulis minggu ini bisa tak termuat bulan depan. Membangun workflow harianmu di atasnya hari ini berarti setuju memperbaikinya rutin.
Kedua, setiap benchmark V4 Pro dilaporkan sendiri. Tak ada reproduksi independen, tak ada halaman pengumuman, angka yang muncul di grup WeChat. Bisa saja akurat, tapi di luar DeepSeek belum ada yang tahu.
Ketiga, harga yang bikin ramai ini pinjaman waktu. Mulai 16 Agustus, penagihan per slot waktu mendorong output sampai $3,96 per juta di peak — empat setengah kali harga hari peluncuran. dsh memberimu kebebasan penuh atas arsitektur agent-mu dan hampir tanpa jaminan soal apa yang masih benar sebulan lagi. Kalau stack agent-mu menjalankan bisnismu, ini bukan minggunya untuk pindah.
Jadi, pindah atau tidak?
Bacaan kami setelah sehari di dalamnya mengerucut ke tiga profil. Kalau kamu membangun harness atau tooling agent, pasang dsh minggu ini: arsitektur all-plugin dan log yang bisa diputar ulang adalah dua ide paling menarik saat ini, dan satu perintah npx sudah memberimu pendapat. Kalau kamu cuma mau tagihan API lebih kecil di tugas agent, uji V4 Pro di proyek sampingan — tapi hitung dengan tarif 16 Agustus, dan tunggu konfirmasi independen atas skornya sebelum mengalihkan produksi.
Kalau Claude Code menjalankan kerja harianmu, pertahankan. Tak ada di peluncuran ini yang membenarkan pindah dari tool yang bekerja ke versi 0.1 yang menjanjikan kerusakan. Kabar baiknya, serangan ini memaksa semua orang bergerak: apa pun agent-mu, harganya kini punya peluang nyata turun.
AIDive