TL;DR
- DeepSeek Harness (dsh) to agent do kodowania na licencji MIT, w którym modele, narzędzia, sandboxy, storage, pętle i UI są pluginami wymienianymi w konfiguracji. Repozytorium ma już ponad 21,000 gwiazdek i ponad 12,000 commitów.
- Najmocniejszy pomysł to append-only log sesji: wykolejoną sesję odtwarzasz zdarzenie po zdarzeniu, zamiast przewijać transkrypt.
- DeepSeek V4 Pro 0813 deklaruje około 80.6% na SWE-bench Verified przy 80.8% dla Claude Opus 4.6. Każdy wynik jest podany przez samego autora; nikt niezależnie nie odtworzył jeszcze żadnego z nich.
- Cena startowa to $0.435 za milion tokenów wejściowych i $0.87 za wyjściowe. Od 16 sierpnia API przechodzi na rozliczanie peak i off-peak, a wyjście w szczycie sięga $3.96, nadal około czterokrotnie taniej niż Opus 5.
- dsh to developer preview 0.1, którego README zapowiada breaking changes. Twórcy narzędzi powinni zainstalować go w tym tygodniu, osoby tnące koszty niech przetestują V4 Pro w pobocznym projekcie według stawek od 16 sierpnia, a codzienni użytkownicy Claude Code niech zostaną przy swoim.
Co mówią źródła
Architektura
Cały harness opiera się na jądrze o nazwie Cordis, a oficjalna strona opisuje każdą możliwość jako coś, co można wybrać, wymienić lub rozszerzyć w konfiguracji bez dotykania kodu harnessu s8. To więcej niż skille i serwery MCP w Claude Code: tam rozszerzasz agenta na jego krawędziach, w dsh możesz przekomponować sandbox, storage sesji i samą pętlę s1. Temat GitHub dsh-plugin zbiera już pluginy społeczności, w tym pluginy modeli, dzięki którym harness działa na modelach innych niż DeepSeek s10.
Instalacja to jedno polecenie: npx @deepseek-ai/dsh web uruchamia lokalny interfejs webowy na porcie 3080, bez konta, a ta sama baza kodu obsługuje też tryb terminalowy. Sklonowanie i zbudowanie całego repozytorium to cztery polecenia pnpm s2.
dsh ma cztery tryby wykonania. Standard to kompletny agent do kodowania (edycja plików, shell, wyszukiwanie, planowanie). Code każe modelowi pisać TypeScript, który sam orkiestruje wieloetapowe operacje zamiast łączyć wywołania narzędzi jedno po drugim, co zmniejsza liczbę round tripów do API przy długich zadaniach. Minimal redukuje agenta do basha i edytora plików, głównie po to, by testować sam "goły" model. Creator służy do budowania własnych presetów z podglądem runtime na żywo s8.
Wszystko, co widzi model, trafia do append-only logu sesji: prompty, reasoning, wywołania narzędzi, wstrzyknięcia kontekstu. Ten log jest źródłem prawdy harnessu, więc każdą sesję można wznowić, rozgałęzić, przeszukać lub odtworzyć ze strumienia zdarzeń s1.
Model
V4 Pro 0813 to model mixture-of-experts z oknem kontekstu 1M tokenów, do 384,000 tokenów wyjściowych, wywołaniami narzędzi i wyjściem JSON s4. API DeepSeek reklamuje zgodność z API Anthropic, więc narzędzie napisane pod Claude może celować w V4 Pro po zmianie base URL i klucza s3.
Własne liczby DeepSeek stawiają wariant Max na około 80.6% w SWE-bench Verified wobec 80.8% dla Claude Opus 4.6, z deklarowanymi zwycięstwami w Terminal Bench 2.1 i kilku benchmarkach agentowych nad Opus 4.8. W indeksie Artificial Analysis V4 Pro ma 53, a Opus 5 63 i Fable 5 62. Pod względem szybkości generuje 83 tokeny na sekundę, gdzie Opus 5 robi 52 s5.
Żaden z tych wyników nie został odtworzony przez osobę trzecią. Benchmarki krążyły najpierw w oficjalnej grupie DeepSeek na WeChacie, potem w poście na Reddicie usuniętym przez moderatorów, potem jako tabela ASCII na Hacker News. Nie ma oficjalnej strony z ogłoszeniem, a otwarte wagi nie są potwierdzone, choć zarówno kwietniowy V4 Pro, jak i lipcowy V4 Flash trafiły na Hugging Face. Jedyna dotychczasowa obserwacja z praktyki: trzy poziomy reasoningu dały trzy radykalnie różne wyniki na tym samym prompcie z rysunkiem, czego nie widziano u żadnego innego modelu s5.
Ceny
Na starcie V4 Pro kosztuje $0.435 za milion tokenów wejściowych i $0.87 za milion wyjściowych, a kontekst 1M jest rozliczany po stawce standardowej bez dopłaty za długi kontekst s3. Claude Opus 5 kosztuje $5 za wejście i $25 za wyjście, Fable 5 $10 i $50, Sonnet 5 $2 i $10 s6. Wychodzi z tego, że V4 Pro jest około 11 razy tańszy od Opus 5 na wejściu i 28 razy na wyjściu, a od Sonnet 5 nadal 4 do 11 razy tańszy s3.
Typowa sesja agenta z 50,000 tokenów wejściowych i 15,000 wyjściowych kosztuje około $0.62 na Opus 5 i $0.035 na V4 Pro po stawkach startowych. Ukryta pozycja u agentów to cache: harness w każdej turze wysyła ten sam kontekst ponownie, więc większość tokenów wejściowych to ponowne odczyty. Trafienie w cache kosztuje $0.50 za milion na Opus 5 s6 i $0.0036 u DeepSeek, czyli stosunek 138 do jednego dokładnie tam, gdzie agent wydaje najwięcej s3.
Od 16 sierpnia, trzy dni po premierze, API przechodzi na rozliczanie peak i off-peak. Poza szczytem V4 Pro rośnie do $0.66 za wejście i $1.98 za wyjście. W szczycie, między 1h a 4h oraz między 6h a 10h UTC, jest to $1.32 i $3.96 s3. Wyjście w szczycie to cztery i pół raza stawka z dnia premiery, wzrost o 355%. Nawet przy najgorszej stawce V4 Pro pozostaje prawie czterokrotnie tańszy od Opus 5 s6. Godziny szczytu pokrywają się z chińskim dniem pracy, więc crony i europejskie nocne uruchomienia mogą celować w off-peak, a kodowanie na żywo po południu trafi w część slotów szczytowych.
Odbiór
Post na Hacker News przekroczył 990 punktów w jeden dzień s7. Bloomberg przedstawił premierę jako bezpośrednie wyzwanie dla Claude Code, harnessu Anthropic związanego z modelami Claude s9.
Werdykt
| Element | Zostaw, wypróbuj czy pomiń | Dlaczego |
|---|---|---|
| Architektura pluginów dsh | Wypróbuj | Sandbox, storage i pętla są wymienialne; najciekawszy obecnie projekt harnessu |
| Odtwarzalny log sesji dsh | Wypróbuj | Odtwarzanie zdarzenie po zdarzeniu bije czytanie transkryptu, gdy agent się wykolei |
| dsh jako codzienne narzędzie | Na razie pomiń | Developer preview 0.1, README zapowiada breaking changes, brak doświadczeń z produkcji |
| V4 Pro w pobocznych projektach | Wypróbuj | Kontekst 1M, zgodność z API Anthropic, $0.0036 za trafienie w cache |
| V4 Pro na produkcji | Poczekaj | Wyniki tylko deklarowane, brak strony z ogłoszeniem, wagi niepotwierdzone |
| Ceny startowe w twoim arkuszu | Pomiń | Wygasają 16 sierpnia; licz z $0.66/$1.98 off-peak i $1.32/$3.96 w szczycie |
| Claude Code do codziennej pracy | Zostaw | Zweryfikowane wyniki modeli, dojrzały ekosystem, subskrypcja ryczałtowa |
Do zrobienia w poniedziałek
- Uruchom
npx @deepseek-ai/dsh web, otwórz 127.0.0.1:3080 i spędź trzydzieści minut w trybie Standard na jednorazowym repo. - Przełącz to samo zadanie na tryb Code i policz round tripy do API w porównaniu z trybem Standard.
- Wymuś błąd, potem odtwórz log sesji do zdarzenia, w którym coś poszło źle, i porównaj to z czytaniem transkryptu Claude Code.
- Wskaż jednemu istniejącemu skryptowi zgodnemu z Anthropic base URL DeepSeek z kluczem V4 Pro i sprawdź, czy wywołania narzędzi i wyjście JSON nadal działają.
- Przelicz swój szacunek kosztów według stawek od 16 sierpnia: $0.66/$1.98 off-peak, $1.32/$3.96 w szczycie, i zaznacz, które z twoich uruchomień wypadają w 1h do 4h lub 6h do 10h UTC.
- Zmierz udział trafień w cache w jednej prawdziwej sesji agenta, zanim zaufasz stosunkowi cache 138 do jednego.
- Obserwuj temat GitHub dsh-plugin pod kątem pluginu modelu, który uruchomi twój obecny model w dsh.
- Zostaw Claude Code jako domyślne narzędzie i ustaw przypomnienie w kalendarzu, by ocenić ponownie, gdy ktoś trzeci opublikuje odtworzenie wyniku SWE-bench Verified.
Czytaj dalej
- Przeczytaj quickstart i zbuduj dsh ze źródeł przez pnpm, by zobaczyć, jak tryby webowy i terminalowy dzielą jedną bazę kodu s2.
- Zapoznaj się z jądrem Cordis i sekcją "Everything is a Plugin", zanim napiszesz plugin, bo to w systemie presetów odbywa się przekomponowanie s8.
- Śledź temat dsh-plugin, by zobaczyć, jakie pluginy społeczności pojawią się pierwsze: modele, sandboxy czy storage pokażą, dokąd zmierza ekosystem s10.
- Prześledź drogę liczb z benchmarków, od WeChata przez Reddit do Hacker News, zanim gdziekolwiek zacytujesz 80.6% s5.
- Sprawdź wpis OpenRouter pod kątem limitu 384,000 tokenów wyjściowych i miksu dostawców, jeśli chcesz V4 Pro bez bezpośredniego konta DeepSeek s4.
- Porównaj stronę cennika cache Claude z wierszem trafień w cache u DeepSeek; cache w każdej turze to miejsce, w którym rachunki za agentów rozjeżdżają się najbardziej s6.
- Przejrzyj wątek na Hacker News w poszukiwaniu pierwszych autorów pluginów i pierwszych raportów o breaking changes między buildami preview s7.
Źródła
- deepseek-ai/deepseek-harness, GitHub. Dlaczego warto: ostrzeżenie z README, liczby gwiazdek i commitów oraz projekt logu sesji są tutaj.
- DeepSeek Harness quickstart guide, DeepSeek. Dlaczego warto: instalacja jednym poleceniem i budowanie ze źródeł czterema poleceniami.
- DeepSeek API pricing, DeepSeek. Dlaczego warto: stawki startowe, siatka peak i off-peak od 16 sierpnia oraz uwaga o zgodności z Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Dlaczego warto: limity kontekstu, wyjścia i funkcji na jednej karcie.
- First impressions of DeepSeek V4 Pro, Simon Willison. Dlaczego warto: jedyna staranna relacja o tym, skąd wzięły się liczby z benchmarków.
- Claude model pricing, Anthropic. Dlaczego warto: stawki Opus 5, Fable 5 i Sonnet 5 stojące za każdym przelicznikiem w tym packu.
- Hacker News discussion of the dsh launch, Hacker News. Dlaczego warto: reakcje praktyków i pierwsze eksperymenty z pluginami.
- DeepSeek Harness home page, DeepSeek. Dlaczego warto: model pluginów, Cordis i cztery tryby wykonania tak, jak opisuje je DeepSeek.
- Claude Code product page, Anthropic. Dlaczego warto: własne ujęcie obecnego lidera, przydatne do porównania funkcja po funkcji.
- GitHub topic dsh-plugin, GitHub. Dlaczego warto: aktualna lista pluginów społeczności.
FAQ
Czy mogę uruchomić dsh z modelem Claude?
Harness przyjmuje modele inne niż DeepSeek przez pluginy modeli, a temat dsh-plugin wymienia już kilka. Dwie połowy premiery da się testować osobno: dsh z twoim obecnym modelem albo twój obecny harness z V4 Pro przez API zgodne z Anthropic.
Czy różnica cen 28x jest prawdziwa?
Przy stawkach startowych tak: $0.87 wobec $25 za milion tokenów wyjściowych. Od 16 sierpnia różnica w godzinach szczytu kurczy się do około 4x, więc planuj budżet według późniejszej siatki.
Dlaczego nie ufać wynikowi SWE-bench 80.6%?
To liczba samego DeepSeek, która wypłynęła przez grupę na WeChacie i tabelę ASCII, bez strony z ogłoszeniem i jak dotąd bez niezależnego odtworzenia. Może być trafna; poza DeepSeek nikt jej nie sprawdził.
Co w praktyce zmienia log append-only?
Gdy agent wykoleja się przy wywołaniu narzędzia 42, odtwarzasz sesję do tego zdarzenia i widzisz dokładnie, co model miał w kontekście, zamiast rekonstruować to z płaskiego transkryptu.
AIDive