AIDive

DeepSeek atakuje Claude Code: Harness + V4 Pro

AIDive · Opublikowano

Agenty do kodowaniaModele AI

DeepSeek uderza dwa razy tego samego dnia

13 sierpnia 2026 DeepSeek wypuścił dwa produkty naraz. DeepSeek Harness to otwartoźródłowy agent kodujący na licencji MIT, który celuje prosto w Claude Code — Bloomberg wprost nazwał to wyzwaniem rzuconym Anthropic. Tego samego dnia DeepSeek V4 Pro (build 0813) wszedł do ogólnej dostępności, z oknem kontekstowym na milion tokenów za mniej niż pół dolara za milion tokenów wejścia.

Rynek zauważył od razu. Post o modelu na Hacker News przebił 990 punktów w jeden dzień, a repozytorium Harness ma już ponad 21 000 gwiazdek na GitHubie. Narzędzie plus model, wypuszczone tego samego dnia — to dokładnie ta formuła, która stworzyła Claude Code.

Zainstalowaliśmy DeepSeek Harness jedną komendą npx, przeczytaliśmy dokumentację i przeszliśmy przez każdą liczbę opublikowaną przez DeepSeeka. Ten artykuł omawia architekturę „wszystko jest wtyczką", ile V4 Pro jest wart przy Claude w benchmarkach i cenach, oraz kto powinien się przenosić, a kto poczekać.

Czym naprawdę jest harness agenta

Harness to cała maszyneria wokół modelu, żeby mógł naprawdę pracować na twoim komputerze: pętla spinająca wywołania, narzędzia, których model może użyć, zarządzanie kontekstem, uprawnienia i interfejs. Model decyduje, harness wykonuje — w tym krótkim zdaniu mieści się cały podział pracy.

Kiedy wpisujesz polecenie w Claude Code, model sam nigdy nie dotyka dysku. Prosi harness, żeby odczytał plik, uruchomił komendę albo test; harness sprawdza, czy to dozwolone, wykonuje i zwraca wynik. Każdy agent kodujący działa tak samo.

Claude Code to harness Anthropic podpięty do modeli Claude, a Codex to harness OpenAI podpięty do GPT. DeepSeek nigdy nie miał oficjalnego — jego modele chodziły w cudzych narzędziach. To właśnie zmienia 13 sierpnia: DeepSeek przestaje sprzedawać sam silnik i sprzedaje cały samochód.

Wszystko jest wtyczką: wnętrze dsh

DeepSeek Harness — w dokumentacji skracany do dsh — stoi na jednej myśli przewodniej: wszystko jest wtyczką. To nie slogan marketingowy, to realna architektura. Modele są wtyczkami. Narzędzia są wtyczkami. Skille, sesje, sandboksy, storage, pętle, harmonogramy, a nawet interfejs: same wtyczki. Oficjalna dokumentacja mówi wprost, że każdą zdolność można wybrać, wymienić albo rozszerzyć w konfiguracji, bez ruszania źródeł harnessa.

Pod spodem wszystko stoi na Cordis — jądrze, które DeepSeek opisuje w artykule naukowym o komponowalności. Projekt ma realną wagę: ponad 12 000 commitów, serwer Discord i osobny tag dsh-plugin na GitHubie, gdzie wtyczki społeczności już się pojawiają. Praktyczna konsekwencja: harness nie ma zamrożonego rdzenia — chcesz inny sandboks, inny storage sesji albo inny model, zmieniasz konfigurację, nie kod.

Instalacja to jedna komenda: npx @deepseek-ai/dsh web otwiera interfejs webowy lokalnie na porcie 3080. Konto na start niepotrzebne, instalator też — wystarczy pakiet npm. Jeśli wolisz zbudować ze źródeł, całe repo klonuje się i kompiluje pnpm w czterech komendach.

dsh daje cztery tryby uruchomieniowe i tu widać zakład o architekturę:

  • Tryb Standard to pełny agent kodujący: edycja plików, shell, wyszukiwanie i planowanie — wprost odpowiednik Claude Code.
  • Tryb Code każe modelowi generować TypeScript, który sam orkiestruje wielokrokowe operacje zamiast łańcucha wywołań narzędzi, co ścina rundy w tę i z powrotem, opóźnienie i tokeny w długich zadaniach.
  • Tryb Minimal ścina agenta do basha i edytora plików, głównie do benchmarków gołego modelu.
  • Tryb Creator służy do budowania własnych presetów, z inspekcją runtime'u i żywymi eksperymentami z wtyczkami.

Ostatni element to śledzenie. Wszystko, co widzi model, ląduje w logu sesji tylko do dopisywania — można dopisywać wyłącznie na końcu, nigdy przepisać historii. Ten log to źródło prawdy harnessa i z niego można wznowić, sforkować, przeszukać albo odtworzyć dowolną sesję. Kiedy twój agent wypada z torów przy czterdziestym drugim wywołaniu narzędzia, nie grzebiesz w transkrypcie; odtwarzasz sesję do punktu przełomu i widzisz dokładnie, co widział model. To myślenie systemem operacyjnym, a nie kolejny wrapper na API.

V4 Pro: silnik za harnessem

DeepSeek V4 Pro, build 0813, to model wychodzący z preview do ogólnej dostępności, dostępny już przez API DeepSeeka albo OpenRouter. To model mixture-of-experts: na każdy token aktywuje się tylko ułamek sieci, więc masz możliwości dużego modelu przy koszcie obliczeń małego. Specyfikacja: okno kontekstowe na milion tokenów, do 384 000 tokenów wyjścia, wywołania narzędzi i wyjście JSON.

Jeden szczegół liczy się tu podwójnie: API DeepSeeka ogłasza zgodność z API Anthropic. Narzędzie napisane pod Claude pogada z V4 Pro po zmianie bazowego URL-a i klucza.

W benchmarkach DeepSeek deklaruje wyniki blisko szczytu:

Benchmark DeepSeek V4 Pro Claude
SWE-bench Verified ~80,6% (wariant Max) 80,8% (Opus 4.6)
Terminal Bench 2.1 deklarowana wygrana Opus 4.8
Indeks Artificial Analysis 53 63 (Opus 5)
Szybkość (tokeny/s) 83 52

Ale jest szczegół, który zmienia czytanie każdej z tych liczb: ani jeden wynik nie został jeszcze powtórzony przez stronę trzecią. Wszystko, co krąży, prowadzi do DeepSeeka albo do tekstów go kopiujących. Simon Willison zwraca uwagę, że benchmarki najpierw krążyły w oficjalnej grupie DeepSeeka na WeChacie, trafiły do posta na Reddicie, który usunęli moderatorzy, i wylądowały jako tabela ASCII na Hacker News. Zauważa też, że nie ma oficjalnej strony ogłoszenia, a otwarte wagi nie są potwierdzone — choć kwietniowy V4 Pro i lipcowy V4 Flash trafiły na Hugging Face, więc wydanie wygląda prawdopodobnie. Jego test z pelikanem pokazał przynajmniej coś nietypowego: trzy poziomy rozumowania dały trzy zupełnie różne pelikany. Model jest pewnie bardzo dobry; na razie mówi to tylko sam DeepSeek.

Różnica cen wobec Claude

To na cenie DeepSeek uderza najmocniej. Na premierę V4 Pro kosztuje 0,435 $ za milion tokenów wejścia i 0,87 $ za milion tokenów wyjścia przez API DeepSeeka.

Model Wejście ($/mln tokenów) Wyjście ($/mln tokenów)
DeepSeek V4 Pro (stawka premierowa) 0,435 $ 0,87 $
Claude Sonnet 5 2 $ 10 $
Claude Opus 5 5 $ 25 $
Claude Fable 5 10 $ 50 $

Przy stawce premierowej V4 Pro jest około 11 razy tańszy od Opus 5 na wejściu i 28 razy na wyjściu. Nawet Sonnet 5, budżetowa opcja Anthropic, zostaje cztery do jedenastu razy droższy.

Dla typowej sesji agenta kodującego — 50 000 tokenów wejścia i 15 000 wyjścia — Opus 5 kosztuje około 0,62 $, a V4 Pro po stawce premierowej około 0,035 $. Ukryta pozycja dla agenta to cache, bo harness odsyła ten sam kontekst przy każdym obrocie pętli: trafienie w cache to 0,50 $ za milion na Opus 5 i około 0,0036 $ za milion u DeepSeeka.

Tyle że ta cena minimalna ma datę ważności, i to bliską. Od 16 sierpnia — trzy dni po premierze — API przechodzi na rozliczanie w godzinach szczytu i poza nim:

Okres taryfowy Wejście ($/mln) Wyjście ($/mln)
Premiera (do 16 sierpnia) 0,435 $ 0,87 $
Poza szczytem 0,66 $ 1,98 $
Szczyt (1–4 i 6–10 UTC) 1,32 $ 3,96 $

Cena, którą wszyscy porównują w tym tygodniu, rośnie co najmniej o połowę, a na wyjściu ponad czterokrotnie. Nawet przy najgorszej stawce V4 Pro jest prawie cztery razy tańszy niż Opus 5, więc argument się broni — ale liczba krążąca po Hacker News to promocja kończąca się za trzy dni. Harmonogram ma znaczenie także dla agentów: szczyt idzie za chińskim dniem pracy, więc nocne crony łapią godziny poza szczytem, a popołudniowe kodowanie zjada okna szczytu.

Czy zastąpi Claude Code?

W architekturze dsh ma argumenty, których Claude Code nie ma. Gdy agent wypada z torów, Claude Code pozwala grzebać w transkrypcie; dsh pozwala odtworzyć sesję zdarzenie po zdarzeniu. System wtyczek sięga dalej niż skille i serwery MCP Anthropic, bo obejmuje też sandboks, storage i samą pętlę — w Claude Code rozszerzasz agenta, w dsh możesz go złożyć od nowa. Harness przyjmuje też modele inne niż DeepSeeka, podczas gdy Claude Code trzyma się Claude, chyba że pójdziesz przez nieoficjalne proxy.

Po drugiej stronie Claude Code ma dojrzałość, a ta waży sporo: miesiące produkcji w dziesiątkach tysięcy zespołów, ogromny ekosystem skilli, hooków i integracji, modele, których wyniki weryfikują niezależni ewaluatorzy, i dostęp abonamentowy chroniący przed niespodziankami na fakturze, podczas gdy dsh liczy każdy token.

dsh to developer preview w wersji 0.1, a README pisze wielkimi literami, że będą zmiany łamiące kompatybilność. Ale zgodność z API Anthropic oznacza, że nie musisz wybierać strony: zostaw swój harness i skieruj część workflowów na V4 Pro, albo spróbuj dsh z modelem, którego już używasz. dsh to najbardziej wiarygodny pretendent, jakiego miał Claude Code — i jest to pretendent 0.1 przeciw urzędującemu mistrzowi.

Pułapki przed przeprowadzką

Zanim cokolwiek odinstalujesz, są trzy ograniczenia do rozważenia.

Po pierwsze, dsh to developer preview, który łamie zgodność bez ostrzeżenia, więc wtyczka pisana w tym tygodniu może się nie wczytać w przyszłym miesiącu. Budowanie na tym codziennego workflowu dziś to zgoda na regularne naprawy.

Po drugie, każdy benchmark V4 Pro jest samodzielnie zgłoszony. Brak niezależnego powtórzenia, brak strony ogłoszenia, liczby, które wypłynęły z grupy WeChat. Mogą być dokładne, ale poza DeepSeekiem nikt jeszcze tego nie wie.

Po trzecie, cena robiąca szum żyje na kredyt. Od 16 sierpnia rozliczanie po przedziałach godzinowych podnosi wyjście do 3,96 $ za milion w szczycie — cztery i pół raza ponad cenę z dnia premiery. dsh daje pełną swobodę w architekturze twojego agenta i prawie żadnej gwarancji, co będzie prawdą za miesiąc. Jeśli twój stack agentów niesie firmę, to nie jest tydzień na przeprowadzkę.

Więc przenosić się czy nie?

Nasze odczytanie po dniu w środku sprowadza się do trzech profili. Jeśli budujesz harnessy albo tooling dla agentów, zainstaluj dsh w tym tygodniu: architektura cała-na-wtyczkach i odtwarzalny log to dwa najciekawsze pomysły w tej chwili, a jedna komenda npx wystarczy, żeby wyrobić sobie opinię. Jeśli chcesz tylko mniejszy rachunek za API przy zadaniach agenta, przetestuj V4 Pro na projekcie pobocznym — ale licz po stawkach z 16 sierpnia i poczekaj na niezależne potwierdzenie wyników, zanim przełożysz produkcję.

Jeśli Claude Code niesie twoją codzienną pracę, zostaw go. Nic w tej premierze nie usprawiedliwia migracji z działającego narzędzia na wersję 0.1, która obiecuje pęknięcia. Dobra wiadomość jest taka, że ten atak zmusza wszystkich do ruchu: jakiego agenta byś nie miał, jego cena ma teraz realną szansę spaść.

Źródła

Najczęstsze pytania

Czym jest DeepSeek Harness (dsh)?
DeepSeek Harness, w skrócie dsh, to otwartoźródłowy agent kodujący wydany przez DeepSeeka 13 sierpnia 2026 na licencji MIT. To odpowiednik Claude Code od DeepSeeka, zbudowany na architekturze, w której wszystko jest wtyczką: modele, narzędzia, sandboksy, storage, a nawet interfejs wymienia się w konfiguracji.
Czym jest harness agenta?
Harness to maszyneria wokół modelu AI, żeby mógł pracować na twoim komputerze: pętla spinająca wywołania, narzędzia, których model może użyć, zarządzanie kontekstem, uprawnienia i interfejs. Model decyduje, harness wykonuje — Claude Code to harness Anthropic dla Claude, a Codex to harness OpenAI dla GPT.
Jak zainstalować DeepSeek Harness?
Uruchom `npx @deepseek-ai/dsh web`, a lokalny interfejs webowy otworzy się na porcie 3080. Na start nie potrzeba konta ani instalatora, a repozytorium można też zbudować ze źródeł pnpm w czterech komendach.
Czy DeepSeek V4 Pro jest lepszy od Claude?
DeepSeek deklaruje niemal remis: około 80,6% na SWE-bench Verified wobec 80,8% dla Claude Opus 4.6 i 83 tokeny na sekundę wobec 52, choć w indeksie Artificial Analysis Opus 5 prowadzi 63 do 53. Żaden z tych wyników nie został jeszcze niezależnie powtórzony — wszystkie opublikowane liczby prowadzą do samego DeepSeeka.
O ile DeepSeek V4 Pro jest tańszy od Claude?
Przy stawce premierowej (0,435 $/mln wejścia, 0,87 $/mln wyjścia) V4 Pro jest około 11 razy tańszy od Claude Opus 5 na wejściu i 28 razy na wyjściu. Od 16 sierpnia 2026 rozliczanie szczyt/poza szczytem podnosi ceny do 0,66–1,32 $ na wejściu i 1,98–3,96 $ na wyjściu, co nadal zostawia go około 4 razy tańszym od Opus 5 przy najgorszej stawce.
Czy powinienem przejść z Claude Code na DeepSeek Harness?
Do codziennej pracy produkcyjnej jeszcze nie. dsh to developer preview 0.1, którego README ostrzega przed zmianami łamiącymi zgodność, a benchmarki V4 Pro nie są zweryfikowane. Warto go zainstalować, jeśli budujesz tooling dla agentów, a V4 Pro warto przetestować na projektach pobocznych dzięki zgodności z API Anthropic.

Powiązane filmy