AIDive

Video-Paket

DeepSeek Harness und V4 Pro: Architektur-Notizen, Preisraster, Verdict-Tabelle und Quellen

10 Min. Lesezeit

TL;DR

  • DeepSeek Harness (dsh) ist ein Coding-Agent unter MIT-Lizenz, bei dem Modelle, Tools, Sandboxes, Speicher, Loops und die UI allesamt Plugins sind, die du per Config austauschst. Das Repository hat bereits mehr als 21,000 Stars und mehr als 12,000 Commits.
  • Die stärkste Idee ist das Append-only-Session-Log: Du spielst eine entgleiste Session Event für Event nach, statt durch ein Transkript zu scrollen.
  • DeepSeek V4 Pro 0813 kommt laut eigener Angabe auf etwa 80.6% bei SWE-bench Verified, Claude Opus 4.6 auf 80.8%. Jeder Score ist selbst berichtet; bisher hat keiner unabhängig einen davon reproduziert.
  • Der Launch-Preis liegt bei $0.435 pro Million Input-Tokens und $0.87 für Output. Ab dem 16. August stellt die API auf Peak- und Off-Peak-Abrechnung um, und der Output steigt zur Peak-Zeit auf bis zu $3.96, immer noch etwa viermal günstiger als Opus 5.
  • dsh ist eine Developer Preview 0.1, deren README Breaking Changes ankündigt. Tool-Bauer sollten es diese Woche installieren, wer Kosten senken will, testet V4 Pro in einem Nebenprojekt mit den Preisen ab dem 16. August, und wer täglich mit Claude Code arbeitet, bleibt dabei.

Was die Quellen sagen

Architektur

Das ganze Harness ruht auf einem Kernel namens Cordis, und die offizielle Seite beschreibt jede Fähigkeit als etwas, das du in der Konfiguration auswählen, austauschen oder erweitern kannst, ohne den Harness-Code anzufassen s8. Das geht weiter als Skills und MCP-Server in Claude Code: Dort erweiterst du den Agenten an seinen Rändern, in dsh kannst du Sandbox, Session-Speicher und den Loop selbst neu zusammensetzen s1. Ein GitHub-Topic, dsh-plugin, listet schon Community-Plugins auf, darunter Modell-Plugins, mit denen das Harness auf anderen Modellen als denen von DeepSeek läuft s10.

Die Installation ist ein einziger Befehl: npx @deepseek-ai/dsh web startet eine lokale Web-UI auf Port 3080, ohne Account, und dieselbe Codebasis bedient auch den Terminal-Modus. Das ganze Repository zu klonen und zu bauen dauert vier pnpm-Befehle s2.

dsh bringt vier Ausführungsmodi mit. Standard ist der komplette Coding-Agent (Dateiänderungen, Shell, Suche, Planung). Code lässt das Modell TypeScript schreiben, das mehrstufige Abläufe selbst orchestriert, statt Tool-Aufrufe einzeln aneinanderzureihen, was die API-Roundtrips bei langen Aufgaben senkt. Minimal reduziert den Agenten auf bash plus einen Dateieditor, vor allem um das nackte Modell zu benchmarken. Creator dient dazu, eigene Presets mit Live-Inspektion der Laufzeit zu bauen s8.

Alles, was das Modell sieht, landet in einem Append-only-Session-Log: Prompts, Reasoning, Tool-Aufrufe, Kontext-Injektionen. Dieses Log ist die Source of Truth des Harness, deshalb lässt sich jede Session aus dem Event-Stream fortsetzen, forken, durchsuchen oder abspielen s1.

Das Modell

V4 Pro 0813 ist ein Mixture-of-Experts-Modell mit 1M Token Kontextfenster, bis zu 384,000 Output-Tokens, Tool-Aufrufen und JSON-Ausgabe s4. Die DeepSeek-API wirbt mit Kompatibilität zur Anthropic-API, ein für Claude geschriebenes Tool kann also V4 Pro ansprechen, indem du Base-URL und Key änderst s3.

DeepSeeks eigene Zahlen sehen die Max-Variante bei etwa 80.6% auf SWE-bench Verified gegenüber 80.8% für Claude Opus 4.6, dazu behauptete Siege bei Terminal Bench 2.1 und mehreren Agent-Benchmarks gegen Opus 4.8. Im Artificial-Analysis-Index steht V4 Pro bei 53, Opus 5 bei 63 und Fable 5 bei 62. Bei der Geschwindigkeit liefert es 83 Tokens pro Sekunde, wo Opus 5 auf 52 kommt s5.

Keiner dieser Scores wurde von Dritten reproduziert. Die Benchmarks tauchten zuerst in DeepSeeks offizieller WeChat-Gruppe auf, dann in einem Reddit-Post, den die Moderatoren entfernten, dann als ASCII-Tabelle auf Hacker News. Es gibt keine offizielle Ankündigungsseite, und offene Gewichte sind nicht bestätigt, obwohl das V4 Pro vom April und das V4 Flash vom Juli beide auf Hugging Face gelandet sind. Die einzige praktische Beobachtung bisher: Drei Reasoning-Stufen lieferten bei demselben Zeichen-Prompt drei völlig verschiedene Ergebnisse, was bei keinem anderen Modell zu sehen war s5.

Preise

Zum Launch kostet V4 Pro $0.435 pro Million Input-Tokens und $0.87 pro Million Output-Tokens, und der 1M-Kontext wird zum Standardtarif ohne Long-Context-Aufschlag abgerechnet s3. Claude Opus 5 liegt bei $5 Input und $25 Output, Fable 5 bei $10 und $50, Sonnet 5 bei $2 und $10 s6. Damit ist V4 Pro beim Input etwa 11-mal und beim Output 28-mal günstiger als Opus 5 und immer noch 4- bis 11-mal günstiger als Sonnet 5 s3.

Eine typische Agent-Session mit 50,000 Input- und 15,000 Output-Tokens kostet mit Opus 5 etwa $0.62 und mit V4 Pro zu den Launch-Preisen $0.035. Der versteckte Posten bei Agenten ist der Cache: Ein Harness schickt in jedem Turn denselben Kontext erneut, also sind die meisten Input-Tokens Wiederholungslesungen. Ein Cache-Treffer kostet bei Opus 5 $0.50 pro Million s6 und bei DeepSeek $0.0036, ein Verhältnis von 138 zu eins genau dort, wo ein Agent am meisten ausgibt s3.

Ab dem 16. August, drei Tage nach dem Launch, stellt die API auf Peak- und Off-Peak-Abrechnung um. Off-Peak steigt V4 Pro auf $0.66 Input und $1.98 Output. Zur Peak-Zeit, zwischen 1h und 4h sowie zwischen 6h und 10h UTC, sind es $1.32 und $3.96 s3. Der Peak-Output ist das Viereinhalbfache des Launch-Tarifs, ein Anstieg um 355%. Selbst zum schlechtesten Tarif bleibt V4 Pro fast viermal günstiger als Opus 5 s6. Die Peak-Zeiten decken sich mit dem chinesischen Arbeitstag, Cron-Jobs und nächtliche Läufe aus Europa können also auf Off-Peak zielen, während Live-Coding am Nachmittag in manche Peak-Slots fällt.

Resonanz

Der Hacker-News-Post knackte an einem Tag 990 Punkte s7. Bloomberg stellte den Launch als direkte Herausforderung für Claude Code dar, Anthropics an Claude-Modelle gebundenes Harness s9.

Fazit

Baustein Behalten, testen oder lassen Warum
dsh-Plugin-Architektur Testen Sandbox, Speicher und Loop sind austauschbar; das interessanteste Harness-Design im Moment
dsh-Session-Log mit Replay Testen Event-für-Event-Replay schlägt das Lesen eines Transkripts, wenn ein Agent entgleist
dsh als tägliches Werkzeug Vorerst lassen Developer Preview 0.1, README kündigt Breaking Changes an, keine Erfahrung im Produktiveinsatz
V4 Pro in Nebenprojekten Testen 1M Kontext, Anthropic-API-Kompatibilität, $0.0036 pro Cache-Treffer
V4 Pro in Produktion Abwarten Scores nur selbst berichtet, keine Ankündigungsseite, Gewichte unbestätigt
Launch-Preise in deiner Tabelle Lassen Laufen am 16. August aus; rechne mit $0.66/$1.98 Off-Peak und $1.32/$3.96 Peak
Claude Code für die tägliche Arbeit Behalten Verifizierte Modell-Scores, ausgereiftes Ökosystem, Flatrate-Abo

Das machst du am Montag

  • Führe npx @deepseek-ai/dsh web aus, öffne 127.0.0.1:3080 und verbringe dreißig Minuten im Standard-Modus auf einem Wegwerf-Repo.
  • Schalte dieselbe Aufgabe in den Code-Modus und zähle die API-Roundtrips gegenüber dem Standard-Modus.
  • Provoziere einen Fehler, spiele dann das Session-Log bis zum Event nach, an dem es schiefging, und vergleiche das mit dem Lesen eines Claude-Code-Transkripts.
  • Richte ein bestehendes Anthropic-kompatibles Skript auf die DeepSeek-Base-URL mit einem V4-Pro-Key und prüfe, ob Tool-Aufrufe und JSON-Ausgabe weiter funktionieren.
  • Baue deine Kostenschätzung mit den Preisen ab dem 16. August neu: $0.66/$1.98 Off-Peak, $1.32/$3.96 Peak, und markiere, welche deiner Läufe in 1h bis 4h oder 6h bis 10h UTC fallen.
  • Miss den Anteil deiner Cache-Treffer an einer echten Agent-Session, bevor du dem Cache-Verhältnis von 138 zu eins traust.
  • Beobachte das GitHub-Topic dsh-plugin auf ein Modell-Plugin, das dein aktuelles Modell in dsh laufen lässt.
  • Lass Claude Code als Standard und setze dir eine Kalendererinnerung, neu zu bewerten, sobald ein Dritter eine SWE-bench-Verified-Reproduktion veröffentlicht.

Weiterlesen

  • Lies den Quickstart und baue dsh mit pnpm aus dem Quellcode, um zu sehen, wie Web- und Terminal-Modus eine Codebasis teilen s2.
  • Sieh dir den Cordis-Kernel und den Abschnitt "Everything is a Plugin" an, bevor du ein Plugin schreibst, denn im Preset-System findet die Neukomposition statt s8.
  • Verfolge das Topic dsh-plugin, um zu sehen, welche Community-Plugins zuerst erscheinen: Modelle, Sandboxes oder Speicher zeigen, wohin sich das Ökosystem entwickelt s10.
  • Lies die Überlieferungskette der Benchmark-Zahlen von WeChat über Reddit zu Hacker News, bevor du die 80.6% irgendwo zitierst s5.
  • Prüfe das OpenRouter-Listing auf die Obergrenze von 384,000 Output-Tokens und den Provider-Mix, wenn du V4 Pro ohne direkten DeepSeek-Account nutzen willst s4.
  • Vergleiche die Cache-Preisseite von Claude mit der Cache-Treffer-Zeile von DeepSeek; der Cache pro Turn ist der Punkt, an dem Agent-Rechnungen am stärksten auseinanderlaufen s6.
  • Überfliege den Hacker-News-Thread nach frühen Plugin-Autoren und ersten Berichten über Breaking Changes zwischen Preview-Builds s7.

Quellen

FAQ

Kann ich dsh mit einem Claude-Modell nutzen?

Das Harness akzeptiert über Modell-Plugins auch andere Modelle als die von DeepSeek, und das Topic dsh-plugin listet bereits einige. Die beiden Hälften des Launchs lassen sich getrennt testen: dsh mit deinem aktuellen Modell oder dein aktuelles Harness mit V4 Pro über die Anthropic-kompatible API.

Ist der Preisunterschied von 28x real?

Zu den Launch-Preisen ja: $0.87 gegen $25 pro Million Output-Tokens. Ab dem 16. August schrumpft der Abstand zur Peak-Zeit auf etwa 4x, plane also mit dem späteren Raster.

Warum dem SWE-bench-Score von 80.6% nicht trauen?

Es ist DeepSeeks eigene Zahl, aufgetaucht über eine WeChat-Gruppe und eine ASCII-Tabelle, ohne Ankündigungsseite und bislang ohne unabhängige Reproduktion. Sie mag stimmen; außerhalb von DeepSeek hat sie niemand geprüft.

Was ändert das Append-only-Log in der Praxis?

Wenn ein Agent bei Tool-Aufruf 42 entgleist, spielst du die Session bis zu diesem Event ab und siehst genau, was das Modell im Kontext hatte, statt es aus einem flachen Transkript zu rekonstruieren.