TL;DR
- DeepSeek Harness (dsh) est un agent de code sous licence MIT où les modèles, les outils, les sandboxes, le stockage, les boucles et l'interface sont tous des plugins que l'on remplace dans la config. Le dépôt compte déjà plus de 21,000 étoiles et plus de 12,000 commits.
- L'idée la plus forte est le journal de session en ajout seul : on rejoue une session qui a déraillé événement par événement, au lieu de faire défiler une transcription.
- DeepSeek V4 Pro 0813 revendique environ 80.6% sur SWE-bench Verified, contre 80.8% pour Claude Opus 4.6. Chaque score est auto-déclaré ; personne d'indépendant n'en a reproduit un seul pour l'instant.
- Le tarif de lancement est de $0.435 par million de tokens en entrée et $0.87 en sortie. À partir du 16 août, l'API passe à une facturation heures pleines et heures creuses et la sortie monte jusqu'à $3.96 en heures pleines, soit encore environ quatre fois moins cher qu'Opus 5.
- dsh est une préversion développeur 0.1 dont le README promet des ruptures de compatibilité. Les créateurs d'outils devraient l'installer cette semaine, ceux qui veulent réduire leurs coûts devraient tester V4 Pro sur un projet annexe aux tarifs du 16 août, et les utilisateurs quotidiens de Claude Code devraient rester où ils sont.
Ce que disent les sources
Architecture
Tout le harness repose sur un noyau appelé Cordis, et la page officielle décrit chaque capacité comme quelque chose que l'on peut sélectionner, remplacer ou étendre par la configuration sans toucher au code du harness s8. C'est plus large que les skills et les serveurs MCP de Claude Code : dans Claude Code, on étend l'agent par ses bords, dans dsh on peut recomposer la sandbox, le stockage des sessions et la boucle elle-même s1. Un topic GitHub, dsh-plugin, liste déjà des plugins communautaires, dont des plugins de modèles qui permettent de faire tourner le harness sur d'autres modèles que ceux de DeepSeek s10.
L'installation tient en une commande : npx @deepseek-ai/dsh web lance une interface web locale sur le port 3080, sans compte, et la même base de code sert le mode terminal. Cloner et compiler le dépôt complet demande quatre commandes pnpm s2.
dsh propose quatre modes d'exécution. Standard est l'agent de code complet (édition de fichiers, shell, recherche, planification). Code fait écrire au modèle du TypeScript qui orchestre lui-même les opérations en plusieurs étapes, au lieu d'enchaîner les appels d'outils un par un, ce qui réduit les allers-retours API sur les longues tâches. Minimal réduit l'agent à bash plus un éditeur de fichiers, surtout pour évaluer le modèle brut. Creator sert à construire ses propres presets avec une inspection du runtime en direct s8.
Tout ce que voit le modèle va dans un journal de session en ajout seul : prompts, raisonnement, appels d'outils, injections de contexte. Ce journal est la source de vérité du harness, donc n'importe quelle session peut être reprise, dupliquée, recherchée ou rejouée à partir du flux d'événements s1.
Le modèle
V4 Pro 0813 est un modèle mixture-of-experts avec une fenêtre de contexte de 1M tokens, jusqu'à 384,000 tokens de sortie, des appels d'outils et une sortie JSON s4. L'API DeepSeek annonce une compatibilité avec l'API Anthropic : un outil écrit pour Claude peut donc cibler V4 Pro en changeant une URL de base et une clé s3.
Les chiffres de DeepSeek donnent à la variante Max environ 80.6% sur SWE-bench Verified contre 80.8% pour Claude Opus 4.6, avec des victoires revendiquées sur Terminal Bench 2.1 et plusieurs benchmarks d'agents face à Opus 4.8. Sur l'indice Artificial Analysis, V4 Pro est à 53 alors qu'Opus 5 est à 63 et Fable 5 à 62. Côté vitesse, il sort 83 tokens par seconde là où Opus 5 en fait 52 s5.
Aucun de ces scores n'a été reproduit par un tiers. Les benchmarks ont d'abord circulé dans le groupe WeChat officiel de DeepSeek, puis dans un post Reddit supprimé par les modérateurs, puis sous forme de tableau ASCII sur Hacker News. Il n'y a pas de page d'annonce officielle et les poids ouverts ne sont pas confirmés, même si le V4 Pro d'avril et le V4 Flash de juillet ont fini sur Hugging Face. La seule observation concrète à ce jour : trois niveaux de raisonnement ont donné trois résultats radicalement différents sur le même prompt de dessin, ce qu'on n'a vu sur aucun autre modèle s5.
Tarifs
Au lancement, V4 Pro coûte $0.435 par million de tokens en entrée et $0.87 par million en sortie, et le contexte de 1M est facturé au tarif standard, sans supplément long contexte s3. Claude Opus 5 est à $5 en entrée et $25 en sortie, Fable 5 à $10 et $50, Sonnet 5 à $2 et $10 s6. V4 Pro est donc environ 11 fois moins cher qu'Opus 5 en entrée et 28 fois en sortie, et encore 4 à 11 fois moins cher que Sonnet 5 s3.
Une session d'agent typique de 50,000 tokens en entrée et 15,000 en sortie coûte environ $0.62 sur Opus 5 et $0.035 sur V4 Pro aux tarifs de lancement. La ligne cachée pour les agents, c'est le cache : un harness renvoie le même contexte à chaque tour, donc la plupart des tokens d'entrée sont des relectures. Un cache hit coûte $0.50 par million sur Opus 5 s6 et $0.0036 chez DeepSeek, soit un rapport de 138 contre un exactement là où un agent dépense le plus s3.
À partir du 16 août, trois jours après le lancement, l'API passe à une facturation heures pleines et heures creuses. En heures creuses, V4 Pro monte à $0.66 en entrée et $1.98 en sortie. En heures pleines, entre 1h et 4h et entre 6h et 10h UTC, c'est $1.32 et $3.96 s3. La sortie en heures pleines vaut quatre fois et demie le tarif du jour du lancement, soit une hausse de 355%. Même au pire tarif, V4 Pro reste presque quatre fois moins cher qu'Opus 5 s6. Les heures pleines correspondent à la journée de travail chinoise : les tâches cron et les exécutions de nuit en Europe peuvent viser les heures creuses, alors que le code en direct l'après-midi tombera sur certains créneaux pleins.
Réception
Le post Hacker News a dépassé 990 points en une journée s7. Bloomberg a présenté le lancement comme un défi direct à Claude Code, le harness d'Anthropic lié aux modèles Claude s9.
Verdict
| Élément | Garder, essayer ou passer | Pourquoi |
|---|---|---|
| Architecture à plugins de dsh | Essayer | Sandbox, stockage et boucle sont tous remplaçables ; la conception de harness la plus intéressante du moment |
| Journal de session rejouable de dsh | Essayer | Le rejeu événement par événement bat la lecture d'une transcription quand un agent déraille |
| dsh comme outil quotidien | Passer pour l'instant | Préversion 0.1, le README promet des ruptures, aucun historique en production |
| V4 Pro sur des projets annexes | Essayer | Contexte 1M, compatibilité API Anthropic, cache hits à $0.0036 |
| V4 Pro en production | Attendre | Scores uniquement auto-déclarés, pas de page d'annonce, poids non confirmés |
| Tarif de lancement dans votre tableur | Passer | Expire le 16 août ; modélisez avec $0.66/$1.98 en heures creuses et $1.32/$3.96 en heures pleines |
| Claude Code au quotidien | Garder | Scores de modèle vérifiés, écosystème mature, abonnement forfaitaire |
À faire lundi
- Lancez
npx @deepseek-ai/dsh web, ouvrez 127.0.0.1:3080 et passez trente minutes en mode Standard sur un dépôt jetable. - Passez la même tâche en mode Code et comptez les allers-retours API par rapport au mode Standard.
- Provoquez un échec, puis rejouez le journal de session jusqu'à l'événement où ça a dérapé et comparez avec la lecture d'une transcription Claude Code.
- Pointez un script existant compatible Anthropic vers l'URL de base DeepSeek avec une clé V4 Pro et vérifiez que les appels d'outils et la sortie JSON fonctionnent toujours.
- Refaites votre estimation de coûts avec les tarifs du 16 août : $0.66/$1.98 en heures creuses, $1.32/$3.96 en heures pleines, et notez lesquelles de vos exécutions tombent entre 1h et 4h ou entre 6h et 10h UTC.
- Mesurez votre part de cache hits sur une vraie session d'agent avant de faire confiance au rapport de 138 contre un.
- Surveillez le topic GitHub dsh-plugin pour un plugin de modèle qui fait tourner votre modèle actuel dans dsh.
- Gardez Claude Code par défaut et mettez un rappel dans votre calendrier pour réévaluer dès qu'un tiers publie une reproduction de SWE-bench Verified.
Pour aller plus loin
- Lisez le quickstart et compilez dsh depuis les sources avec pnpm pour voir comment les modes web et terminal partagent une seule base de code s2.
- Étudiez le noyau Cordis et la section "Everything is a Plugin" avant d'écrire un plugin, car c'est dans le système de presets que se fait la recomposition s8.
- Suivez le topic dsh-plugin pour voir quels plugins communautaires apparaissent en premier : modèles, sandboxes ou stockage indiquent où va l'écosystème s10.
- Lisez la chaîne WeChat, Reddit puis Hacker News par laquelle sont passés les chiffres de benchmark avant de citer le 80.6% où que ce soit s5.
- Consultez la fiche OpenRouter pour le plafond de 384,000 tokens de sortie et la répartition des fournisseurs si vous voulez V4 Pro sans compte DeepSeek direct s4.
- Comparez la page de tarifs du cache Claude avec la ligne cache hit de DeepSeek ; le cache à chaque tour est l'endroit où les factures d'agents divergent le plus s6.
- Parcourez le fil Hacker News pour repérer les premiers auteurs de plugins et les premiers retours de ruptures entre les builds de préversion s7.
Sources
- deepseek-ai/deepseek-harness, GitHub. Pourquoi le lire : l'avertissement du README, le nombre d'étoiles et de commits, et la conception du journal de session sont ici.
- DeepSeek Harness quickstart guide, DeepSeek. Pourquoi le lire : l'installation en une ligne et la compilation depuis les sources en quatre commandes.
- DeepSeek API pricing, DeepSeek. Pourquoi le lire : les tarifs de lancement, la grille heures pleines et creuses du 16 août et la note de compatibilité Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Pourquoi le lire : les limites de contexte, de sortie et de fonctionnalités sur une seule fiche.
- First impressions of DeepSeek V4 Pro, Simon Willison. Pourquoi le lire : le seul compte rendu soigneux de l'origine des chiffres de benchmark.
- Claude model pricing, Anthropic. Pourquoi le lire : les tarifs d'Opus 5, Fable 5 et Sonnet 5 derrière chaque multiplicateur de ce pack.
- Hacker News discussion of the dsh launch, Hacker News. Pourquoi le lire : les réactions de praticiens et les premières expériences de plugins.
- DeepSeek Harness home page, DeepSeek. Pourquoi le lire : le modèle de plugins, Cordis et les quatre modes d'exécution tels que DeepSeek les décrit.
- Claude Code product page, Anthropic. Pourquoi le lire : le cadrage de l'acteur en place par lui-même, utile pour comparer fonction par fonction.
- GitHub topic dsh-plugin, GitHub. Pourquoi le lire : la liste en direct des plugins communautaires.
FAQ
Puis-je utiliser dsh avec un modèle Claude ?
Le harness accepte d'autres modèles que ceux de DeepSeek via des plugins de modèles, et le topic dsh-plugin en liste déjà quelques-uns. Les deux moitiés du lancement se testent séparément : dsh avec votre modèle actuel, ou votre harness actuel avec V4 Pro via l'API compatible Anthropic.
L'écart de prix de 28x est-il réel ?
Aux tarifs de lancement, oui : $0.87 contre $25 par million de tokens en sortie. À partir du 16 août, l'écart se réduit à environ 4x en heures pleines, donc budgétez sur la grille suivante.
Pourquoi ne pas se fier au score de 80.6% sur SWE-bench ?
C'est le chiffre de DeepSeek lui-même, sorti via un groupe WeChat et un tableau ASCII, sans page d'annonce ni reproduction indépendante à ce jour. Il est peut-être exact ; personne en dehors de DeepSeek ne l'a vérifié.
Que change concrètement le journal en ajout seul ?
Quand un agent déraille à l'appel d'outil 42, vous rejouez la session jusqu'à cet événement et voyez exactement ce que le modèle avait en contexte, au lieu de le reconstituer à partir d'une transcription à plat.
AIDive