TL;DR
- DeepSeek Harness (dsh) è un agente di coding con licenza MIT in cui modelli, tool, sandbox, storage, loop e UI sono tutti plugin che sostituisci da config. Il repository conta già più di 21,000 stelle e più di 12,000 commit.
- L'idea più forte è il session log append-only: una sessione andata fuori strada la riesegui evento per evento, invece di scorrere una trascrizione.
- DeepSeek V4 Pro 0813 dichiara circa 80.6% su SWE-bench Verified contro 80.8% di Claude Opus 4.6. Ogni punteggio è autodichiarato; nessuno, finora, ne ha riprodotto uno in modo indipendente.
- Il prezzo di lancio è $0.435 per milione di token in input e $0.87 in output. Dal 16 agosto l'API passa alla fatturazione peak e off-peak e l'output sale fino a $3.96 nelle ore di picco, comunque circa quattro volte meno di Opus 5.
- dsh è una developer preview 0.1 il cui README promette breaking change. Chi costruisce tool dovrebbe installarlo questa settimana, chi vuole tagliare i costi dovrebbe provare V4 Pro su un side project con le tariffe del 16 agosto, chi usa Claude Code ogni giorno dovrebbe restare dov'è.
Cosa dicono le fonti
Architettura
L'intero harness poggia su un kernel chiamato Cordis, e la pagina ufficiale descrive ogni capacità come qualcosa che puoi selezionare, sostituire o estendere dalla configurazione senza toccare il codice dell'harness s8. È più di quanto offrano skill e server MCP di Claude Code: lì estendi l'agente ai suoi bordi, in dsh puoi ricomporre la sandbox, lo storage delle sessioni e il loop stesso s1. Un topic GitHub, dsh-plugin, elenca già plugin della community, inclusi plugin di modello che fanno girare l'harness su modelli diversi da quelli di DeepSeek s10.
L'installazione è un solo comando: npx @deepseek-ai/dsh web avvia una web UI locale sulla porta 3080, senza account, e la stessa base di codice serve anche la modalità terminale. Clonare e compilare l'intero repository richiede quattro comandi pnpm s2.
dsh include quattro modalità di esecuzione. Standard è l'agente di coding completo (modifica file, shell, ricerca, pianificazione). Code fa scrivere al modello TypeScript che orchestra da sé le operazioni in più passaggi, invece di concatenare le chiamate ai tool una per una, riducendo i round trip API sui task lunghi. Minimal riduce l'agente a bash più un editor di file, soprattutto per fare benchmark del modello nudo. Creator serve a costruire preset propri con ispezione live del runtime s8.
Tutto ciò che il modello vede finisce in un session log append-only: prompt, reasoning, chiamate ai tool, iniezioni di contesto. Quel log è la fonte di verità dell'harness, quindi ogni sessione può essere ripresa, forkata, cercata o riprodotta dallo stream di eventi s1.
Il modello
V4 Pro 0813 è un modello mixture-of-experts con finestra di contesto da 1M token, fino a 384,000 token di output, tool call e output JSON s4. L'API di DeepSeek dichiara compatibilità con l'API Anthropic, quindi uno strumento scritto per Claude può puntare a V4 Pro cambiando base URL e chiave s3.
I numeri di DeepSeek stessa collocano la variante Max a circa 80.6% su SWE-bench Verified contro 80.8% di Claude Opus 4.6, con vittorie dichiarate su Terminal Bench 2.1 e su diversi benchmark per agenti contro Opus 4.8. Nell'indice Artificial Analysis V4 Pro sta a 53, mentre Opus 5 è a 63 e Fable 5 a 62. In velocità produce 83 token al secondo dove Opus 5 ne fa 52 s5.
Nessuno di questi punteggi è stato riprodotto da terzi. I benchmark sono circolati prima nel gruppo WeChat ufficiale di DeepSeek, poi in un post su Reddit rimosso dai moderatori, poi come tabella ASCII su Hacker News. Non c'è una pagina di annuncio ufficiale e i pesi aperti non sono confermati, anche se sia V4 Pro di aprile sia V4 Flash di luglio sono finiti su Hugging Face. L'unica osservazione pratica finora: tre livelli di reasoning hanno prodotto tre risultati radicalmente diversi sullo stesso prompt di disegno, cosa mai vista su altri modelli s5.
Prezzi
Al lancio V4 Pro costa $0.435 per milione di token in input e $0.87 per milione in output, e il contesto da 1M è fatturato a tariffa standard senza sovrapprezzo per contesto lungo s3. Claude Opus 5 è a $5 in input e $25 in output, Fable 5 a $10 e $50, Sonnet 5 a $2 e $10 s6. Questo rende V4 Pro circa 11 volte più economico di Opus 5 sull'input e 28 volte sull'output, e comunque da 4 a 11 volte più economico di Sonnet 5 s3.
Una tipica sessione d'agente da 50,000 token di input e 15,000 di output costa circa $0.62 su Opus 5 e $0.035 su V4 Pro alle tariffe di lancio. La voce nascosta per gli agenti è la cache: un harness rimanda lo stesso contesto a ogni turno, quindi la maggior parte dei token di input sono riletture. Un cache hit costa $0.50 per milione su Opus 5 s6 e $0.0036 su DeepSeek, un rapporto di 138 a uno proprio dove un agente spende di più s3.
Dal 16 agosto, tre giorni dopo il lancio, l'API passa alla fatturazione peak e off-peak. Off-peak, V4 Pro sale a $0.66 in input e $1.98 in output. In picco, tra l'1h e le 4h e tra le 6h e le 10h UTC, è $1.32 e $3.96 s3. L'output in picco è quattro volte e mezza la tariffa del giorno di lancio, un aumento del 355%. Anche alla tariffa peggiore V4 Pro resta quasi quattro volte più economico di Opus 5 s6. Le ore di picco coincidono con la giornata lavorativa cinese, quindi cron job ed esecuzioni notturne europee possono puntare all'off-peak, mentre il coding live del pomeriggio cadrà in alcune fasce di picco.
Accoglienza
Il post su Hacker News ha superato i 990 punti in un giorno s7. Bloomberg ha presentato il lancio come una sfida diretta a Claude Code, l'harness di Anthropic legato ai modelli Claude s9.
Verdetto
| Elemento | Tieni, prova o salta | Perché |
|---|---|---|
| Architettura a plugin di dsh | Prova | Sandbox, storage e loop sono tutti sostituibili; il design di harness più interessante del momento |
| Session log riproducibile di dsh | Prova | Il replay evento per evento batte la lettura di una trascrizione quando un agente va fuori strada |
| dsh come strumento quotidiano | Salta per ora | Developer preview 0.1, il README promette breaking change, nessuna esperienza in produzione |
| V4 Pro su side project | Prova | Contesto 1M, compatibilità API Anthropic, $0.0036 per cache hit |
| V4 Pro in produzione | Aspetta | Punteggi solo autodichiarati, nessuna pagina di annuncio, pesi non confermati |
| Prezzi di lancio nel tuo foglio di calcolo | Salta | Scadono il 16 agosto; modella con $0.66/$1.98 off-peak e $1.32/$3.96 in picco |
| Claude Code per il lavoro quotidiano | Tieni | Punteggi dei modelli verificati, ecosistema maturo, abbonamento flat |
Da fare lunedì
- Esegui
npx @deepseek-ai/dsh web, apri 127.0.0.1:3080 e passa trenta minuti in modalità Standard su un repo usa e getta. - Passa lo stesso task alla modalità Code e conta i round trip API rispetto alla modalità Standard.
- Forza un errore, poi riesegui il session log fino all'evento in cui è andato storto e confrontalo con la lettura di una trascrizione di Claude Code.
- Punta uno script esistente compatibile Anthropic al base URL di DeepSeek con una chiave V4 Pro e verifica che tool call e output JSON funzionino ancora.
- Rifai la stima dei costi con le tariffe del 16 agosto: $0.66/$1.98 off-peak, $1.32/$3.96 in picco, e segna quali delle tue esecuzioni cadono tra 1h e 4h o tra 6h e 10h UTC.
- Misura la quota di cache hit su una sessione d'agente reale prima di fidarti del rapporto di cache 138 a uno.
- Tieni d'occhio il topic GitHub dsh-plugin per un plugin di modello che faccia girare il tuo modello attuale dentro dsh.
- Tieni Claude Code come default e imposta un promemoria in calendario per rivalutare quando una terza parte pubblicherà una riproduzione di SWE-bench Verified.
Per approfondire
- Leggi la quickstart e compila dsh dai sorgenti con pnpm per vedere come le modalità web e terminale condividono una base di codice s2.
- Studia il kernel Cordis e la sezione "Everything is a Plugin" prima di scrivere un plugin, perché è nel sistema di preset che avviene la ricomposizione s8.
- Segui il topic dsh-plugin per vedere quali plugin della community compaiono per primi: modelli, sandbox o storage indicano dove va l'ecosistema s10.
- Leggi la catena di provenienza dei numeri dei benchmark, da WeChat a Reddit a Hacker News, prima di citare ovunque il 80.6% s5.
- Controlla la scheda OpenRouter per il tetto di 384,000 token di output e il mix di provider se vuoi V4 Pro senza un account DeepSeek diretto s4.
- Confronta la pagina dei prezzi della cache di Claude con la riga cache hit di DeepSeek; la cache per turno è il punto in cui le bollette degli agenti divergono di più s6.
- Scorri il thread di Hacker News per trovare i primi autori di plugin e i primi report di breaking change tra le build di preview s7.
Fonti
- deepseek-ai/deepseek-harness, GitHub. Perché leggerla: l'avviso nel README, il numero di stelle e commit e il design del session log sono qui.
- DeepSeek Harness quickstart guide, DeepSeek. Perché leggerla: l'installazione in una riga e la build dai sorgenti in quattro comandi.
- DeepSeek API pricing, DeepSeek. Perché leggerla: tariffe di lancio, la griglia peak e off-peak del 16 agosto e la nota sulla compatibilità Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Perché leggerla: i limiti di contesto, output e funzionalità in un'unica scheda.
- First impressions of DeepSeek V4 Pro, Simon Willison. Perché leggerla: l'unico resoconto accurato di da dove vengono i numeri dei benchmark.
- Claude model pricing, Anthropic. Perché leggerla: le tariffe di Opus 5, Fable 5 e Sonnet 5 dietro ogni moltiplicatore di questo pack.
- Hacker News discussion of the dsh launch, Hacker News. Perché leggerla: reazioni di chi lavora sul campo e i primi esperimenti con i plugin.
- DeepSeek Harness home page, DeepSeek. Perché leggerla: il modello a plugin, Cordis e le quattro modalità di esecuzione come le descrive DeepSeek.
- Claude Code product page, Anthropic. Perché leggerla: l'inquadramento dell'incumbent stesso, utile per un confronto funzione per funzione.
- GitHub topic dsh-plugin, GitHub. Perché leggerla: l'elenco live dei plugin della community.
FAQ
Posso usare dsh con un modello Claude?
L'harness accetta modelli diversi da quelli di DeepSeek tramite plugin di modello, e il topic dsh-plugin ne elenca già alcuni. Le due metà del lancio si testano separatamente: dsh con il tuo modello attuale, oppure il tuo harness attuale con V4 Pro tramite l'API compatibile Anthropic.
La differenza di prezzo di 28x è reale?
Alle tariffe di lancio sì: $0.87 contro $25 per milione di token in output. Dal 16 agosto il divario si riduce a circa 4x nelle ore di picco, quindi fai il budget sulla griglia successiva.
Perché non fidarsi del punteggio SWE-bench di 80.6%?
È un numero di DeepSeek stessa, emerso da un gruppo WeChat e da una tabella ASCII, senza pagina di annuncio e senza riproduzione indipendente finora. Potrebbe essere accurato; fuori da DeepSeek nessuno l'ha verificato.
Cosa cambia in pratica il log append-only?
Quando un agente va fuori strada alla tool call 42, riesegui la sessione fino a quell'evento e vedi esattamente cosa aveva in contesto il modello, invece di ricostruirlo da una trascrizione piatta.
AIDive