TL;DR
- O DeepSeek Harness (dsh) é um agente de código com licença MIT em que modelos, ferramentas, sandboxes, armazenamento, loops e a interface são todos plugins que você troca na configuração. O repositório já tem mais de 21,000 estrelas e mais de 12,000 commits.
- A melhor ideia é o log de sessão somente de acréscimo: você reproduz uma sessão que saiu dos trilhos evento por evento, em vez de rolar uma transcrição.
- O DeepSeek V4 Pro 0813 diz ter cerca de 80.6% no SWE-bench Verified, contra 80.8% do Claude Opus 4.6. Todas as pontuações são autodeclaradas; ninguém independente reproduziu nenhuma ainda.
- O preço de lançamento é $0.435 por milhão de tokens de entrada e $0.87 de saída. A partir de 16 de agosto a API passa a cobrar por horário de pico e fora de pico, e a saída sobe até $3.96 no pico, ainda cerca de quatro vezes mais barato que o Opus 5.
- O dsh é uma prévia para desenvolvedores 0.1 cujo README promete mudanças incompatíveis. Quem cria ferramentas deve instalar esta semana, quem quer cortar custos deve testar o V4 Pro em um projeto paralelo com as tarifas de 16 de agosto, e quem usa o Claude Code todo dia deve ficar onde está.
O que dizem as fontes
Arquitetura
O harness inteiro repousa sobre um núcleo chamado Cordis, e a página oficial descreve cada capacidade como algo que você pode selecionar, trocar ou estender na configuração sem tocar no código do harness s8. Isso vai além dos skills e dos servidores MCP do Claude Code: no Claude Code você estende o agente pelas bordas, no dsh você pode recompor o sandbox, o armazenamento de sessões e o próprio loop s1. Um tópico do GitHub, dsh-plugin, já lista plugins da comunidade, incluindo plugins de modelo que permitem rodar o harness com modelos que não são da DeepSeek s10.
A instalação é um comando só: npx @deepseek-ai/dsh web sobe uma interface web local na porta 3080, sem conta, e a mesma base de código serve o modo terminal. Clonar e compilar o repositório completo leva quatro comandos pnpm s2.
O dsh traz quatro modos de execução. Standard é o agente de código completo (edição de arquivos, shell, busca, planejamento). Code faz o modelo escrever TypeScript que orquestra sozinho as operações de vários passos, em vez de encadear chamadas de ferramenta uma a uma, o que reduz idas e vindas à API em tarefas longas. Minimal reduz o agente a bash mais um editor de arquivos, principalmente para avaliar o modelo puro. Creator serve para montar seus próprios presets com inspeção do runtime ao vivo s8.
Tudo o que o modelo vê vai para um log de sessão somente de acréscimo: prompts, raciocínio, chamadas de ferramenta, injeções de contexto. Esse log é a fonte da verdade do harness, então qualquer sessão pode ser retomada, bifurcada, pesquisada ou reproduzida a partir do fluxo de eventos s1.
O modelo
O V4 Pro 0813 é um modelo mixture-of-experts com janela de contexto de 1M tokens, até 384,000 tokens de saída, chamadas de ferramenta e saída JSON s4. A API da DeepSeek anuncia compatibilidade com a API da Anthropic, então uma ferramenta escrita para o Claude pode apontar para o V4 Pro trocando uma URL base e uma chave s3.
Os números da própria DeepSeek colocam a variante Max em cerca de 80.6% no SWE-bench Verified contra 80.8% do Claude Opus 4.6, com vitórias declaradas no Terminal Bench 2.1 e em vários benchmarks de agentes contra o Opus 4.8. No índice da Artificial Analysis, o V4 Pro fica em 53 enquanto o Opus 5 está em 63 e o Fable 5 em 62. Em velocidade, ele entrega 83 tokens por segundo onde o Opus 5 faz 52 s5.
Nenhuma dessas pontuações foi reproduzida por terceiros. Os benchmarks circularam primeiro no grupo oficial de WeChat da DeepSeek, depois em um post do Reddit que os moderadores removeram, e depois como uma tabela ASCII no Hacker News. Não há página de anúncio oficial e os pesos abertos não estão confirmados, embora o V4 Pro de abril e o V4 Flash de julho tenham ido parar no Hugging Face. A única observação prática até agora: três níveis de raciocínio deram três resultados radicalmente diferentes no mesmo prompt de desenho, algo que não se viu em nenhum outro modelo s5.
Preços
No lançamento, o V4 Pro custa $0.435 por milhão de tokens de entrada e $0.87 por milhão de saída, e o contexto de 1M é cobrado pela tarifa padrão, sem sobretaxa de contexto longo s3. O Claude Opus 5 está em $5 de entrada e $25 de saída, o Fable 5 em $10 e $50, o Sonnet 5 em $2 e $10 s6. Isso deixa o V4 Pro cerca de 11 vezes mais barato que o Opus 5 na entrada e 28 vezes na saída, e ainda de 4 a 11 vezes mais barato que o Sonnet 5 s3.
Uma sessão típica de agente com 50,000 tokens de entrada e 15,000 de saída custa cerca de $0.62 no Opus 5 e $0.035 no V4 Pro com as tarifas de lançamento. A linha escondida para agentes é o cache: um harness reenvia o mesmo contexto a cada turno, então a maioria dos tokens de entrada são releituras. Um cache hit custa $0.50 por milhão no Opus 5 s6 e $0.0036 na DeepSeek, uma razão de 138 para um exatamente onde um agente mais gasta s3.
A partir de 16 de agosto, três dias após o lançamento, a API muda para cobrança por pico e fora de pico. Fora do pico, o V4 Pro sobe para $0.66 de entrada e $1.98 de saída. No pico, entre 1h e 4h e entre 6h e 10h UTC, fica em $1.32 e $3.96 s3. A saída no pico é quatro vezes e meia a tarifa do dia do lançamento, um aumento de 355%. Mesmo na pior tarifa, o V4 Pro continua quase quatro vezes mais barato que o Opus 5 s6. Os horários de pico coincidem com o dia útil chinês, então cron jobs e execuções noturnas na Europa podem mirar o fora de pico, enquanto programar ao vivo à tarde vai cair em alguns slots de pico.
Recepção
O post do Hacker News passou de 990 pontos em um dia s7. A Bloomberg apresentou o lançamento como um desafio direto ao Claude Code, o harness da Anthropic preso aos modelos Claude s9.
Veredito
| Peça | Manter, testar ou pular | Por quê |
|---|---|---|
| Arquitetura de plugins do dsh | Testar | Sandbox, armazenamento e loop são todos trocáveis; o design de harness mais interessante do momento |
| Log de sessão reproduzível do dsh | Testar | Reproduzir evento por evento vence ler uma transcrição quando um agente sai dos trilhos |
| dsh como ferramenta do dia a dia | Pular por enquanto | Prévia 0.1, o README promete mudanças incompatíveis, sem histórico em produção |
| V4 Pro em projetos paralelos | Testar | Contexto de 1M, compatibilidade com a API da Anthropic, cache hits a $0.0036 |
| V4 Pro em produção | Esperar | Pontuações só autodeclaradas, sem página de anúncio, pesos não confirmados |
| Tarifa de lançamento na sua planilha | Pular | Expira em 16 de agosto; modele com $0.66/$1.98 fora do pico e $1.32/$3.96 no pico |
| Claude Code no trabalho diário | Manter | Pontuações de modelo verificadas, ecossistema maduro, assinatura fixa |
Faça isto na segunda-feira
- Rode
npx @deepseek-ai/dsh web, abra 127.0.0.1:3080 e passe trinta minutos no modo Standard em um repositório descartável. - Passe a mesma tarefa para o modo Code e conte as idas e vindas à API em relação ao modo Standard.
- Force uma falha, depois reproduza o log de sessão até o evento em que deu errado e compare com ler uma transcrição do Claude Code.
- Aponte um script existente compatível com a Anthropic para a URL base da DeepSeek com uma chave do V4 Pro e confira se as chamadas de ferramenta e a saída JSON continuam funcionando.
- Refaça sua estimativa de custos com as tarifas de 16 de agosto: $0.66/$1.98 fora do pico, $1.32/$3.96 no pico, e marque quais das suas execuções caem entre 1h e 4h ou entre 6h e 10h UTC.
- Meça sua proporção de cache hits em uma sessão real de agente antes de confiar na razão de 138 para um.
- Acompanhe o tópico dsh-plugin do GitHub atrás de um plugin de modelo que rode seu modelo atual dentro do dsh.
- Mantenha o Claude Code como padrão e coloque um lembrete no calendário para reavaliar quando um terceiro publicar uma reprodução do SWE-bench Verified.
Para ir além
- Leia o quickstart e compile o dsh a partir do código-fonte com pnpm para ver como os modos web e terminal compartilham uma única base de código s2.
- Estude o núcleo Cordis e a seção "Everything is a Plugin" antes de escrever um plugin, já que o sistema de presets é onde a recomposição acontece s8.
- Acompanhe o tópico dsh-plugin para ver quais plugins da comunidade aparecem primeiro: modelos, sandboxes ou armazenamento indicam para onde o ecossistema vai s10.
- Leia a cadeia WeChat, Reddit e Hacker News pela qual os números de benchmark passaram antes de citar os 80.6% em qualquer lugar s5.
- Confira a listagem do OpenRouter para o teto de 384,000 tokens de saída e a mistura de provedores se quiser o V4 Pro sem uma conta direta na DeepSeek s4.
- Compare a página de preços de cache do Claude com a linha de cache hit da DeepSeek; o cache por turno é onde as contas de agentes mais divergem s6.
- Percorra a thread do Hacker News para achar os primeiros autores de plugins e os primeiros relatos de mudanças incompatíveis entre builds da prévia s7.
Fontes
- deepseek-ai/deepseek-harness, GitHub. Por que ler: o aviso do README, as contagens de estrelas e commits e o design do log de sessão estão aqui.
- DeepSeek Harness quickstart guide, DeepSeek. Por que ler: a instalação em uma linha e a compilação a partir do código-fonte em quatro comandos.
- DeepSeek API pricing, DeepSeek. Por que ler: as tarifas de lançamento, a grade de pico e fora de pico de 16 de agosto e a nota de compatibilidade com a Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Por que ler: os limites de contexto, saída e recursos em um único card.
- First impressions of DeepSeek V4 Pro, Simon Willison. Por que ler: o único relato cuidadoso de onde vieram os números de benchmark.
- Claude model pricing, Anthropic. Por que ler: as tarifas do Opus 5, Fable 5 e Sonnet 5 por trás de cada multiplicador deste pack.
- Hacker News discussion of the dsh launch, Hacker News. Por que ler: reações de quem pratica e os primeiros experimentos com plugins.
- DeepSeek Harness home page, DeepSeek. Por que ler: o modelo de plugins, o Cordis e os quatro modos de execução como a DeepSeek os descreve.
- Claude Code product page, Anthropic. Por que ler: o enquadramento do concorrente já estabelecido, útil para comparar recurso por recurso.
- GitHub topic dsh-plugin, GitHub. Por que ler: a lista ao vivo de plugins da comunidade.
FAQ
Posso rodar o dsh com um modelo Claude?
O harness aceita modelos que não são da DeepSeek por meio de plugins de modelo, e o tópico dsh-plugin já lista alguns. As duas metades do lançamento se testam separadamente: o dsh com seu modelo atual, ou seu harness atual com o V4 Pro pela API compatível com a Anthropic.
A diferença de preço de 28x é real?
Nas tarifas de lançamento, sim: $0.87 contra $25 por milhão de tokens de saída. A partir de 16 de agosto a diferença cai para cerca de 4x no pico, então faça o orçamento pela grade posterior.
Por que não confiar na pontuação de 80.6% no SWE-bench?
É o número da própria DeepSeek, surgido por um grupo de WeChat e uma tabela ASCII, sem página de anúncio e sem reprodução independente até agora. Pode estar correto; ninguém fora da DeepSeek conferiu.
O que o log somente de acréscimo muda na prática?
Quando um agente sai dos trilhos na chamada de ferramenta 42, você reproduz a sessão até aquele evento e vê exatamente o que o modelo tinha no contexto, em vez de reconstruir isso a partir de uma transcrição plana.
AIDive