AIDive

Pack de vídeo

DeepSeek Harness e V4 Pro: notas de arquitetura, tarifas, tabela de veredito e fontes

10 min de leitura

TL;DR

  • O DeepSeek Harness (dsh) é um agente de código com licença MIT em que modelos, ferramentas, sandboxes, armazenamento, loops e a interface são todos plugins que você troca na configuração. O repositório já tem mais de 21,000 estrelas e mais de 12,000 commits.
  • A melhor ideia é o log de sessão somente de acréscimo: você reproduz uma sessão que saiu dos trilhos evento por evento, em vez de rolar uma transcrição.
  • O DeepSeek V4 Pro 0813 diz ter cerca de 80.6% no SWE-bench Verified, contra 80.8% do Claude Opus 4.6. Todas as pontuações são autodeclaradas; ninguém independente reproduziu nenhuma ainda.
  • O preço de lançamento é $0.435 por milhão de tokens de entrada e $0.87 de saída. A partir de 16 de agosto a API passa a cobrar por horário de pico e fora de pico, e a saída sobe até $3.96 no pico, ainda cerca de quatro vezes mais barato que o Opus 5.
  • O dsh é uma prévia para desenvolvedores 0.1 cujo README promete mudanças incompatíveis. Quem cria ferramentas deve instalar esta semana, quem quer cortar custos deve testar o V4 Pro em um projeto paralelo com as tarifas de 16 de agosto, e quem usa o Claude Code todo dia deve ficar onde está.

O que dizem as fontes

Arquitetura

O harness inteiro repousa sobre um núcleo chamado Cordis, e a página oficial descreve cada capacidade como algo que você pode selecionar, trocar ou estender na configuração sem tocar no código do harness s8. Isso vai além dos skills e dos servidores MCP do Claude Code: no Claude Code você estende o agente pelas bordas, no dsh você pode recompor o sandbox, o armazenamento de sessões e o próprio loop s1. Um tópico do GitHub, dsh-plugin, já lista plugins da comunidade, incluindo plugins de modelo que permitem rodar o harness com modelos que não são da DeepSeek s10.

A instalação é um comando só: npx @deepseek-ai/dsh web sobe uma interface web local na porta 3080, sem conta, e a mesma base de código serve o modo terminal. Clonar e compilar o repositório completo leva quatro comandos pnpm s2.

O dsh traz quatro modos de execução. Standard é o agente de código completo (edição de arquivos, shell, busca, planejamento). Code faz o modelo escrever TypeScript que orquestra sozinho as operações de vários passos, em vez de encadear chamadas de ferramenta uma a uma, o que reduz idas e vindas à API em tarefas longas. Minimal reduz o agente a bash mais um editor de arquivos, principalmente para avaliar o modelo puro. Creator serve para montar seus próprios presets com inspeção do runtime ao vivo s8.

Tudo o que o modelo vê vai para um log de sessão somente de acréscimo: prompts, raciocínio, chamadas de ferramenta, injeções de contexto. Esse log é a fonte da verdade do harness, então qualquer sessão pode ser retomada, bifurcada, pesquisada ou reproduzida a partir do fluxo de eventos s1.

O modelo

O V4 Pro 0813 é um modelo mixture-of-experts com janela de contexto de 1M tokens, até 384,000 tokens de saída, chamadas de ferramenta e saída JSON s4. A API da DeepSeek anuncia compatibilidade com a API da Anthropic, então uma ferramenta escrita para o Claude pode apontar para o V4 Pro trocando uma URL base e uma chave s3.

Os números da própria DeepSeek colocam a variante Max em cerca de 80.6% no SWE-bench Verified contra 80.8% do Claude Opus 4.6, com vitórias declaradas no Terminal Bench 2.1 e em vários benchmarks de agentes contra o Opus 4.8. No índice da Artificial Analysis, o V4 Pro fica em 53 enquanto o Opus 5 está em 63 e o Fable 5 em 62. Em velocidade, ele entrega 83 tokens por segundo onde o Opus 5 faz 52 s5.

Nenhuma dessas pontuações foi reproduzida por terceiros. Os benchmarks circularam primeiro no grupo oficial de WeChat da DeepSeek, depois em um post do Reddit que os moderadores removeram, e depois como uma tabela ASCII no Hacker News. Não há página de anúncio oficial e os pesos abertos não estão confirmados, embora o V4 Pro de abril e o V4 Flash de julho tenham ido parar no Hugging Face. A única observação prática até agora: três níveis de raciocínio deram três resultados radicalmente diferentes no mesmo prompt de desenho, algo que não se viu em nenhum outro modelo s5.

Preços

No lançamento, o V4 Pro custa $0.435 por milhão de tokens de entrada e $0.87 por milhão de saída, e o contexto de 1M é cobrado pela tarifa padrão, sem sobretaxa de contexto longo s3. O Claude Opus 5 está em $5 de entrada e $25 de saída, o Fable 5 em $10 e $50, o Sonnet 5 em $2 e $10 s6. Isso deixa o V4 Pro cerca de 11 vezes mais barato que o Opus 5 na entrada e 28 vezes na saída, e ainda de 4 a 11 vezes mais barato que o Sonnet 5 s3.

Uma sessão típica de agente com 50,000 tokens de entrada e 15,000 de saída custa cerca de $0.62 no Opus 5 e $0.035 no V4 Pro com as tarifas de lançamento. A linha escondida para agentes é o cache: um harness reenvia o mesmo contexto a cada turno, então a maioria dos tokens de entrada são releituras. Um cache hit custa $0.50 por milhão no Opus 5 s6 e $0.0036 na DeepSeek, uma razão de 138 para um exatamente onde um agente mais gasta s3.

A partir de 16 de agosto, três dias após o lançamento, a API muda para cobrança por pico e fora de pico. Fora do pico, o V4 Pro sobe para $0.66 de entrada e $1.98 de saída. No pico, entre 1h e 4h e entre 6h e 10h UTC, fica em $1.32 e $3.96 s3. A saída no pico é quatro vezes e meia a tarifa do dia do lançamento, um aumento de 355%. Mesmo na pior tarifa, o V4 Pro continua quase quatro vezes mais barato que o Opus 5 s6. Os horários de pico coincidem com o dia útil chinês, então cron jobs e execuções noturnas na Europa podem mirar o fora de pico, enquanto programar ao vivo à tarde vai cair em alguns slots de pico.

Recepção

O post do Hacker News passou de 990 pontos em um dia s7. A Bloomberg apresentou o lançamento como um desafio direto ao Claude Code, o harness da Anthropic preso aos modelos Claude s9.

Veredito

Peça Manter, testar ou pular Por quê
Arquitetura de plugins do dsh Testar Sandbox, armazenamento e loop são todos trocáveis; o design de harness mais interessante do momento
Log de sessão reproduzível do dsh Testar Reproduzir evento por evento vence ler uma transcrição quando um agente sai dos trilhos
dsh como ferramenta do dia a dia Pular por enquanto Prévia 0.1, o README promete mudanças incompatíveis, sem histórico em produção
V4 Pro em projetos paralelos Testar Contexto de 1M, compatibilidade com a API da Anthropic, cache hits a $0.0036
V4 Pro em produção Esperar Pontuações só autodeclaradas, sem página de anúncio, pesos não confirmados
Tarifa de lançamento na sua planilha Pular Expira em 16 de agosto; modele com $0.66/$1.98 fora do pico e $1.32/$3.96 no pico
Claude Code no trabalho diário Manter Pontuações de modelo verificadas, ecossistema maduro, assinatura fixa

Faça isto na segunda-feira

  • Rode npx @deepseek-ai/dsh web, abra 127.0.0.1:3080 e passe trinta minutos no modo Standard em um repositório descartável.
  • Passe a mesma tarefa para o modo Code e conte as idas e vindas à API em relação ao modo Standard.
  • Force uma falha, depois reproduza o log de sessão até o evento em que deu errado e compare com ler uma transcrição do Claude Code.
  • Aponte um script existente compatível com a Anthropic para a URL base da DeepSeek com uma chave do V4 Pro e confira se as chamadas de ferramenta e a saída JSON continuam funcionando.
  • Refaça sua estimativa de custos com as tarifas de 16 de agosto: $0.66/$1.98 fora do pico, $1.32/$3.96 no pico, e marque quais das suas execuções caem entre 1h e 4h ou entre 6h e 10h UTC.
  • Meça sua proporção de cache hits em uma sessão real de agente antes de confiar na razão de 138 para um.
  • Acompanhe o tópico dsh-plugin do GitHub atrás de um plugin de modelo que rode seu modelo atual dentro do dsh.
  • Mantenha o Claude Code como padrão e coloque um lembrete no calendário para reavaliar quando um terceiro publicar uma reprodução do SWE-bench Verified.

Para ir além

  • Leia o quickstart e compile o dsh a partir do código-fonte com pnpm para ver como os modos web e terminal compartilham uma única base de código s2.
  • Estude o núcleo Cordis e a seção "Everything is a Plugin" antes de escrever um plugin, já que o sistema de presets é onde a recomposição acontece s8.
  • Acompanhe o tópico dsh-plugin para ver quais plugins da comunidade aparecem primeiro: modelos, sandboxes ou armazenamento indicam para onde o ecossistema vai s10.
  • Leia a cadeia WeChat, Reddit e Hacker News pela qual os números de benchmark passaram antes de citar os 80.6% em qualquer lugar s5.
  • Confira a listagem do OpenRouter para o teto de 384,000 tokens de saída e a mistura de provedores se quiser o V4 Pro sem uma conta direta na DeepSeek s4.
  • Compare a página de preços de cache do Claude com a linha de cache hit da DeepSeek; o cache por turno é onde as contas de agentes mais divergem s6.
  • Percorra a thread do Hacker News para achar os primeiros autores de plugins e os primeiros relatos de mudanças incompatíveis entre builds da prévia s7.

Fontes

FAQ

Posso rodar o dsh com um modelo Claude?

O harness aceita modelos que não são da DeepSeek por meio de plugins de modelo, e o tópico dsh-plugin já lista alguns. As duas metades do lançamento se testam separadamente: o dsh com seu modelo atual, ou seu harness atual com o V4 Pro pela API compatível com a Anthropic.

A diferença de preço de 28x é real?

Nas tarifas de lançamento, sim: $0.87 contra $25 por milhão de tokens de saída. A partir de 16 de agosto a diferença cai para cerca de 4x no pico, então faça o orçamento pela grade posterior.

Por que não confiar na pontuação de 80.6% no SWE-bench?

É o número da própria DeepSeek, surgido por um grupo de WeChat e uma tabela ASCII, sem página de anúncio e sem reprodução independente até agora. Pode estar correto; ninguém fora da DeepSeek conferiu.

O que o log somente de acréscimo muda na prática?

Quando um agente sai dos trilhos na chamada de ferramenta 42, você reproduz a sessão até aquele evento e vê exatamente o que o modelo tinha no contexto, em vez de reconstruir isso a partir de uma transcrição plana.