AIDive

DeepSeek ataca a Claude Code: Harness + V4 Pro al detalle

Por AIDive · Publicado el

Agentes de programaciónModelos de IA

DeepSeek golpea dos veces el mismo día

El 13 de agosto de 2026, DeepSeek lanzó dos productos a la vez. DeepSeek Harness es un agente de código open source con licencia MIT que va directo contra Claude Code — Bloomberg lo describió sin rodeos como un desafío a Anthropic. Ese mismo día, DeepSeek V4 Pro (build 0813) llegó a disponibilidad general, con una ventana de contexto de un millón de tokens por menos de medio dólar el millón de tokens de entrada.

El mercado reaccionó de inmediato. El post de Hacker News del modelo superó los 990 puntos en un solo día, y el repositorio de Harness ya pasa de 21 000 estrellas en GitHub. Una herramienta más un modelo lanzados el mismo día es exactamente la fórmula que hizo grande a Claude Code.

Instalamos DeepSeek Harness con un solo comando npx, leímos la documentación y repasamos todas las cifras que publicó DeepSeek. Este artículo cubre la arquitectura «todo es un plugin», lo que vale V4 Pro frente a Claude en benchmarks y precio, y quién debería migrar frente a quién debería esperar.

Qué es realmente un harness de agente

Un harness es toda la maquinaria que rodea a un modelo para que pueda trabajar de verdad en tu ordenador: el bucle que encadena las llamadas, las herramientas que el modelo puede usar, la gestión del contexto, los permisos y la interfaz. El modelo decide, el harness ejecuta — esa frase corta resume todo el reparto de papeles.

Cuando escribes una instrucción en Claude Code, el modelo nunca toca tu disco. Le pide al harness que lea un fichero, ejecute un comando o lance un test; el harness comprueba si está permitido, lo ejecuta y le devuelve el resultado. Todos los agentes de código funcionan así.

Claude Code es el harness de Anthropic conectado a los modelos Claude, y Codex el de OpenAI conectado a GPT. DeepSeek nunca tuvo uno oficial — sus modelos corrían dentro de las herramientas de otros. Eso es lo que cambia el 13 de agosto: DeepSeek deja de vender solo el motor y pasa a vender el coche entero.

Todo es un plugin: por dentro de dsh

DeepSeek Harness — abreviado como dsh en la documentación — se construye sobre una idea central: todo es un plugin. No es un eslogan de marketing, es la arquitectura real. Los modelos son plugins. Las herramientas son plugins. Skills, sesiones, sandboxes, almacenamiento, bucles, scheduling e incluso la interfaz: plugins. La documentación oficial indica que cualquier capacidad se puede elegir, sustituir o extender en la configuración, sin tocar el código fuente del harness.

Por debajo, todo se apoya en Cordis, un kernel que DeepSeek describe en un paper de investigación sobre composabilidad. El proyecto tiene peso real: más de 12 000 commits, un servidor de Discord y una etiqueta dsh-plugin dedicada en GitHub donde ya aparecen plugins de la comunidad. La consecuencia práctica es que el harness no tiene un núcleo congelado — si quieres otro sandbox, otro almacenamiento de sesiones u otro modelo, cambias la configuración, no el código.

La instalación es un solo comando: npx @deepseek-ai/dsh web abre una interfaz web en local en el puerto 3080. No hace falta cuenta ni instalador — basta con el paquete npm. Si prefieres compilar desde el código fuente, el repositorio entero se clona y compila con pnpm en cuatro comandos.

dsh trae cuatro modos de ejecución, y ahí es donde se ve la apuesta arquitectónica:

  • El modo Standard es el agente de código completo: edición de ficheros, shell, búsqueda y planificación — el equivalente directo de Claude Code.
  • El modo Code hace que el modelo genere TypeScript que orquesta él mismo operaciones de varios pasos, en vez de encadenar llamadas a herramientas una a una, lo que recorta idas y vueltas, latencia y tokens en tareas largas.
  • El modo Minimal reduce el agente a bash y un editor de ficheros, sobre todo para benchmarkear el modelo desnudo.
  • El modo Creator sirve para construir tus propios presets, con inspección del runtime y experimentos de plugins en vivo.

La última pieza es la trazabilidad. Todo lo que ve el modelo va a un log de sesión append-only — solo puedes añadir al final, nunca reescribir el historial. Ese log es la fuente de verdad del harness, y desde ahí puedes retomar, bifurcar, buscar o reproducir cualquier sesión. Cuando tu agente se descarrila en la llamada a herramienta cuarenta y dos, no rebuscas en un transcript; reproduces la sesión hasta el punto de quiebre y ves exactamente lo que vio el modelo. Eso es pensar como un sistema operativo, no como otro wrapper de API.

V4 Pro: el motor detrás del harness

DeepSeek V4 Pro, build 0813, es el modelo que sale de preview y llega a disponibilidad general, ya usable por la API de DeepSeek o por OpenRouter. Es un modelo mixture-of-experts: solo se activa una fracción de la red por token, así que tienes capacidad de modelo grande al coste de cómputo de uno pequeño. La ficha técnica: ventana de contexto de un millón de tokens, hasta 384 000 tokens de salida, tool calls y salida JSON.

Un detalle cuenta doble en esta historia: la API de DeepSeek anuncia compatibilidad con la API de Anthropic. Una herramienta escrita para hablar con Claude puede hablar con V4 Pro cambiando una URL base y una clave.

En benchmarks, DeepSeek anuncia resultados casi de primera línea:

Benchmark DeepSeek V4 Pro Claude
SWE-bench Verified ~80,6 % (variante Max) 80,8 % (Opus 4.6)
Terminal Bench 2.1 victoria reclamada Opus 4.8
Índice Artificial Analysis 53 63 (Opus 5)
Velocidad (tokens/s) 83 52

Pero un detalle cambia cómo lees todas esas cifras: ni un solo resultado lo ha reproducido un tercero todavía. Todo lo que circula viene de DeepSeek o de artículos que copian a DeepSeek. Simon Willison cuenta que los benchmarks circularon primero en el grupo oficial de WeChat de DeepSeek, luego en un post de Reddit que los moderadores borraron, y acabaron como tabla ASCII en Hacker News. También señala que no hay página de anuncio oficial y que los pesos abiertos no están confirmados — aunque el V4 Pro de abril y el V4 Flash de julio acabaron en Hugging Face, así que una publicación parece probable. Su test del pelícano al menos mostró algo raro: tres niveles de razonamiento produjeron tres pelícanos radicalmente distintos. El modelo probablemente es muy bueno; ahora mismo, solo lo dice DeepSeek.

La brecha de precio con Claude

El precio es donde DeepSeek golpea más fuerte. En el lanzamiento, V4 Pro cuesta 0,435 $ por millón de tokens de entrada y 0,87 $ por millón de salida en la API de DeepSeek.

Modelo Entrada ($/M tokens) Salida ($/M tokens)
DeepSeek V4 Pro (precio de lanzamiento) 0,435 $ 0,87 $
Claude Sonnet 5 2 $ 10 $
Claude Opus 5 5 $ 25 $
Claude Fable 5 10 $ 50 $

Al precio de lanzamiento, V4 Pro sale unas 11 veces más barato que Opus 5 en entrada y 28 veces en salida. Incluso Sonnet 5, la opción económica de Anthropic, sigue siendo de cuatro a once veces más caro.

Para una sesión típica de agente de código de 50 000 tokens de entrada y 15 000 de salida, Opus 5 cuesta unos 0,62 $; V4 Pro al precio de lanzamiento cuesta unos 0,035 $. La partida oculta para un agente es la caché, porque un harness reenvía el mismo contexto en cada vuelta del bucle: un acierto de caché cuesta 0,50 $ por millón en Opus 5 y unos 0,0036 $ por millón en DeepSeek.

Solo que este precio suelo tiene fecha de caducidad, y está cerca. Desde el 16 de agosto — tres días después del lanzamiento — la API pasa a facturación por horas pico y horas valle:

Periodo tarifario Entrada ($/M) Salida ($/M)
Lanzamiento (hasta el 16 de agosto) 0,435 $ 0,87 $
Horas valle 0,66 $ 1,98 $
Horas pico (1–4 y 6–10 UTC) 1,32 $ 3,96 $

El precio que todo el mundo compara esta semana sube al menos la mitad, y más que se cuadruplica en salida. Incluso al peor precio, V4 Pro sigue siendo casi cuatro veces más barato que Opus 5, así que el argumento aguanta — pero la cifra que circula por Hacker News es una promo que termina en tres días. El horario también importa para un agente: las horas pico siguen la jornada laboral china, así que un cron nocturno puede caer en horas valle mientras programar por la tarde se come las horas pico.

¿Puede reemplazar a Claude Code?

En arquitectura, dsh tiene argumentos que Claude Code no tiene. Cuando tu agente descarrila, Claude Code te deja rebuscar en el transcript; dsh te deja reproducir la sesión evento a evento. El sistema de plugins llega más lejos que las skills y los servidores MCP de Anthropic, porque cubre también el sandbox, el almacenamiento y el propio bucle — en Claude Code extiendes el agente, en dsh puedes recomponerlo. El harness también acepta modelos que no son de DeepSeek, mientras que Claude Code sigue atado a Claude salvo que uses proxies no oficiales.

Enfrente, Claude Code tiene madurez, y pesa mucho: meses de producción en decenas de miles de equipos, un ecosistema enorme de skills, hooks e integraciones, modelos cuyos resultados verifican evaluadores independientes, y acceso por suscripción que protege de sorpresas de facturación, donde dsh cobra cada token.

dsh es una developer preview en versión 0.1, y el README dice en mayúsculas que habrá cambios que rompen la compatibilidad. Pero la compatibilidad con la API de Anthropic significa que no tienes que elegir bando: quédate con tu harness y apunta algunos workflows a V4 Pro, o prueba dsh con el modelo que ya usas. dsh es el retador más creíble al que se ha enfrentado Claude Code — y es un retador 0.1 contra un campeón instalado.

Las trampas antes de migrar

Hay tres límites que pesar antes de desinstalar nada.

Primero, dsh es una developer preview que rompe compatibilidad sin avisar, así que un plugin que escribes esta semana puede no cargar el mes que viene. Montar tu flujo diario encima hoy es aceptar repararlo con frecuencia.

Segundo, todos los benchmarks de V4 Pro son autodeclarados. Sin reproducción independiente, sin página de anuncio, cifras que salieron de un grupo de WeChat. Puede que sean exactas, pero nadie fuera de DeepSeek lo sabe todavía.

Tercero, el precio que hace ruido está en tiempo prestado. Desde el 16 de agosto, la facturación por franjas sube la salida hasta 3,96 $ por millón en horas pico — cuatro veces y media el precio del día del lanzamiento. dsh te da libertad total sobre la arquitectura de tu agente y casi ninguna garantía sobre lo que seguirá siendo cierto en un mes. Si tu stack de agentes hace funcionar tu negocio, esta no es la semana para moverla.

Entonces, ¿migrar o no?

Nuestra lectura tras un día dentro se resume en tres perfiles. Si construyes harnesses o herramientas de agentes, instala dsh esta semana: la arquitectura todo-plugin y el log reproducible son las dos ideas más interesantes ahora mismo, y un comando npx te da una opinión. Si solo quieres una factura de API más baja en tareas de agente, prueba V4 Pro en un proyecto paralelo — pero haz las cuentas con los precios del 16 de agosto, y espera confirmación independiente de los resultados antes de redirigir producción.

Si Claude Code mueve tu trabajo diario, quédatelo. Nada en este lanzamiento justifica migrar una herramienta que funciona a una versión 0.1 que promete roturas. La buena noticia es que este ataque obliga a todos a moverse: sea cual sea tu agente, su precio ahora tiene opciones reales de bajar.

Fuentes

Preguntas frecuentes

¿Qué es DeepSeek Harness (dsh)?
DeepSeek Harness, abreviado como dsh, es un agente de código open source publicado por DeepSeek el 13 de agosto de 2026 con licencia MIT. Es el equivalente de DeepSeek a Claude Code, construido sobre una arquitectura de «todo es un plugin» donde modelos, herramientas, sandboxes, almacenamiento e incluso la interfaz se pueden sustituir en la configuración.
¿Qué es un harness de agente?
Un harness es la maquinaria que rodea a un modelo de IA para que pueda trabajar en tu ordenador: el bucle que encadena las llamadas, las herramientas que el modelo puede usar, la gestión del contexto, los permisos y la interfaz. El modelo decide, el harness ejecuta — Claude Code es el harness de Anthropic para Claude, y Codex el de OpenAI para GPT.
¿Cómo se instala DeepSeek Harness?
Ejecuta `npx @deepseek-ai/dsh web` y se abre una interfaz web local en el puerto 3080. No hace falta cuenta ni instalador para empezar, y el repositorio también se puede compilar desde el código fuente con pnpm en cuatro comandos.
¿Es DeepSeek V4 Pro mejor que Claude?
DeepSeek reclama casi paridad: alrededor del 80,6 % en SWE-bench Verified frente al 80,8 % de Claude Opus 4.6, y 83 tokens/s frente a 52 en velocidad, aunque Opus 5 va por delante 63 a 53 en el índice de Artificial Analysis. Ninguno de estos resultados se ha reproducido de forma independiente todavía — todas las cifras publicadas vienen de DeepSeek.
¿Cuánto más barato es DeepSeek V4 Pro que Claude?
Al precio de lanzamiento (0,435 $/M de entrada, 0,87 $/M de salida), V4 Pro es unas 11 veces más barato que Claude Opus 5 en entrada y 28 en salida. Desde el 16 de agosto de 2026, la facturación por horas pico y valle sube los precios a 0,66–1,32 $ de entrada y 1,98–3,96 $ de salida, lo que aún lo deja unas 4 veces más barato que Opus 5 al peor precio.
¿Debería cambiar de Claude Code a DeepSeek Harness?
Todavía no para trabajo de producción diario. dsh es una developer preview 0.1 cuyo README avisa de cambios que rompen la compatibilidad, y los benchmarks de V4 Pro no están verificados. Merece la pena instalarlo si construyes herramientas de agentes, y V4 Pro merece una prueba en proyectos paralelos gracias a la compatibilidad con la API de Anthropic.

Vídeos relacionados