TL;DR
- DeepSeek Harness (dsh) es un agente de código con licencia MIT donde los modelos, las herramientas, los sandboxes, el almacenamiento, los bucles y la interfaz son plugins que se cambian desde la configuración. El repositorio ya supera las 21,000 estrellas y los 12,000 commits.
- La idea más fuerte es el registro de sesión de solo anexado: se reproduce una sesión que se descarriló evento por evento, en lugar de desplazarse por una transcripción.
- DeepSeek V4 Pro 0813 afirma alrededor de 80.6% en SWE-bench Verified, frente a 80.8% de Claude Opus 4.6. Todas las puntuaciones son autodeclaradas; nadie independiente ha reproducido ninguna todavía.
- El precio de lanzamiento es $0.435 por millón de tokens de entrada y $0.87 de salida. Desde el 16 de agosto la API pasa a facturación en hora punta y valle, y la salida sube hasta $3.96 en hora punta, que sigue siendo unas cuatro veces más barato que Opus 5.
- dsh es una vista previa para desarrolladores 0.1 cuyo README promete cambios que rompen compatibilidad. Quienes crean herramientas deberían instalarlo esta semana, quienes quieren recortar costes deberían probar V4 Pro en un proyecto secundario con las tarifas del 16 de agosto, y quienes usan Claude Code a diario deberían quedarse donde están.
Lo que dicen las fuentes
Arquitectura
Todo el harness descansa sobre un núcleo llamado Cordis, y la página oficial describe cada capacidad como algo que se puede seleccionar, cambiar o extender desde la configuración sin tocar el código del harness s8. Eso va más allá de los skills y los servidores MCP de Claude Code: en Claude Code se extiende el agente por los bordes, en dsh se pueden recomponer el sandbox, el almacenamiento de sesiones y el propio bucle s1. Un topic de GitHub, dsh-plugin, ya lista plugins de la comunidad, incluidos plugins de modelos que permiten ejecutar el harness con modelos distintos a los de DeepSeek s10.
La instalación es un solo comando: npx @deepseek-ai/dsh web arranca una interfaz web local en el puerto 3080, sin cuenta, y la misma base de código sirve el modo terminal. Clonar y compilar el repositorio completo requiere cuatro comandos de pnpm s2.
dsh trae cuatro modos de ejecución. Standard es el agente de código completo (edición de archivos, shell, búsqueda, planificación). Code hace que el modelo escriba TypeScript que orquesta por sí mismo las operaciones de varios pasos, en lugar de encadenar llamadas a herramientas una por una, lo que reduce los viajes de ida y vuelta a la API en tareas largas. Minimal reduce el agente a bash más un editor de archivos, sobre todo para evaluar el modelo en bruto. Creator sirve para construir tus propios presets con inspección del runtime en vivo s8.
Todo lo que ve el modelo va a un registro de sesión de solo anexado: prompts, razonamiento, llamadas a herramientas, inyecciones de contexto. Ese registro es la fuente de verdad del harness, así que cualquier sesión se puede reanudar, bifurcar, buscar o reproducir desde el flujo de eventos s1.
El modelo
V4 Pro 0813 es un modelo mixture-of-experts con una ventana de contexto de 1M tokens, hasta 384,000 tokens de salida, llamadas a herramientas y salida JSON s4. La API de DeepSeek anuncia compatibilidad con la API de Anthropic, así que una herramienta escrita para Claude puede apuntar a V4 Pro cambiando una URL base y una clave s3.
Las cifras de DeepSeek sitúan a la variante Max en alrededor de 80.6% en SWE-bench Verified frente a 80.8% de Claude Opus 4.6, con victorias declaradas en Terminal Bench 2.1 y varios benchmarks de agentes frente a Opus 4.8. En el índice de Artificial Analysis, V4 Pro está en 53 mientras que Opus 5 está en 63 y Fable 5 en 62. En velocidad, produce 83 tokens por segundo donde Opus 5 hace 52 s5.
Ninguna de esas puntuaciones ha sido reproducida por un tercero. Los benchmarks circularon primero en el grupo oficial de WeChat de DeepSeek, luego en un post de Reddit que los moderadores eliminaron, y después como una tabla ASCII en Hacker News. No hay página de anuncio oficial y los pesos abiertos no están confirmados, aunque tanto el V4 Pro de abril como el V4 Flash de julio acabaron en Hugging Face. La única observación práctica hasta ahora: tres niveles de razonamiento dieron tres resultados radicalmente distintos con el mismo prompt de dibujo, algo que no se ha visto en ningún otro modelo s5.
Precios
En el lanzamiento, V4 Pro cuesta $0.435 por millón de tokens de entrada y $0.87 por millón de salida, y el contexto de 1M se factura a la tarifa estándar, sin recargo por contexto largo s3. Claude Opus 5 está en $5 de entrada y $25 de salida, Fable 5 en $10 y $50, Sonnet 5 en $2 y $10 s6. Eso hace que V4 Pro sea unas 11 veces más barato que Opus 5 en entrada y 28 veces en salida, y todavía de 4 a 11 veces más barato que Sonnet 5 s3.
Una sesión típica de agente de 50,000 tokens de entrada y 15,000 de salida cuesta unos $0.62 en Opus 5 y $0.035 en V4 Pro con las tarifas de lanzamiento. La línea oculta para los agentes es la caché: un harness reenvía el mismo contexto en cada turno, así que la mayoría de los tokens de entrada son relecturas. Un acierto de caché cuesta $0.50 por millón en Opus 5 s6 y $0.0036 en DeepSeek, una proporción de 138 a uno justo donde un agente más gasta s3.
Desde el 16 de agosto, tres días después del lanzamiento, la API cambia a facturación en hora punta y valle. En hora valle, V4 Pro sube a $0.66 de entrada y $1.98 de salida. En hora punta, entre la 1h y las 4h y entre las 6h y las 10h UTC, es $1.32 y $3.96 s3. La salida en hora punta es cuatro veces y media la tarifa del día de lanzamiento, un aumento del 355%. Incluso en la peor tarifa, V4 Pro sigue siendo casi cuatro veces más barato que Opus 5 s6. Las horas punta coinciden con la jornada laboral china, así que los cron jobs y las ejecuciones nocturnas en Europa pueden apuntar a la hora valle, mientras que programar en directo por la tarde caerá en algunas franjas punta.
Recepción
El post de Hacker News superó los 990 puntos en un día s7. Bloomberg presentó el lanzamiento como un desafío directo a Claude Code, el harness de Anthropic ligado a los modelos Claude s9.
Veredicto
| Pieza | Mantener, probar u omitir | Por qué |
|---|---|---|
| Arquitectura de plugins de dsh | Probar | Sandbox, almacenamiento y bucle son intercambiables; el diseño de harness más interesante del momento |
| Registro de sesión reproducible de dsh | Probar | Reproducir evento por evento supera a leer una transcripción cuando un agente se descarrila |
| dsh como herramienta diaria | Omitir por ahora | Vista previa 0.1, el README promete cambios que rompen, sin historial en producción |
| V4 Pro en proyectos secundarios | Probar | Contexto de 1M, compatibilidad con la API de Anthropic, aciertos de caché a $0.0036 |
| V4 Pro en producción | Esperar | Puntuaciones solo autodeclaradas, sin página de anuncio, pesos sin confirmar |
| Tarifa de lanzamiento en tu hoja de cálculo | Omitir | Caduca el 16 de agosto; modela con $0.66/$1.98 en hora valle y $1.32/$3.96 en hora punta |
| Claude Code para el trabajo diario | Mantener | Puntuaciones de modelo verificadas, ecosistema maduro, suscripción fija |
Haz esto el lunes
- Ejecuta
npx @deepseek-ai/dsh web, abre 127.0.0.1:3080 y dedica treinta minutos al modo Standard en un repositorio desechable. - Pasa la misma tarea al modo Code y cuenta los viajes de ida y vuelta a la API frente al modo Standard.
- Fuerza un fallo y luego reproduce el registro de sesión hasta el evento donde salió mal y compáralo con leer una transcripción de Claude Code.
- Apunta un script existente compatible con Anthropic a la URL base de DeepSeek con una clave de V4 Pro y comprueba que las llamadas a herramientas y la salida JSON siguen funcionando.
- Rehaz tu estimación de costes con las tarifas del 16 de agosto: $0.66/$1.98 en hora valle, $1.32/$3.96 en hora punta, y marca cuáles de tus ejecuciones caen entre 1h y 4h o entre 6h y 10h UTC.
- Mide tu proporción de aciertos de caché en una sesión real de agente antes de fiarte de la proporción de 138 a uno.
- Vigila el topic dsh-plugin de GitHub por si aparece un plugin de modelo que ejecute tu modelo actual dentro de dsh.
- Mantén Claude Code por defecto y pon un recordatorio en el calendario para reevaluar cuando un tercero publique una reproducción de SWE-bench Verified.
Para ir más lejos
- Lee el quickstart y compila dsh desde el código fuente con pnpm para ver cómo los modos web y terminal comparten una sola base de código s2.
- Estudia el núcleo Cordis y la sección "Everything is a Plugin" antes de escribir un plugin, ya que el sistema de presets es donde ocurre la recomposición s8.
- Sigue el topic dsh-plugin para ver qué plugins de la comunidad aparecen primero: modelos, sandboxes o almacenamiento indican hacia dónde va el ecosistema s10.
- Lee la cadena de WeChat a Reddit y a Hacker News por la que pasaron las cifras de benchmark antes de citar el 80.6% en cualquier sitio s5.
- Revisa la ficha de OpenRouter para ver el techo de 384,000 tokens de salida y la mezcla de proveedores si quieres V4 Pro sin una cuenta directa de DeepSeek s4.
- Compara la página de precios de caché de Claude con la línea de acierto de caché de DeepSeek; la caché por turno es donde más divergen las facturas de los agentes s6.
- Repasa el hilo de Hacker News para encontrar a los primeros autores de plugins y los primeros informes de cambios que rompen entre builds de la vista previa s7.
Fuentes
- deepseek-ai/deepseek-harness, GitHub. Por qué leerlo: aquí están la advertencia del README, el número de estrellas y commits y el diseño del registro de sesión.
- DeepSeek Harness quickstart guide, DeepSeek. Por qué leerlo: la instalación en una línea y la compilación desde el código fuente en cuatro comandos.
- DeepSeek API pricing, DeepSeek. Por qué leerlo: las tarifas de lanzamiento, la cuadrícula de hora punta y valle del 16 de agosto y la nota de compatibilidad con Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Por qué leerlo: los límites de contexto, salida y funciones en una sola ficha.
- First impressions of DeepSeek V4 Pro, Simon Willison. Por qué leerlo: el único relato cuidadoso de dónde salieron las cifras de benchmark.
- Claude model pricing, Anthropic. Por qué leerlo: las tarifas de Opus 5, Fable 5 y Sonnet 5 detrás de cada multiplicador de este pack.
- Hacker News discussion of the dsh launch, Hacker News. Por qué leerlo: reacciones de profesionales y los primeros experimentos con plugins.
- DeepSeek Harness home page, DeepSeek. Por qué leerlo: el modelo de plugins, Cordis y los cuatro modos de ejecución tal como los describe DeepSeek.
- Claude Code product page, Anthropic. Por qué leerlo: cómo se presenta el actor establecido, útil para comparar función por función.
- GitHub topic dsh-plugin, GitHub. Por qué leerlo: la lista en vivo de plugins de la comunidad.
FAQ
¿Puedo usar dsh con un modelo de Claude?
El harness acepta modelos distintos a los de DeepSeek mediante plugins de modelos, y el topic dsh-plugin ya lista algunos. Las dos mitades del lanzamiento se prueban por separado: dsh con tu modelo actual, o tu harness actual con V4 Pro a través de la API compatible con Anthropic.
¿Es real la diferencia de precio de 28x?
Con las tarifas de lanzamiento, sí: $0.87 frente a $25 por millón de tokens de salida. Desde el 16 de agosto la diferencia baja a cerca de 4x en hora punta, así que presupuesta con la cuadrícula posterior.
¿Por qué no fiarse de la puntuación de 80.6% en SWE-bench?
Es la cifra de la propia DeepSeek, salida de un grupo de WeChat y de una tabla ASCII, sin página de anuncio y sin reproducción independiente hasta ahora. Puede que sea correcta; nadie fuera de DeepSeek la ha comprobado.
¿Qué cambia en la práctica el registro de solo anexado?
Cuando un agente se descarrila en la llamada a herramienta 42, reproduces la sesión hasta ese evento y ves exactamente qué tenía el modelo en contexto, en lugar de reconstruirlo a partir de una transcripción plana.
AIDive