AIDive

Pack de vídeo

Las 400,000 sesiones de Claude Code de Anthropic: cifras, veredicto y checklist del lunes

9 min de lectura

TL;DR

  • Anthropic evaluó 400,000 sesiones de Claude Code de 235,000 personas y encontró que los managers, no los ingenieros de software, tienen la mejor tasa de éxito verificado.
  • Saber programar aporta muy poco: las ocupaciones de software verifican el 34% de las sesiones que producen código, todas las demás el 29%, y los dos grupos empatan en éxito parcial, 89% frente a 88%.
  • Lo que marca la diferencia es el nivel del usuario. Los novatos obtienen unas 5 acciones del agente y 600 palabras por prompt con un 15% de éxito verificado; los expertos obtienen 12 acciones y 3,200 palabras con un 28 a 33%.
  • Tres hábitos explican casi toda la mejora: poner tu propio contexto en el prompt, cerrar con una prueba verificable y quedarte en la sesión cuando algo falla en lugar de cerrarla.
  • El techo es bajo para todos: incluso los expertos verifican como máximo un tercio de las sesiones, y el primer puesto de los managers puede deberse en parte a un artefacto de medición.

Lo que dicen las fuentes

El estudio es una pasada de clasificador sobre 400,000 sesiones interactivas de Claude Code de 235,000 personas, registradas entre octubre de 2025 y abril de 2026 s1. Nadie leyó las conversaciones. Un clasificador construido sobre Sonnet 4.6 puntuó cada sesión, y sus puntuaciones se contrastaron con la telemetría, es decir, commits, cambios de código y resultados de tests; en las sesiones que modifican código, clasificador y telemetría coinciden más del 90% de las veces s1. Claude Code es el agente de terminal que lee tus archivos, escribe código y ejecuta comandos a partir de una petición en lenguaje natural s2.

Tres definiciones determinan cómo se leen las cifras. Éxito verificado significa que el clasificador encontró evidencia sólida de que se cumplió el objetivo, por ejemplo tests que pasan o una confirmación explícita del usuario. Éxito parcial significa que el objetivo se alcanzó al menos en parte. La experiencia no es un cargo: el clasificador puntúa cómo se comporta el usuario dentro de la sesión, en cinco niveles de novato a experto, con tres señales: la precisión de las instrucciones, lo que el usuario pide al agente que verifique y si el usuario corrige al agente s1.

El resultado por ocupación es el titular. En sesiones que producen código, las ocupaciones de software alcanzan un 34% de éxito verificado y el resto un 29%, una diferencia de cinco puntos que se mantuvo estable durante los siete meses mientras ambos grupos mejoraban s1. En éxito parcial los dos grupos están a la par, 89% frente a 88% s1. Los diez mayores grupos de ocupaciones quedan todos a menos de siete puntos de los desarrolladores, y el grupo de dirección está arriba del todo s1. El predictor que sí importa, Anthropic lo llama experiencia de dominio: conocer a fondo el problema que estás resolviendo.

El reparto del trabajo lo explica. En una sesión típica el humano toma cerca del 70% de las decisiones de planificación, qué construir, pero solo el 20% de las de ejecución, cómo escribirlo s1. Un manager que sabe exactamente qué debe hacer el producto tiene la mitad que cuenta. El mismo cambio se ve en para qué se usa el agente: en siete meses la proporción de sesiones de depuración bajó del 33% al 19%, ejecutar software subió del 14% al 21%, el análisis de datos y la redacción de documentos casi se duplicaron, y el valor estimado de la tarea media encargada al agente subió un 27% s1.

La autonomía hace que cada frase pese más. Una sesión típica tiene solo unos cuatro intercambios entre usuario y agente, cada prompt dispara de media unas diez acciones, y un solo prompt a veces dispara más de cien s1. Cuando solo hablas cuatro veces, la precisión de cada línea es casi toda tu aportación.

La escala de niveles es donde están las cifras prácticas. Un novato escribe instrucciones genéricas sin conocimiento del dominio; cada prompt dispara unas 5 acciones del agente y devuelve unas 600 palabras de trabajo, y el éxito verificado se queda en un 15% s1. Un experto escribe prompts cargados de contexto; el mismo agente encadena 12 acciones y produce 3,200 palabras por instrucción, y el éxito verificado queda entre el 28% y el 33% s1. Eso es unas cinco veces más trabajo entregado y el doble de éxito con la misma herramienta y la misma suscripción, con la persona al teclado como única variable. Casi toda esa mejora está entre novato e intermedio, que es el paso que cubren los tres hábitos de abajo.

Los hábitos se corresponden con las tres señales del clasificador. Precisión de las instrucciones: di dónde actuar, con qué y cómo es un resultado terminado. Verificación: cierra el prompt con una condición comprobable, ejecuta los tests, enséñame el render, confirma que la página carga; el estudio halla que esto es lo que separa un éxito juzgado de uno verificado s1. Corrección: los novatos aceptan el resultado de forma pasiva y abandonan cuatro veces más que los demás usuarios en cuanto algo falla, mientras que volver a explicar el problema con tus palabras es justo lo que mide la tercera señal s1. Ninguna de las tres exige una línea de código.

Los límites los declara el propio estudio. Incluso los expertos verifican entre el 28% y el 33% de las sesiones, así que dos de cada tres terminan sin prueba sólida de que se cumplió el objetivo, como mucho con un éxito parcial, que sí supera el 90% s1. La clasificación de los managers tiene un posible sesgo de medición: el éxito verificado cuenta las confirmaciones explícitas del usuario, y confirmar con claridad que el trabajo se acepta es un hábito de manager s1. Y la muestra son usuarios de Claude Code, un público de línea de comandos ya más motivado que la media, así que nada garantiza las mismas cifras en otra herramienta s1. El hilo de la comunidad sobre consejos para principiantes sirve de contraste desde el otro lado: lo que se aconseja a los recién llegados coincide con las tres señales, da contexto, pide comprobaciones, sigue guiando s3.

Veredicto: qué respalda el estudio

Afirmación Estado Base
Hay que saber programar para obtener código que funcione del agente Descartar 34% frente a 29% verificado, 89% frente a 88% parcial, managers arriba s1
Poner tu propio contexto en el prompt compensa Mantener 5 frente a 12 acciones, 600 frente a 3,200 palabras por prompt entre novato y experto s1
Cerrar el prompt con una condición de prueba compensa Mantener La verificación es una de las tres señales del clasificador; separa el éxito juzgado del verificado s1
Quedarte en la sesión tras un fallo compensa Mantener Los novatos abandonan cuatro veces más; la corrección es la tercera señal s1
Llegar a nivel experto hace fiable al agente Descartar Los expertos siguen verificando solo el 28 a 33% de las sesiones s1
Los managers son mejores que los ingenieros en esto Probar, con cautela Posible sesgo: el éxito verificado cuenta las confirmaciones explícitas del usuario s1
Estas cifras se trasladan a otras herramientas de IA Descartar La muestra son solo usuarios de Claude Code s1

Qué hacer el lunes

  • Toma el último prompt que enviaste a un agente y reescríbelo con tres bloques: dónde actuar, con qué (el archivo, la ruta, el dataset o el documento existente) y cómo es el resultado terminado.
  • Añade una cláusula de prueba al final de cada prompt esta semana: ejecuta los tests, abre la página, comprueba que todos los enlaces responden, enséñame el diff.
  • Cuando una sesión se tuerza, escribe una corrección antes de cerrarla: qué pasó, qué esperabas, dónde mirar. Cuenta cuántas veces el siguiente turno lo arregla.
  • Anota los tres datos de tu proyecto que solo tú conoces (audiencia, restricciones, lo que no debe cambiar) y pégalos al principio de tu próxima sesión.
  • Pasa una tarea que no sea de código por el agente, el borrador de una newsletter o una reescritura de precios, con los mismos tres bloques, y compara con tu forma habitual.
  • Lleva un recuento durante cinco sesiones: verificada, parcial o nada. Compáralo con las franjas del estudio, 15% de novato y 28 a 33% de experto.
  • Si un bloque de tu prompt queda vacío porque no sabes la respuesta, resuélvelo con un compañero o un documento antes de lanzar la sesión, no después.

Para ir más lejos

  • Lee la sección de metodología antes de citar cualquier cifra: el clasificador es Sonnet 4.6, contrastado con la telemetría con más del 90% de coincidencia en sesiones que modifican código s1.
  • El gráfico de acciones por prompt según el nivel es la imagen más clara del salto de novato a experto, de 5 a 12 acciones y de 600 a 3,200 palabras s1.
  • La sección de mezcla de tareas muestra la depuración bajando del 33% al 19% y ejecutar software subiendo del 14% al 21% en siete meses, un buen argumento cuando alguien dice que los agentes solo sirven para arreglar bugs s1.
  • El reparto 70% planificación frente a 20% ejecución es la cifra que llevar a una discusión de equipo sobre quién debería manejar un agente s1.
  • Vuelve a leer la nota de sesgo sobre el éxito verificado y las confirmaciones explícitas del usuario antes de usar el resultado de los managers en una presentación s1.
  • Para ver cómo funciona realmente el agente en una terminal, qué lee, escribe y ejecuta, empieza por la página del producto s2.
  • El hilo de consejos para principiantes es donde los recién llegados intercambian hábitos concretos de prompt; léelo con las tres señales en mente y ordena los consejos según la señal a la que sirven s3.

Fuentes

FAQ

¿El estudio dice que quien no programa es tan bueno como los desarrolladores?

No exactamente. Los desarrolladores mantienen cinco puntos de ventaja en éxito verificado, 34% frente a 29%, y se mantuvo estable durante siete meses. El estudio dice que la ventaja es pequeña y que el nivel del usuario dentro de la sesión predice mucho más que el cargo.

¿Qué cuenta como éxito verificado?

Evidencia sólida de que se cumplió el objetivo: tests que pasan, un resultado que funciona y que el clasificador puede confirmar con la telemetría, o una confirmación explícita del usuario. Este último punto es la razón del posible sesgo en el resultado de los managers.

¿Puedo subir de nivel sin aprender a programar?

Sí. El clasificador puntúa la precisión de las instrucciones, lo que le pides al agente que verifique y si lo corriges. Las tres son descripciones de tu problema y de tu criterio, no código.

¿Por qué el techo es tan bajo incluso para los expertos?

El estudio solo cuenta una sesión como verificada cuando hay prueba. Los expertos llegan a un 28 a 33% verificado, pero el éxito parcial supera el 90%, así que la mayoría de las sesiones entregan algo; lo que falta es la prueba de que está terminado.