AIDive

Pack de vídeo

Recorte del límite de Claude Code: palancas medidas, tablas de caché y checklist

10 min de lectura

TL;DR

  • El límite semanal de Claude Code pasó de una base de 100 a un nivel promocional de 150, y se fijó en un 125 permanente el 14 de septiembre de 2026. Frente al nivel promocional es un recorte del 17%; frente a la base antigua, una subida del 25%. Las dos afirmaciones son ciertas a la vez.
  • En un mes de logs locales, los subagents consumieron el 48,1% de todos los tokens y el 55,3% del coste ponderado. La palanca más grande es lanzar menos subagents y fijar un modelo pequeño en los que conservas.
  • Los subagents escriben una caché de 5 minutos, mientras que la sesión principal escribe una caché de 1 hora. Una petición posterior tras una pausa en frío reescribe unas 19 veces más caché que una en caliente.
  • Una pausa de más de 60 minutos en una sesión principal cuesta una mediana de 130.332 tokens de reescritura de caché en la siguiente petición, frente a 1.176 cuando la pausa es de menos de 5 minutos.
  • Bajar el effort no redujo la salida por petición en estos logs (media de 778 tokens en high frente a 837 en medium en sesiones principales), así que trátalo como un compromiso de calidad, no como un ahorro gratis.
  • Desactivar las sugerencias de prompt y filtrar la salida de la shell son palancas reales pero pequeñas. Cuéntalas al final.

Lo que dicen las mediciones

La aritmética detrás del titular: base 100, nivel promocional 150, nivel permanente 125. 125 / 150 = 0,8333, así que el recorte es del 16,67% y se redondea a 17%. La lectura equivocada es restar los incrementos (del 50% al 25%) y hablar de un recorte del 25%. s2

La promoción duró del 13 de mayo de 2026 al 13 de septiembre de 2026, subió los límites semanales un 50% solo en Claude Code y dejó intactos los límites de 5 horas. Se aplicó a los planes Pro, Max, Team y Enterprise por puesto. s1

Las mediciones de abajo salen de los logs de Claude Code de una sola máquina: 455 sesiones principales, 2.631 ejecuciones de subagents, 63.398 peticiones deduplicadas entre 2026-09-03 y 2026-10-03. El primer hallazgo trata del propio recuento: cada petición aparece de media en 1,96 líneas de log, así que sumar todas las líneas sobreestima los tokens totales en un 99,3%. Cualquier script que lea estos logs debe deduplicar antes por (message.id, requestId). s11

Los subagents son la partida más grande. Deduplicados, suponen el 48,1% de los tokens totales, el 63,9% de los tokens de salida y el 55,3% del coste ponderado. La primera petición de una ejecución de subagent lleva un prompt mediano de 47.117 tokens antes de hacer nada; el p90 es 52.681 y el máximo 126.769. Los agentes con conjuntos de herramientas restringidos empiezan mucho más abajo (mín 5.295). s8

La elección de modelo lo agrava. Los subagents heredan el modelo de la conversación principal salvo que lo cambie un frontmatter model, un parámetro model por invocación o CLAUDE_CODE_SUBAGENT_MODEL, y desde la v2.1.251 la variable de entorno por sí sola ya no anula el frontmatter: necesitas CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. En los logs, claude-opus-5 por sí solo fue el 31,5% de todos los tokens y el 35,8% del coste ponderado, con el 63,2% de ese gasto dentro de subagents. s3

El nivel de caché lo decide dónde corre la petición. En estos datos, el 100,0% de las escrituras de caché de los subagents fueron de 5 minutos y el 100,0% de las de la sesión principal de 1 hora; ninguna petición tuvo un reparto mixto. Dentro de las ejecuciones de subagents, solo 95 de 41.790 peticiones posteriores (0,2%) llegaron tras una pausa superior a 5 minutos, pero escribieron de media 74.582 tokens de cache_creation frente a 3.886 de las peticiones en caliente. El ajuste subagentPromptCacheTtl y la variable CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL aceptan 5m o 1h y requieren Claude Code v2.1.242 o posterior. s4

Una prueba independiente vio el mismo reparto: cada petición de subagent escrita bajo ephemeral_5m_input_tokens mientras el padre usaba ephemeral_1h_input_tokens, y un agente que reescribió los 20.971 tokens de su prefijo en una petición llegada después de la ventana de cinco minutos. s6

El equivalente en la sesión principal es la pausa larga. Las peticiones que llegaron menos de 5 minutos después de la anterior escribieron una mediana de 1.176 tokens de cache_creation (n = 18.029). Entre 5 y 60 minutos, 1.327 (n = 414). Por encima de 60 minutos, 130.332 (n = 79), con un prompt mediano de 175.523 tokens y un p90 de 674.348. La documentación confirma que la facturación por overage también baja la conversación principal al nivel de cinco minutos. s3

El arranque de sesión es el coste fijo: la primera petición de una sesión principal llevaba una mediana de 55.989 tokens (p90 72.000), con una dispersión por proyecto de 15.764 a 105.020 según el tamaño de CLAUDE.md y de la memoria. Una medición pública anterior situaba el suelo en unos 29k en un directorio vacío, 30,4k con 3 servidores MCP y 38,8k en un repo real. s9

El effort es la palanca que empuja la documentación y que los logs no premian. En sesiones principales, las peticiones high produjeron una media de 778 tokens de salida frente a 837 con medium; los subagents con high produjeron 323 frente a 642. La comparación está contaminada (tareas, modelos y proyectos distintos), así que es un motivo para el escepticismo, no una prueba. La guía del propio equipo de Claude Code plantea el effort como dónde gastar razonamiento, no como un mando de presupuesto. s10

Dos consejos populares midieron poco. Las sugerencias de prompt cuestan peticiones extra, y la cifra tan compartida de "ahorra ~10%" es un techo, no un ahorro típico; el ajuste es promptSuggestionEnabled: false o CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 El filtrado de la salida de la shell durante veinte días redujo 66,7 millones de tokens de salida a 24,1 millones, pero esos 66,7 millones eran el 7,4% de los tokens nuevos consumidos en la misma ventana. s11

Mediciones

Coste de lanzamiento del subagent, prompt de la primera petición en tokens, por modelo:

Modelo n mín mediana p90 máx
Todos 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Reescritura de caché al reanudar, sesiones principales, por pausa antes de la petición:

Pausa n cache_creation mediana media cache_read mediana prompt mediana
< 5 min 18,029 1,176 2,391 184,169 186,412
de 5 a 60 min 414 1,327 5,575 221,857 225,168
> 60 min 79 130,332 241,499 25,264 175,523

Protocolo: lee cada sesión principal ~/.claude/projects/*/<uuid>.jsonl y cada ejecución */<uuid>/subagents/agent-*.jsonl, con peticiones desde 2026-09-01. Deduplica las líneas assistant por (message.id, requestId) y conserva un solo registro usage por petición. Tokens totales = input + output + cache_read + cache_creation; tamaño del prompt = input + cache_read + cache_creation. Pausa = tiempo desde la última línea de log de la petición anterior hasta la primera línea de esta, dentro de una misma sesión o ejecución. El coste ponderado usa pesos relativos: input 1, escritura de caché 5m 1,25, escritura de caché 1h 2, cache read 0,1, output 5; estos pesos son una suposición, no una tarifa publicada.

Haz esto el lunes

  • Ejecuta /usage en tu plan y lee el desglose por skill, subagent, plugin y MCP, más los avisos de comportamiento levantados con el 10% o más del uso reciente.
  • Lista las definiciones de tus subagents y añade un frontmatter model: haiku o model: sonnet a todos los que solo buscan, comprueban o resumen.
  • Si quieres un único modelo en cada subagent sin importar el frontmatter, define CLAUDE_CODE_SUBAGENT_MODEL y CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Comprueba que tu versión de Claude Code sea 2.1.242 o posterior y decide por workflow si subagentPromptCacheTtl: "1h" compensa: ayuda a los subagents que esperan entre llamadas de herramienta, no a los cortos.
  • Antes de una pausa de más de una hora, termina la tarea en la sesión actual y escribe un archivo de traspaso; al volver abre una sesión nueva en lugar de reanudar un prompt de 175k tokens.
  • Escribe un script de solo lectura sobre tus propios logs, deduplicado por (message.id, requestId), y compara la parte de sesión principal y de subagents antes de cambiar nada más.
  • Define promptSuggestionEnabled: false si nunca usas las sugerencias, y considera el ahorro como unos pocos puntos como mucho.

Para ir más lejos

  • Max 5x frente a Max 20x: la relación de capacidad que midieron los usuarios tras el recorte es una cuestión de elección de plan que el vídeo dejó fuera. s7
  • La cadena completa de precedencia del TTL de caché (env de forzado, env por bucket, ajuste por bucket, experimental.cacheTtl del subagent) y qué cambia con la facturación por overage. s4
  • Por qué cambiar el effort a mitad de sesión puede leer todo el historial sin aciertos de caché en la mayoría de modelos, y qué modelos están exentos. s3
  • Cómo leer los campos usage y los niveles de caché en los logs de tus propias sesiones, y el enfoque de ccboard para una vista de presupuesto diario. s11
  • Tres archivos de subagent con tres modelos y lo que cada lanzamiento escribió realmente en caché, con las correcciones del autor al final. s8
  • Las definiciones diferidas de herramientas MCP y ENABLE_TOOL_SEARCH=auto:N para controlar cuándo entran los esquemas de herramientas en el contexto. s3

Fuentes

FAQ

¿Es un recorte del 17% o una subida del 25%?

Las dos cosas, medidas desde bases distintas. Frente a la base previa a la promo de 100, el nivel permanente de 125 es una subida del 25%. Frente al nivel promocional de 150 que los usuarios tuvieron del 13 de mayo al 13 de septiembre de 2026, es un recorte del 17%.

¿Debo poner subagentPromptCacheTtl en 1h en todas partes?

Solo si tus subagents esperan más de cinco minutos entre peticiones. En los logs, el 0,2% de las peticiones posteriores caía en ese caso, así que un nivel 1h general paga sobre todo un precio de escritura más alto para nada. Mide primero la distribución de tus propias pausas.

¿Bajar el effort ahorra tokens?

No de forma visible en estos logs: las peticiones de sesiones principales en high produjeron una media de 778 tokens de salida frente a 837 en medium. Los datos están contaminados, así que la respuesta honesta es que el effort es un mando de calidad cuyo ahorro hay que medir en tus propias tareas.

¿Por qué cuesta tanto mi primer prompt después de comer?

La sesión principal escribe una caché de 1 hora. Tras una pausa de más de 60 minutos, la siguiente petición reescribe el prefijo: una mediana de 130.332 tokens de cache_creation en los logs, frente a 1.176 de una petición en caliente. Termina las tareas antes de las pausas largas y empieza de cero después.