TL;DR
- El límite semanal de Claude Code pasó de una base de 100 a un nivel promocional de 150, y se fijó en un 125 permanente el 14 de septiembre de 2026. Frente al nivel promocional es un recorte del 17%; frente a la base antigua, una subida del 25%. Las dos afirmaciones son ciertas a la vez.
- En un mes de logs locales, los subagents consumieron el 48,1% de todos los tokens y el 55,3% del coste ponderado. La palanca más grande es lanzar menos subagents y fijar un modelo pequeño en los que conservas.
- Los subagents escriben una caché de 5 minutos, mientras que la sesión principal escribe una caché de 1 hora. Una petición posterior tras una pausa en frío reescribe unas 19 veces más caché que una en caliente.
- Una pausa de más de 60 minutos en una sesión principal cuesta una mediana de 130.332 tokens de reescritura de caché en la siguiente petición, frente a 1.176 cuando la pausa es de menos de 5 minutos.
- Bajar el effort no redujo la salida por petición en estos logs (media de 778 tokens en high frente a 837 en medium en sesiones principales), así que trátalo como un compromiso de calidad, no como un ahorro gratis.
- Desactivar las sugerencias de prompt y filtrar la salida de la shell son palancas reales pero pequeñas. Cuéntalas al final.
Lo que dicen las mediciones
La aritmética detrás del titular: base 100, nivel promocional 150, nivel permanente 125. 125 / 150 = 0,8333, así que el recorte es del 16,67% y se redondea a 17%. La lectura equivocada es restar los incrementos (del 50% al 25%) y hablar de un recorte del 25%. s2
La promoción duró del 13 de mayo de 2026 al 13 de septiembre de 2026, subió los límites semanales un 50% solo en Claude Code y dejó intactos los límites de 5 horas. Se aplicó a los planes Pro, Max, Team y Enterprise por puesto. s1
Las mediciones de abajo salen de los logs de Claude Code de una sola máquina: 455 sesiones principales, 2.631 ejecuciones de subagents, 63.398 peticiones deduplicadas entre 2026-09-03 y 2026-10-03. El primer hallazgo trata del propio recuento: cada petición aparece de media en 1,96 líneas de log, así que sumar todas las líneas sobreestima los tokens totales en un 99,3%. Cualquier script que lea estos logs debe deduplicar antes por (message.id, requestId). s11
Los subagents son la partida más grande. Deduplicados, suponen el 48,1% de los tokens totales, el 63,9% de los tokens de salida y el 55,3% del coste ponderado. La primera petición de una ejecución de subagent lleva un prompt mediano de 47.117 tokens antes de hacer nada; el p90 es 52.681 y el máximo 126.769. Los agentes con conjuntos de herramientas restringidos empiezan mucho más abajo (mín 5.295). s8
La elección de modelo lo agrava. Los subagents heredan el modelo de la conversación principal salvo que lo cambie un frontmatter model, un parámetro model por invocación o CLAUDE_CODE_SUBAGENT_MODEL, y desde la v2.1.251 la variable de entorno por sí sola ya no anula el frontmatter: necesitas CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. En los logs, claude-opus-5 por sí solo fue el 31,5% de todos los tokens y el 35,8% del coste ponderado, con el 63,2% de ese gasto dentro de subagents. s3
El nivel de caché lo decide dónde corre la petición. En estos datos, el 100,0% de las escrituras de caché de los subagents fueron de 5 minutos y el 100,0% de las de la sesión principal de 1 hora; ninguna petición tuvo un reparto mixto. Dentro de las ejecuciones de subagents, solo 95 de 41.790 peticiones posteriores (0,2%) llegaron tras una pausa superior a 5 minutos, pero escribieron de media 74.582 tokens de cache_creation frente a 3.886 de las peticiones en caliente. El ajuste subagentPromptCacheTtl y la variable CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL aceptan 5m o 1h y requieren Claude Code v2.1.242 o posterior. s4
Una prueba independiente vio el mismo reparto: cada petición de subagent escrita bajo ephemeral_5m_input_tokens mientras el padre usaba ephemeral_1h_input_tokens, y un agente que reescribió los 20.971 tokens de su prefijo en una petición llegada después de la ventana de cinco minutos. s6
El equivalente en la sesión principal es la pausa larga. Las peticiones que llegaron menos de 5 minutos después de la anterior escribieron una mediana de 1.176 tokens de cache_creation (n = 18.029). Entre 5 y 60 minutos, 1.327 (n = 414). Por encima de 60 minutos, 130.332 (n = 79), con un prompt mediano de 175.523 tokens y un p90 de 674.348. La documentación confirma que la facturación por overage también baja la conversación principal al nivel de cinco minutos. s3
El arranque de sesión es el coste fijo: la primera petición de una sesión principal llevaba una mediana de 55.989 tokens (p90 72.000), con una dispersión por proyecto de 15.764 a 105.020 según el tamaño de CLAUDE.md y de la memoria. Una medición pública anterior situaba el suelo en unos 29k en un directorio vacío, 30,4k con 3 servidores MCP y 38,8k en un repo real. s9
El effort es la palanca que empuja la documentación y que los logs no premian. En sesiones principales, las peticiones high produjeron una media de 778 tokens de salida frente a 837 con medium; los subagents con high produjeron 323 frente a 642. La comparación está contaminada (tareas, modelos y proyectos distintos), así que es un motivo para el escepticismo, no una prueba. La guía del propio equipo de Claude Code plantea el effort como dónde gastar razonamiento, no como un mando de presupuesto. s10
Dos consejos populares midieron poco. Las sugerencias de prompt cuestan peticiones extra, y la cifra tan compartida de "ahorra ~10%" es un techo, no un ahorro típico; el ajuste es promptSuggestionEnabled: false o CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 El filtrado de la salida de la shell durante veinte días redujo 66,7 millones de tokens de salida a 24,1 millones, pero esos 66,7 millones eran el 7,4% de los tokens nuevos consumidos en la misma ventana. s11
Mediciones
Coste de lanzamiento del subagent, prompt de la primera petición en tokens, por modelo:
| Modelo | n | mín | mediana | p90 | máx |
|---|---|---|---|---|---|
| Todos | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Reescritura de caché al reanudar, sesiones principales, por pausa antes de la petición:
| Pausa | n | cache_creation mediana | media | cache_read mediana | prompt mediana |
|---|---|---|---|---|---|
| < 5 min | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| de 5 a 60 min | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 min | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Protocolo: lee cada sesión principal ~/.claude/projects/*/<uuid>.jsonl y cada ejecución */<uuid>/subagents/agent-*.jsonl, con peticiones desde 2026-09-01. Deduplica las líneas assistant por (message.id, requestId) y conserva un solo registro usage por petición. Tokens totales = input + output + cache_read + cache_creation; tamaño del prompt = input + cache_read + cache_creation. Pausa = tiempo desde la última línea de log de la petición anterior hasta la primera línea de esta, dentro de una misma sesión o ejecución. El coste ponderado usa pesos relativos: input 1, escritura de caché 5m 1,25, escritura de caché 1h 2, cache read 0,1, output 5; estos pesos son una suposición, no una tarifa publicada.
Haz esto el lunes
- Ejecuta
/usageen tu plan y lee el desglose por skill, subagent, plugin y MCP, más los avisos de comportamiento levantados con el 10% o más del uso reciente. - Lista las definiciones de tus subagents y añade un frontmatter
model: haikuomodel: sonneta todos los que solo buscan, comprueban o resumen. - Si quieres un único modelo en cada subagent sin importar el frontmatter, define
CLAUDE_CODE_SUBAGENT_MODELyCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Comprueba que tu versión de Claude Code sea 2.1.242 o posterior y decide por workflow si
subagentPromptCacheTtl: "1h"compensa: ayuda a los subagents que esperan entre llamadas de herramienta, no a los cortos. - Antes de una pausa de más de una hora, termina la tarea en la sesión actual y escribe un archivo de traspaso; al volver abre una sesión nueva en lugar de reanudar un prompt de 175k tokens.
- Escribe un script de solo lectura sobre tus propios logs, deduplicado por (message.id, requestId), y compara la parte de sesión principal y de subagents antes de cambiar nada más.
- Define
promptSuggestionEnabled: falsesi nunca usas las sugerencias, y considera el ahorro como unos pocos puntos como mucho.
Para ir más lejos
- Max 5x frente a Max 20x: la relación de capacidad que midieron los usuarios tras el recorte es una cuestión de elección de plan que el vídeo dejó fuera. s7
- La cadena completa de precedencia del TTL de caché (env de forzado, env por bucket, ajuste por bucket,
experimental.cacheTtldel subagent) y qué cambia con la facturación por overage. s4 - Por qué cambiar el effort a mitad de sesión puede leer todo el historial sin aciertos de caché en la mayoría de modelos, y qué modelos están exentos. s3
- Cómo leer los campos
usagey los niveles de caché en los logs de tus propias sesiones, y el enfoque de ccboard para una vista de presupuesto diario. s11 - Tres archivos de subagent con tres modelos y lo que cada lanzamiento escribió realmente en caché, con las correcciones del autor al final. s8
- Las definiciones diferidas de herramientas MCP y
ENABLE_TOOL_SEARCH=auto:Npara controlar cuándo entran los esquemas de herramientas en el contexto. s3
Fuentes
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Por qué leerla: las fechas exactas, los planes y el alcance de la promo del 50%, en palabras de Anthropic.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Por qué leerla: la subida del 25% y el recorte del 17% lado a lado, con el anuncio citado.
- Manage costs effectively, Claude Code docs. Por qué leerla: el desglose de
/usage, la herencia de modelo en subagents y las reglas de effort y caché MCP. - How Claude Code uses prompt caching, Claude Code docs. Por qué leerla: la única descripción autorizada de los niveles 5m y 1h y de los ajustes de TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Por qué leerla: el hilo que destapó la caché de 5 minutos de los subagents, con el ajuste que la cambia.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Por qué leerla: una comparación de capacidad desde el lado del usuario entre los dos niveles Max tras el recorte.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Por qué leerla: un experimento reproducible de coste de lanzamiento con campos usage en bruto y correcciones honestas.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Por qué leerla: una medición del sobrecoste de arranque en un directorio vacío, con servidores MCP y en un repo real.
- Using Claude Code: Spending your effort, X, Claude Code team. Por qué leerla: cómo piensa el equipo los niveles de effort; no contiene recuentos de tokens, y ese es el punto.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Por qué leerla: un estudio de logs de veinte días que pone el filtrado de la salida de la shell en proporción al consumo total.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Por qué leerla: la afirmación original y el hilo que reduce el 10% a un techo.
FAQ
¿Es un recorte del 17% o una subida del 25%?
Las dos cosas, medidas desde bases distintas. Frente a la base previa a la promo de 100, el nivel permanente de 125 es una subida del 25%. Frente al nivel promocional de 150 que los usuarios tuvieron del 13 de mayo al 13 de septiembre de 2026, es un recorte del 17%.
¿Debo poner subagentPromptCacheTtl en 1h en todas partes?
Solo si tus subagents esperan más de cinco minutos entre peticiones. En los logs, el 0,2% de las peticiones posteriores caía en ese caso, así que un nivel 1h general paga sobre todo un precio de escritura más alto para nada. Mide primero la distribución de tus propias pausas.
¿Bajar el effort ahorra tokens?
No de forma visible en estos logs: las peticiones de sesiones principales en high produjeron una media de 778 tokens de salida frente a 837 en medium. Los datos están contaminados, así que la respuesta honesta es que el effort es un mando de calidad cuyo ahorro hay que medir en tus propias tareas.
¿Por qué cuesta tanto mi primer prompt después de comer?
La sesión principal escribe una caché de 1 hora. Tras una pausa de más de 60 minutos, la siguiente petición reescribe el prefijo: una mediana de 130.332 tokens de cache_creation en los logs, frente a 1.176 de una petición en caliente. Termina las tareas antes de las pausas largas y empieza de cero después.
AIDive