TL;DR
- O limite semanal do Claude Code passou de uma base de 100 para um nível promocional de 150, e depois se fixou em um 125 permanente em 14 de setembro de 2026. Em relação ao nível promocional, é um corte de 17%; em relação à base antiga, um aumento de 25%. As duas afirmações são verdadeiras ao mesmo tempo.
- Em um mês de logs locais, os subagentes consumiram 48.1% de todos os tokens e 55.3% do custo ponderado. A maior alavanca isolada é lançar menos subagentes e fixar um modelo pequeno nos que você mantém.
- Os subagentes gravam um cache de 5 minutos, enquanto a sessão principal grava um cache de 1 hora. Uma requisição seguinte depois de uma pausa fria regrava cerca de 19 vezes mais cache do que uma requisição quente.
- Uma pausa de mais de 60 minutos em uma sessão principal custa, na mediana, 130,332 tokens de regravação de cache na requisição seguinte, contra 1,176 quando a pausa é menor que 5 minutos.
- Reduzir o esforço não reduziu a saída por requisição nesses logs (média de 778 tokens em high contra 837 em medium nas sessões principais), então trate isso como uma troca de qualidade, não como economia gratuita.
- Desativar as sugestões de prompt e filtrar a saída do shell são alavancas reais, mas pequenas. Deixe-as para o fim.
O que as medições mostram
A conta por trás da manchete: base 100, nível promocional 150, nível permanente 125. 125 / 150 = 0.8333, então o corte é de 16.67% e arredonda para 17%. A leitura errada é subtrair os incrementos (50% para 25%) e chamar isso de corte de 25%. s2
A promoção valeu de 13 de maio de 2026 a 13 de setembro de 2026, aumentou os limites semanais em 50% apenas no Claude Code e não mexeu nos limites de 5 horas. Ela se aplicou aos planos Pro, Max, Team e Enterprise por assento. s1
As medições abaixo vêm dos logs do Claude Code de uma única máquina: 455 sessões principais, 2,631 execuções de subagentes, 63,398 requisições deduplicadas entre 2026-09-03 e 2026-10-03. A primeira descoberta é sobre a própria contagem: cada requisição aparece em 1.96 linhas de log em média, então somar todas as linhas superestima o total de tokens em 99.3%. Qualquer script que leia esses logs precisa deduplicar por (message.id, requestId) primeiro. s11
Os subagentes são a maior linha. Deduplicados, respondem por 48.1% do total de tokens, 63.9% dos tokens de saída e 55.3% do custo ponderado. A primeira requisição de uma execução de subagente carrega um prompt mediano de 47,117 tokens antes de fazer qualquer coisa; o p90 é 52,681 e o máximo 126,769. Agentes com conjuntos de ferramentas restritos começam muito mais baixo (mín. 5,295). s8
A escolha do modelo agrava isso. Os subagentes herdam o modelo da conversa principal, a menos que um frontmatter model, um parâmetro model por invocação ou CLAUDE_CODE_SUBAGENT_MODEL diga outra coisa, e desde a v2.1.251 a variável de ambiente sozinha não sobrescreve mais o frontmatter: é preciso CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Nos logs, só o claude-opus-5 foi 31.5% de todos os tokens e 35.8% do custo ponderado, com 63.2% disso gasto dentro de subagentes. s3
A faixa de cache é decidida pelo lugar onde a requisição roda. Nesses dados, 100.0% das gravações de cache dos subagentes foram de 5 minutos e 100.0% das gravações de cache da sessão principal foram de 1 hora; nenhuma requisição teve divisão mista. Dentro das execuções de subagentes, apenas 95 de 41,790 requisições seguintes (0.2%) chegaram após uma pausa acima de 5 minutos, mas elas gravaram em média 74,582 tokens de cache_creation, contra 3,886 das requisições quentes. A configuração subagentPromptCacheTtl e a variável de ambiente CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL aceitam 5m ou 1h e exigem o Claude Code v2.1.242 ou posterior. s4
Uma execução independente viu a mesma divisão: toda requisição de subagente gravada em ephemeral_5m_input_tokens enquanto o pai usava ephemeral_1h_input_tokens, e um agente regravando todos os 20,971 tokens do seu prefixo em uma requisição que veio depois da janela de cinco minutos. s6
O equivalente na sessão principal é a pausa longa. Requisições que chegam menos de 5 minutos depois da anterior gravaram uma mediana de 1,176 tokens de cache_creation (n = 18,029). Entre 5 e 60 minutos, 1,327 (n = 414). Acima de 60 minutos, 130,332 (n = 79), com um prompt mediano de 175,523 tokens e um p90 de 674,348. A documentação confirma que a cobrança por excedente também leva a conversa principal para a faixa de cinco minutos. s3
O início de sessão é o custo fixo: a primeira requisição de uma sessão principal carregou uma mediana de 55,989 tokens (p90 72,000), com uma variação por projeto de 15,764 a 105,020 conforme o tamanho do CLAUDE.md e da memória. Uma medição pública anterior apontava um piso de cerca de 29k em um diretório vazio, 30.4k com 3 servidores MCP e 38.8k em um repositório real. s9
O esforço é a alavanca que a documentação defende e que os logs não recompensam. Nas sessões principais, as requisições em high produziram em média 778 tokens de saída contra 837 em medium; os subagentes em high produziram 323 contra 642. A comparação é confundida (tarefas, modelos e projetos diferentes), então é um motivo para ficar cético, não uma prova. A orientação da própria equipe do Claude Code trata o esforço como o lugar onde gastar raciocínio, não como um botão de orçamento. s10
Duas dicas populares mediram pouco. As sugestões de prompt custam requisições extras, e o número muito compartilhado de "economize ~10%" é um teto, não uma economia típica; a configuração é promptSuggestionEnabled: false ou CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 A filtragem da saída do shell ao longo de vinte dias reduziu 66.7 milhões de tokens de saída para 24.1 milhões, mas esses 66.7 milhões eram 7.4% dos tokens novos consumidos na mesma janela. s11
Medições
Custo de lançamento do subagente, prompt da primeira requisição em tokens, por modelo:
| Modelo | n | mín. | mediana | p90 | máx. |
|---|---|---|---|---|---|
| Todos | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Regravação de cache na retomada, sessões principais, por intervalo antes da requisição:
| Intervalo | n | cache_creation mediana | média | cache_read mediana | prompt mediana |
|---|---|---|---|---|---|
| < 5 min | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| 5 a 60 min | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 min | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Protocolo: ler cada sessão principal ~/.claude/projects/*/<uuid>.jsonl e cada execução */<uuid>/subagents/agent-*.jsonl, com requisições a partir de 2026-09-01. Deduplicar as linhas assistant por (message.id, requestId) e manter um registro de usage por requisição. Total de tokens = input + output + cache_read + cache_creation; tamanho do prompt = input + cache_read + cache_creation. Intervalo = tempo entre a última linha de log da requisição anterior e a primeira linha desta, dentro de uma mesma sessão ou execução. O custo ponderado usa pesos relativos: input 1, gravação de cache 5m 1.25, gravação de cache 1h 2, cache read 0.1, output 5; esses pesos são uma suposição, não uma tarifa publicada.
Faça isto na segunda-feira
- Rode
/usageno seu plano e leia o detalhamento por skill, subagente, plugin e MCP, além dos sinalizadores de comportamento levantados a partir de 10% do uso recente. - Liste as definições dos seus subagentes e adicione um frontmatter
model: haikuoumodel: sonneta cada um que só pesquisa, verifica ou resume. - Se você quer um único modelo em todos os subagentes, independentemente do frontmatter, defina
CLAUDE_CODE_SUBAGENT_MODELeCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Confirme que a sua versão do Claude Code é 2.1.242 ou posterior, e então decida por fluxo de trabalho se
subagentPromptCacheTtl: "1h"compensa: ele ajuda subagentes que ficam ociosos entre chamadas de ferramenta, não os curtos. - Antes de uma pausa de mais de uma hora, termine a tarefa na sessão atual e escreva um arquivo de handoff; ao voltar, abra uma sessão nova em vez de retomar um prompt de 175k tokens.
- Escreva um script somente leitura sobre os seus próprios logs, deduplicado por (message.id, requestId), e compare a fatia da sessão principal com a dos subagentes antes de mudar qualquer outra coisa.
- Defina
promptSuggestionEnabled: falsese você nunca usa as sugestões, e trate a economia como no máximo alguns pontos percentuais.
Para ir além
- Max 5x contra Max 20x: a proporção de capacidade que os usuários mediram depois do corte é uma questão de escolha de plano que o vídeo deixou de fora. s7
- A cadeia completa de precedência do TTL de cache (variável de força, variável de faixa, configuração de faixa,
experimental.cacheTtldo subagente) e o que muda sob cobrança por excedente. s4 - Por que mudar o esforço no meio da sessão pode ler todo o histórico sem nenhum acerto de cache na maioria dos modelos, e quais modelos são isentos. s3
- Como ler os campos
usagee as faixas de cache nos logs das suas próprias sessões, e a abordagem do ccboard para uma visão de orçamento por dia. s11 - Três arquivos de subagente com três modelos e o que cada lançamento realmente gravou no cache, com as correções do próprio autor anexadas. s8
- Definições de ferramentas MCP adiadas e
ENABLE_TOOL_SEARCH=auto:Npara controlar quando os schemas de ferramentas são carregados no contexto. s3
Fontes
- Claude Code May to August 2026 weekly limits promotion, Central de ajuda da Anthropic. Por que ler: as datas exatas, os planos e o escopo da promoção de 50%, nas palavras da Anthropic.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Por que ler: o aumento de 25% e o corte de 17% lado a lado, com o comunicado citado.
- Manage costs effectively, documentação do Claude Code. Por que ler: o detalhamento do
/usage, a herança de modelo dos subagentes e as regras de esforço e de cache dos MCP. - How Claude Code uses prompt caching, documentação do Claude Code. Por que ler: a única descrição oficial das faixas 5m e 1h e das configurações de TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Por que ler: a discussão que trouxe à tona o cache de 5 minutos dos subagentes, com a configuração que o inverte.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Por que ler: uma comparação de capacidade, do lado do usuário, entre as duas faixas Max depois do corte.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Por que ler: um experimento reproduzível de custo de lançamento, com campos usage brutos e correções honestas.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Por que ler: uma medição do overhead de inicialização em um diretório vazio, com servidores MCP e em um repositório real.
- Using Claude Code: Spending your effort, X, equipe do Claude Code. Por que ler: como a equipe pensa os níveis de esforço; não traz contagens de tokens, e é justamente esse o ponto.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Por que ler: um estudo de logs de vinte dias que põe a filtragem da saída do shell em proporção ao consumo total.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Por que ler: a afirmação original e a discussão que reduz os 10% a um teto.
FAQ
É um corte de 17% ou um aumento de 25%?
Os dois, medidos a partir de bases diferentes. Em relação à base pré-promoção de 100, o nível permanente de 125 é um aumento de 25%. Em relação ao nível promocional de 150 que os usuários tiveram de 13 de maio a 13 de setembro de 2026, é um corte de 17%.
Devo definir subagentPromptCacheTtl como 1h em todo lugar?
Só se os seus subagentes ficam ociosos por mais de cinco minutos entre requisições. Nos logs, 0.2% das requisições seguintes caíram nesse caso, então uma faixa de 1h generalizada na maior parte do tempo paga um preço de gravação maior por nada. Meça primeiro a distribuição dos seus próprios intervalos.
Reduzir o esforço economiza tokens?
Não de forma visível nesses logs: as requisições da sessão principal em high produziram em média 778 tokens de saída contra 837 em medium. Os dados são confundidos, então a resposta honesta é que o esforço é um botão de qualidade cuja economia você precisa medir nas suas próprias tarefas.
Por que o meu primeiro prompt depois do almoço custa tanto?
A sessão principal grava um cache de 1 hora. Depois de uma pausa acima de 60 minutos, a requisição seguinte regrava o prefixo: uma mediana de 130,332 tokens de cache_creation nos logs, contra 1,176 para uma requisição quente. Termine as tarefas antes das pausas longas e comece do zero depois.
AIDive