AIDive

Pack de vídeo

Corte do limite do Claude Code: alavancas medidas, tabelas de cache e checklist de segunda

10 min de leitura

TL;DR

  • O limite semanal do Claude Code passou de uma base de 100 para um nível promocional de 150, e depois se fixou em um 125 permanente em 14 de setembro de 2026. Em relação ao nível promocional, é um corte de 17%; em relação à base antiga, um aumento de 25%. As duas afirmações são verdadeiras ao mesmo tempo.
  • Em um mês de logs locais, os subagentes consumiram 48.1% de todos os tokens e 55.3% do custo ponderado. A maior alavanca isolada é lançar menos subagentes e fixar um modelo pequeno nos que você mantém.
  • Os subagentes gravam um cache de 5 minutos, enquanto a sessão principal grava um cache de 1 hora. Uma requisição seguinte depois de uma pausa fria regrava cerca de 19 vezes mais cache do que uma requisição quente.
  • Uma pausa de mais de 60 minutos em uma sessão principal custa, na mediana, 130,332 tokens de regravação de cache na requisição seguinte, contra 1,176 quando a pausa é menor que 5 minutos.
  • Reduzir o esforço não reduziu a saída por requisição nesses logs (média de 778 tokens em high contra 837 em medium nas sessões principais), então trate isso como uma troca de qualidade, não como economia gratuita.
  • Desativar as sugestões de prompt e filtrar a saída do shell são alavancas reais, mas pequenas. Deixe-as para o fim.

O que as medições mostram

A conta por trás da manchete: base 100, nível promocional 150, nível permanente 125. 125 / 150 = 0.8333, então o corte é de 16.67% e arredonda para 17%. A leitura errada é subtrair os incrementos (50% para 25%) e chamar isso de corte de 25%. s2

A promoção valeu de 13 de maio de 2026 a 13 de setembro de 2026, aumentou os limites semanais em 50% apenas no Claude Code e não mexeu nos limites de 5 horas. Ela se aplicou aos planos Pro, Max, Team e Enterprise por assento. s1

As medições abaixo vêm dos logs do Claude Code de uma única máquina: 455 sessões principais, 2,631 execuções de subagentes, 63,398 requisições deduplicadas entre 2026-09-03 e 2026-10-03. A primeira descoberta é sobre a própria contagem: cada requisição aparece em 1.96 linhas de log em média, então somar todas as linhas superestima o total de tokens em 99.3%. Qualquer script que leia esses logs precisa deduplicar por (message.id, requestId) primeiro. s11

Os subagentes são a maior linha. Deduplicados, respondem por 48.1% do total de tokens, 63.9% dos tokens de saída e 55.3% do custo ponderado. A primeira requisição de uma execução de subagente carrega um prompt mediano de 47,117 tokens antes de fazer qualquer coisa; o p90 é 52,681 e o máximo 126,769. Agentes com conjuntos de ferramentas restritos começam muito mais baixo (mín. 5,295). s8

A escolha do modelo agrava isso. Os subagentes herdam o modelo da conversa principal, a menos que um frontmatter model, um parâmetro model por invocação ou CLAUDE_CODE_SUBAGENT_MODEL diga outra coisa, e desde a v2.1.251 a variável de ambiente sozinha não sobrescreve mais o frontmatter: é preciso CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Nos logs, só o claude-opus-5 foi 31.5% de todos os tokens e 35.8% do custo ponderado, com 63.2% disso gasto dentro de subagentes. s3

A faixa de cache é decidida pelo lugar onde a requisição roda. Nesses dados, 100.0% das gravações de cache dos subagentes foram de 5 minutos e 100.0% das gravações de cache da sessão principal foram de 1 hora; nenhuma requisição teve divisão mista. Dentro das execuções de subagentes, apenas 95 de 41,790 requisições seguintes (0.2%) chegaram após uma pausa acima de 5 minutos, mas elas gravaram em média 74,582 tokens de cache_creation, contra 3,886 das requisições quentes. A configuração subagentPromptCacheTtl e a variável de ambiente CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL aceitam 5m ou 1h e exigem o Claude Code v2.1.242 ou posterior. s4

Uma execução independente viu a mesma divisão: toda requisição de subagente gravada em ephemeral_5m_input_tokens enquanto o pai usava ephemeral_1h_input_tokens, e um agente regravando todos os 20,971 tokens do seu prefixo em uma requisição que veio depois da janela de cinco minutos. s6

O equivalente na sessão principal é a pausa longa. Requisições que chegam menos de 5 minutos depois da anterior gravaram uma mediana de 1,176 tokens de cache_creation (n = 18,029). Entre 5 e 60 minutos, 1,327 (n = 414). Acima de 60 minutos, 130,332 (n = 79), com um prompt mediano de 175,523 tokens e um p90 de 674,348. A documentação confirma que a cobrança por excedente também leva a conversa principal para a faixa de cinco minutos. s3

O início de sessão é o custo fixo: a primeira requisição de uma sessão principal carregou uma mediana de 55,989 tokens (p90 72,000), com uma variação por projeto de 15,764 a 105,020 conforme o tamanho do CLAUDE.md e da memória. Uma medição pública anterior apontava um piso de cerca de 29k em um diretório vazio, 30.4k com 3 servidores MCP e 38.8k em um repositório real. s9

O esforço é a alavanca que a documentação defende e que os logs não recompensam. Nas sessões principais, as requisições em high produziram em média 778 tokens de saída contra 837 em medium; os subagentes em high produziram 323 contra 642. A comparação é confundida (tarefas, modelos e projetos diferentes), então é um motivo para ficar cético, não uma prova. A orientação da própria equipe do Claude Code trata o esforço como o lugar onde gastar raciocínio, não como um botão de orçamento. s10

Duas dicas populares mediram pouco. As sugestões de prompt custam requisições extras, e o número muito compartilhado de "economize ~10%" é um teto, não uma economia típica; a configuração é promptSuggestionEnabled: false ou CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 A filtragem da saída do shell ao longo de vinte dias reduziu 66.7 milhões de tokens de saída para 24.1 milhões, mas esses 66.7 milhões eram 7.4% dos tokens novos consumidos na mesma janela. s11

Medições

Custo de lançamento do subagente, prompt da primeira requisição em tokens, por modelo:

Modelo n mín. mediana p90 máx.
Todos 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Regravação de cache na retomada, sessões principais, por intervalo antes da requisição:

Intervalo n cache_creation mediana média cache_read mediana prompt mediana
< 5 min 18,029 1,176 2,391 184,169 186,412
5 a 60 min 414 1,327 5,575 221,857 225,168
> 60 min 79 130,332 241,499 25,264 175,523

Protocolo: ler cada sessão principal ~/.claude/projects/*/<uuid>.jsonl e cada execução */<uuid>/subagents/agent-*.jsonl, com requisições a partir de 2026-09-01. Deduplicar as linhas assistant por (message.id, requestId) e manter um registro de usage por requisição. Total de tokens = input + output + cache_read + cache_creation; tamanho do prompt = input + cache_read + cache_creation. Intervalo = tempo entre a última linha de log da requisição anterior e a primeira linha desta, dentro de uma mesma sessão ou execução. O custo ponderado usa pesos relativos: input 1, gravação de cache 5m 1.25, gravação de cache 1h 2, cache read 0.1, output 5; esses pesos são uma suposição, não uma tarifa publicada.

Faça isto na segunda-feira

  • Rode /usage no seu plano e leia o detalhamento por skill, subagente, plugin e MCP, além dos sinalizadores de comportamento levantados a partir de 10% do uso recente.
  • Liste as definições dos seus subagentes e adicione um frontmatter model: haiku ou model: sonnet a cada um que só pesquisa, verifica ou resume.
  • Se você quer um único modelo em todos os subagentes, independentemente do frontmatter, defina CLAUDE_CODE_SUBAGENT_MODEL e CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Confirme que a sua versão do Claude Code é 2.1.242 ou posterior, e então decida por fluxo de trabalho se subagentPromptCacheTtl: "1h" compensa: ele ajuda subagentes que ficam ociosos entre chamadas de ferramenta, não os curtos.
  • Antes de uma pausa de mais de uma hora, termine a tarefa na sessão atual e escreva um arquivo de handoff; ao voltar, abra uma sessão nova em vez de retomar um prompt de 175k tokens.
  • Escreva um script somente leitura sobre os seus próprios logs, deduplicado por (message.id, requestId), e compare a fatia da sessão principal com a dos subagentes antes de mudar qualquer outra coisa.
  • Defina promptSuggestionEnabled: false se você nunca usa as sugestões, e trate a economia como no máximo alguns pontos percentuais.

Para ir além

  • Max 5x contra Max 20x: a proporção de capacidade que os usuários mediram depois do corte é uma questão de escolha de plano que o vídeo deixou de fora. s7
  • A cadeia completa de precedência do TTL de cache (variável de força, variável de faixa, configuração de faixa, experimental.cacheTtl do subagente) e o que muda sob cobrança por excedente. s4
  • Por que mudar o esforço no meio da sessão pode ler todo o histórico sem nenhum acerto de cache na maioria dos modelos, e quais modelos são isentos. s3
  • Como ler os campos usage e as faixas de cache nos logs das suas próprias sessões, e a abordagem do ccboard para uma visão de orçamento por dia. s11
  • Três arquivos de subagente com três modelos e o que cada lançamento realmente gravou no cache, com as correções do próprio autor anexadas. s8
  • Definições de ferramentas MCP adiadas e ENABLE_TOOL_SEARCH=auto:N para controlar quando os schemas de ferramentas são carregados no contexto. s3

Fontes

FAQ

É um corte de 17% ou um aumento de 25%?

Os dois, medidos a partir de bases diferentes. Em relação à base pré-promoção de 100, o nível permanente de 125 é um aumento de 25%. Em relação ao nível promocional de 150 que os usuários tiveram de 13 de maio a 13 de setembro de 2026, é um corte de 17%.

Devo definir subagentPromptCacheTtl como 1h em todo lugar?

Só se os seus subagentes ficam ociosos por mais de cinco minutos entre requisições. Nos logs, 0.2% das requisições seguintes caíram nesse caso, então uma faixa de 1h generalizada na maior parte do tempo paga um preço de gravação maior por nada. Meça primeiro a distribuição dos seus próprios intervalos.

Reduzir o esforço economiza tokens?

Não de forma visível nesses logs: as requisições da sessão principal em high produziram em média 778 tokens de saída contra 837 em medium. Os dados são confundidos, então a resposta honesta é que o esforço é um botão de qualidade cuja economia você precisa medir nas suas próprias tarefas.

Por que o meu primeiro prompt depois do almoço custa tanto?

A sessão principal grava um cache de 1 hora. Depois de uma pausa acima de 60 minutos, a requisição seguinte regrava o prefixo: uma mediana de 130,332 tokens de cache_creation nos logs, contra 1,176 para uma requisição quente. Termine as tarefas antes das pausas longas e comece do zero depois.