AIDive

Pack video

Taglio del limite Claude Code: leve misurate, tabelle di cache e checklist

10 min di lettura

TL;DR

  • Il limite settimanale di Claude Code è passato da una base di 100 a un livello promo di 150, per poi stabilizzarsi su un 125 permanente il 14 settembre 2026. Rispetto al livello promo è un taglio del 17%; rispetto alla vecchia base è un aumento del 25%. Entrambe le affermazioni sono vere nello stesso momento.
  • In un mese di log locali, i subagent hanno consumato il 48,1% di tutti i token e il 55,3% del costo ponderato. La leva più grande è lanciare meno subagent e fissare un modello piccolo su quelli che tieni.
  • I subagent scrivono una cache da 5 minuti, mentre la sessione principale scrive una cache da 1 ora. Una richiesta successiva dopo una pausa a freddo riscrive circa 19 volte più cache di una a caldo.
  • Una pausa superiore a 60 minuti in una sessione principale costa una mediana di 130.332 token di riscrittura della cache alla richiesta successiva, contro 1.176 quando la pausa è sotto i 5 minuti.
  • Abbassare l'effort non ha ridotto l'output per richiesta in questi log (media di 778 token con high contro 837 con medium nelle sessioni principali), quindi va trattato come un compromesso sulla qualità, non come un risparmio gratuito.
  • Disattivare i suggerimenti del prompt e filtrare l'output della shell sono leve reali ma piccole. Contale per ultime.

Cosa dicono le misure

L'aritmetica dietro il titolo: base 100, livello promo 150, livello permanente 125. 125 / 150 = 0,8333, quindi il taglio è del 16,67% e si arrotonda a 17%. La lettura sbagliata è sottrarre gli incrementi (dal 50% al 25%) e parlare di un taglio del 25%. s2

La promozione è andata dal 13 maggio 2026 al 13 settembre 2026, ha alzato i limiti settimanali del 50% solo in Claude Code e ha lasciato intatti i limiti da 5 ore. Valeva per i piani Pro, Max, Team e Enterprise a posti. s1

Le misure qui sotto vengono dai log di Claude Code di una sola macchina: 455 sessioni principali, 2.631 esecuzioni di subagent, 63.398 richieste deduplicate tra il 2026-09-03 e il 2026-10-03. Il primo risultato riguarda il conteggio stesso: ogni richiesta compare in media su 1,96 righe di log, quindi sommare tutte le righe sovrastima i token totali del 99,3%. Qualsiasi script che legge questi log deve prima deduplicare su (message.id, requestId). s11

I subagent sono la voce più grande. Deduplicati, rappresentano il 48,1% dei token totali, il 63,9% dei token di output e il 55,3% del costo ponderato. La prima richiesta di un'esecuzione di subagent porta un prompt mediano di 47.117 token prima ancora di fare qualcosa; il p90 è 52.681 e il massimo 126.769. Gli agenti con set di strumenti ristretti partono molto più in basso (min 5.295). s8

La scelta del modello amplifica il problema. I subagent ereditano il modello della conversazione principale, a meno che lo decida diversamente un frontmatter model, un parametro model per singola invocazione o CLAUDE_CODE_SUBAGENT_MODEL; inoltre, dalla v2.1.251 la sola variabile d'ambiente non sovrascrive più il frontmatter: serve CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Nei log, claude-opus-5 da solo è stato il 31,5% di tutti i token e il 35,8% del costo ponderato, con il 63,2% di quella spesa dentro i subagent. s3

Il livello di cache dipende da dove gira la richiesta. In questi dati, il 100,0% delle scritture di cache dei subagent era da 5 minuti e il 100,0% di quelle della sessione principale da 1 ora; nessuna richiesta aveva una ripartizione mista. Dentro le esecuzioni dei subagent, solo 95 richieste successive su 41.790 (0,2%) sono arrivate dopo una pausa superiore a 5 minuti, ma hanno scritto in media 74.582 token di cache_creation contro 3.886 per le richieste a caldo. L'impostazione subagentPromptCacheTtl e la variabile d'ambiente CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL accettano 5m o 1h e richiedono Claude Code v2.1.242 o successivo. s4

Una prova indipendente ha visto la stessa divisione: ogni richiesta di subagent scritta sotto ephemeral_5m_input_tokens mentre il padre usava ephemeral_1h_input_tokens, e un agente che riscriveva tutti i 20.971 token del suo prefisso in una richiesta arrivata dopo la finestra dei cinque minuti. s6

L'equivalente nella sessione principale è la pausa lunga. Le richieste arrivate meno di 5 minuti dopo la precedente hanno scritto una mediana di 1.176 token di cache_creation (n = 18.029). Tra 5 e 60 minuti, 1.327 (n = 414). Oltre 60 minuti, 130.332 (n = 79), con un prompt mediano di 175.523 token e un p90 di 674.348. La documentazione conferma che anche la fatturazione in overage riporta la conversazione principale al livello da cinque minuti. s3

L'avvio della sessione è il costo fisso: la prima richiesta di una sessione principale portava una mediana di 55.989 token (p90 72.000), con una dispersione per progetto da 15.764 a 105.020 a seconda della dimensione di CLAUDE.md e della memoria. Una misura pubblica precedente fissava il minimo a circa 29k in una directory vuota, 30,4k con 3 server MCP e 38,8k in un repo reale. s9

L'effort è la leva che la documentazione spinge e che i log non premiano. Nelle sessioni principali, le richieste high hanno prodotto in media 778 token di output contro 837 con medium; i subagent con high ne hanno prodotti 323 contro 642. Il confronto è inquinato da altre variabili (compiti, modelli, progetti diversi), quindi è un motivo per essere scettici, non una prova. Le indicazioni del team di Claude Code presentano l'effort come il punto in cui spendere il ragionamento, non come una manopola di budget. s10

Due consigli popolari hanno dato risultati piccoli. I suggerimenti del prompt costano richieste in più, e la cifra "risparmi ~10%" molto condivisa è un tetto, non un risparmio tipico; l'impostazione è promptSuggestionEnabled: false oppure CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Il filtraggio dell'output della shell in venti giorni ha ridotto 66,7 milioni di token di output a 24,1 milioni, ma quei 66,7 milioni erano il 7,4% dei token nuovi consumati nella stessa finestra. s11

Misure

Costo di avvio del subagent, prompt della prima richiesta in token, per modello:

Modello n min mediana p90 max
Tutti 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Riscrittura della cache alla ripresa, sessioni principali, per pausa prima della richiesta:

Pausa n cache_creation mediana media cache_read mediana prompt mediana
< 5 min 18,029 1,176 2,391 184,169 186,412
da 5 a 60 min 414 1,327 5,575 221,857 225,168
> 60 min 79 130,332 241,499 25,264 175,523

Protocollo: leggi ogni sessione principale ~/.claude/projects/*/<uuid>.jsonl e ogni esecuzione */<uuid>/subagents/agent-*.jsonl, con richieste dal 2026-09-01. Deduplica le righe assistant su (message.id, requestId) e tieni un solo record usage per richiesta. Token totali = input + output + cache_read + cache_creation; dimensione del prompt = input + cache_read + cache_creation. Pausa = tempo dall'ultima riga di log della richiesta precedente alla prima riga di questa, dentro la stessa sessione o esecuzione. Il costo ponderato usa pesi relativi: input 1, scrittura cache 5m 1,25, scrittura cache 1h 2, cache read 0,1, output 5; questi pesi sono un'ipotesi, non una tariffa pubblicata.

Da fare lunedì

  • Esegui /usage sul tuo piano e leggi la ripartizione per skill, subagent, plugin e MCP, più i flag di comportamento segnalati al 10% o più dell'uso recente.
  • Elenca le definizioni dei tuoi subagent e aggiungi un frontmatter model: haiku o model: sonnet a ognuno che si limita a cercare, controllare o riassumere.
  • Se vuoi un solo modello su ogni subagent a prescindere dal frontmatter, imposta CLAUDE_CODE_SUBAGENT_MODEL e CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Verifica che la tua versione di Claude Code sia 2.1.242 o successiva, poi decidi per ogni workflow se subagentPromptCacheTtl: "1h" conviene: aiuta i subagent che restano fermi tra una chiamata di strumento e l'altra, non quelli brevi.
  • Prima di una pausa superiore a un'ora, finisci il compito nella sessione corrente e scrivi un file di passaggio di consegne; al ritorno apri una sessione nuova invece di riprendere un prompt da 175k token.
  • Scrivi uno script in sola lettura sui tuoi log, deduplicato su (message.id, requestId), e confronta la quota di sessione principale e subagent prima di cambiare altro.
  • Imposta promptSuggestionEnabled: false se non usi mai i suggerimenti, e considera il risparmio come qualche punto percentuale al massimo.

Per approfondire

  • Max 5x contro Max 20x: il rapporto di capacità misurato dagli utenti dopo il taglio è una questione di scelta del piano che il video ha lasciato fuori. s7
  • La catena completa di precedenza del TTL della cache (env di forzatura, env per bucket, impostazione per bucket, experimental.cacheTtl del subagent) e cosa cambia con la fatturazione in overage. s4
  • Perché cambiare effort a metà sessione può far rileggere tutta la cronologia senza cache hit sulla maggior parte dei modelli, e quali modelli sono esenti. s3
  • Come leggere i campi usage e i livelli di cache nei log delle tue sessioni, e l'approccio di ccboard a una vista di budget giornaliero. s11
  • Tre file di subagent con tre modelli e cosa ha scritto in cache ogni lancio, con le correzioni dell'autore in appendice. s8
  • Le definizioni di strumenti MCP differite e ENABLE_TOOL_SEARCH=auto:N per controllare quando gli schemi degli strumenti entrano nel contesto. s3

Fonti

FAQ

È un taglio del 17% o un aumento del 25%?

Entrambi, misurati da basi diverse. Rispetto alla base pre-promo di 100, il livello permanente di 125 è un aumento del 25%. Rispetto al livello promo di 150 che gli utenti hanno avuto dal 13 maggio al 13 settembre 2026, è un taglio del 17%.

Devo impostare subagentPromptCacheTtl su 1h ovunque?

Solo se i tuoi subagent restano fermi più di cinque minuti tra una richiesta e l'altra. Nei log, lo 0,2% delle richieste successive rientrava in quel caso, quindi un livello 1h generalizzato paga per lo più un prezzo di scrittura più alto per niente. Misura prima la distribuzione delle tue pause.

Abbassare l'effort fa risparmiare token?

Non in modo visibile in questi log: le richieste delle sessioni principali con high hanno prodotto in media 778 token di output contro 837 con medium. I dati sono inquinati da altre variabili, quindi la risposta onesta è che l'effort è una manopola di qualità il cui risparmio va misurato sui tuoi compiti.

Perché il primo prompt dopo pranzo costa così tanto?

La sessione principale scrive una cache da 1 ora. Dopo una pausa superiore a 60 minuti, la richiesta successiva riscrive il prefisso: una mediana di 130.332 token di cache_creation nei log, contro 1.176 per una richiesta a caldo. Finisci i compiti prima delle pause lunghe e ricomincia da zero dopo.