TL;DR
- Il limite settimanale di Claude Code è passato da una base di 100 a un livello promo di 150, per poi stabilizzarsi su un 125 permanente il 14 settembre 2026. Rispetto al livello promo è un taglio del 17%; rispetto alla vecchia base è un aumento del 25%. Entrambe le affermazioni sono vere nello stesso momento.
- In un mese di log locali, i subagent hanno consumato il 48,1% di tutti i token e il 55,3% del costo ponderato. La leva più grande è lanciare meno subagent e fissare un modello piccolo su quelli che tieni.
- I subagent scrivono una cache da 5 minuti, mentre la sessione principale scrive una cache da 1 ora. Una richiesta successiva dopo una pausa a freddo riscrive circa 19 volte più cache di una a caldo.
- Una pausa superiore a 60 minuti in una sessione principale costa una mediana di 130.332 token di riscrittura della cache alla richiesta successiva, contro 1.176 quando la pausa è sotto i 5 minuti.
- Abbassare l'effort non ha ridotto l'output per richiesta in questi log (media di 778 token con high contro 837 con medium nelle sessioni principali), quindi va trattato come un compromesso sulla qualità, non come un risparmio gratuito.
- Disattivare i suggerimenti del prompt e filtrare l'output della shell sono leve reali ma piccole. Contale per ultime.
Cosa dicono le misure
L'aritmetica dietro il titolo: base 100, livello promo 150, livello permanente 125. 125 / 150 = 0,8333, quindi il taglio è del 16,67% e si arrotonda a 17%. La lettura sbagliata è sottrarre gli incrementi (dal 50% al 25%) e parlare di un taglio del 25%. s2
La promozione è andata dal 13 maggio 2026 al 13 settembre 2026, ha alzato i limiti settimanali del 50% solo in Claude Code e ha lasciato intatti i limiti da 5 ore. Valeva per i piani Pro, Max, Team e Enterprise a posti. s1
Le misure qui sotto vengono dai log di Claude Code di una sola macchina: 455 sessioni principali, 2.631 esecuzioni di subagent, 63.398 richieste deduplicate tra il 2026-09-03 e il 2026-10-03. Il primo risultato riguarda il conteggio stesso: ogni richiesta compare in media su 1,96 righe di log, quindi sommare tutte le righe sovrastima i token totali del 99,3%. Qualsiasi script che legge questi log deve prima deduplicare su (message.id, requestId). s11
I subagent sono la voce più grande. Deduplicati, rappresentano il 48,1% dei token totali, il 63,9% dei token di output e il 55,3% del costo ponderato. La prima richiesta di un'esecuzione di subagent porta un prompt mediano di 47.117 token prima ancora di fare qualcosa; il p90 è 52.681 e il massimo 126.769. Gli agenti con set di strumenti ristretti partono molto più in basso (min 5.295). s8
La scelta del modello amplifica il problema. I subagent ereditano il modello della conversazione principale, a meno che lo decida diversamente un frontmatter model, un parametro model per singola invocazione o CLAUDE_CODE_SUBAGENT_MODEL; inoltre, dalla v2.1.251 la sola variabile d'ambiente non sovrascrive più il frontmatter: serve CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Nei log, claude-opus-5 da solo è stato il 31,5% di tutti i token e il 35,8% del costo ponderato, con il 63,2% di quella spesa dentro i subagent. s3
Il livello di cache dipende da dove gira la richiesta. In questi dati, il 100,0% delle scritture di cache dei subagent era da 5 minuti e il 100,0% di quelle della sessione principale da 1 ora; nessuna richiesta aveva una ripartizione mista. Dentro le esecuzioni dei subagent, solo 95 richieste successive su 41.790 (0,2%) sono arrivate dopo una pausa superiore a 5 minuti, ma hanno scritto in media 74.582 token di cache_creation contro 3.886 per le richieste a caldo. L'impostazione subagentPromptCacheTtl e la variabile d'ambiente CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL accettano 5m o 1h e richiedono Claude Code v2.1.242 o successivo. s4
Una prova indipendente ha visto la stessa divisione: ogni richiesta di subagent scritta sotto ephemeral_5m_input_tokens mentre il padre usava ephemeral_1h_input_tokens, e un agente che riscriveva tutti i 20.971 token del suo prefisso in una richiesta arrivata dopo la finestra dei cinque minuti. s6
L'equivalente nella sessione principale è la pausa lunga. Le richieste arrivate meno di 5 minuti dopo la precedente hanno scritto una mediana di 1.176 token di cache_creation (n = 18.029). Tra 5 e 60 minuti, 1.327 (n = 414). Oltre 60 minuti, 130.332 (n = 79), con un prompt mediano di 175.523 token e un p90 di 674.348. La documentazione conferma che anche la fatturazione in overage riporta la conversazione principale al livello da cinque minuti. s3
L'avvio della sessione è il costo fisso: la prima richiesta di una sessione principale portava una mediana di 55.989 token (p90 72.000), con una dispersione per progetto da 15.764 a 105.020 a seconda della dimensione di CLAUDE.md e della memoria. Una misura pubblica precedente fissava il minimo a circa 29k in una directory vuota, 30,4k con 3 server MCP e 38,8k in un repo reale. s9
L'effort è la leva che la documentazione spinge e che i log non premiano. Nelle sessioni principali, le richieste high hanno prodotto in media 778 token di output contro 837 con medium; i subagent con high ne hanno prodotti 323 contro 642. Il confronto è inquinato da altre variabili (compiti, modelli, progetti diversi), quindi è un motivo per essere scettici, non una prova. Le indicazioni del team di Claude Code presentano l'effort come il punto in cui spendere il ragionamento, non come una manopola di budget. s10
Due consigli popolari hanno dato risultati piccoli. I suggerimenti del prompt costano richieste in più, e la cifra "risparmi ~10%" molto condivisa è un tetto, non un risparmio tipico; l'impostazione è promptSuggestionEnabled: false oppure CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Il filtraggio dell'output della shell in venti giorni ha ridotto 66,7 milioni di token di output a 24,1 milioni, ma quei 66,7 milioni erano il 7,4% dei token nuovi consumati nella stessa finestra. s11
Misure
Costo di avvio del subagent, prompt della prima richiesta in token, per modello:
| Modello | n | min | mediana | p90 | max |
|---|---|---|---|---|---|
| Tutti | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Riscrittura della cache alla ripresa, sessioni principali, per pausa prima della richiesta:
| Pausa | n | cache_creation mediana | media | cache_read mediana | prompt mediana |
|---|---|---|---|---|---|
| < 5 min | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| da 5 a 60 min | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 min | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Protocollo: leggi ogni sessione principale ~/.claude/projects/*/<uuid>.jsonl e ogni esecuzione */<uuid>/subagents/agent-*.jsonl, con richieste dal 2026-09-01. Deduplica le righe assistant su (message.id, requestId) e tieni un solo record usage per richiesta. Token totali = input + output + cache_read + cache_creation; dimensione del prompt = input + cache_read + cache_creation. Pausa = tempo dall'ultima riga di log della richiesta precedente alla prima riga di questa, dentro la stessa sessione o esecuzione. Il costo ponderato usa pesi relativi: input 1, scrittura cache 5m 1,25, scrittura cache 1h 2, cache read 0,1, output 5; questi pesi sono un'ipotesi, non una tariffa pubblicata.
Da fare lunedì
- Esegui
/usagesul tuo piano e leggi la ripartizione per skill, subagent, plugin e MCP, più i flag di comportamento segnalati al 10% o più dell'uso recente. - Elenca le definizioni dei tuoi subagent e aggiungi un frontmatter
model: haikuomodel: sonneta ognuno che si limita a cercare, controllare o riassumere. - Se vuoi un solo modello su ogni subagent a prescindere dal frontmatter, imposta
CLAUDE_CODE_SUBAGENT_MODELeCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Verifica che la tua versione di Claude Code sia 2.1.242 o successiva, poi decidi per ogni workflow se
subagentPromptCacheTtl: "1h"conviene: aiuta i subagent che restano fermi tra una chiamata di strumento e l'altra, non quelli brevi. - Prima di una pausa superiore a un'ora, finisci il compito nella sessione corrente e scrivi un file di passaggio di consegne; al ritorno apri una sessione nuova invece di riprendere un prompt da 175k token.
- Scrivi uno script in sola lettura sui tuoi log, deduplicato su (message.id, requestId), e confronta la quota di sessione principale e subagent prima di cambiare altro.
- Imposta
promptSuggestionEnabled: falsese non usi mai i suggerimenti, e considera il risparmio come qualche punto percentuale al massimo.
Per approfondire
- Max 5x contro Max 20x: il rapporto di capacità misurato dagli utenti dopo il taglio è una questione di scelta del piano che il video ha lasciato fuori. s7
- La catena completa di precedenza del TTL della cache (env di forzatura, env per bucket, impostazione per bucket,
experimental.cacheTtldel subagent) e cosa cambia con la fatturazione in overage. s4 - Perché cambiare effort a metà sessione può far rileggere tutta la cronologia senza cache hit sulla maggior parte dei modelli, e quali modelli sono esenti. s3
- Come leggere i campi
usagee i livelli di cache nei log delle tue sessioni, e l'approccio di ccboard a una vista di budget giornaliero. s11 - Tre file di subagent con tre modelli e cosa ha scritto in cache ogni lancio, con le correzioni dell'autore in appendice. s8
- Le definizioni di strumenti MCP differite e
ENABLE_TOOL_SEARCH=auto:Nper controllare quando gli schemi degli strumenti entrano nel contesto. s3
Fonti
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Perché leggerla: le date esatte, i piani e l'ambito della promo del 50%, con le parole di Anthropic.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Perché leggerla: l'aumento del 25% e il taglio del 17% affiancati, con l'annuncio citato.
- Manage costs effectively, Claude Code docs. Perché leggerla: la ripartizione di
/usage, l'ereditarietà del modello nei subagent e le regole di effort e cache MCP. - How Claude Code uses prompt caching, Claude Code docs. Perché leggerla: l'unica descrizione autorevole dei livelli 5m e 1h e delle impostazioni TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Perché leggerla: il thread che ha fatto emergere la cache da 5 minuti dei subagent, con l'impostazione che la cambia.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Perché leggerla: un confronto di capacità lato utente tra i due livelli Max dopo il taglio.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Perché leggerla: un esperimento riproducibile sul costo di avvio, con i campi usage grezzi e correzioni oneste.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Perché leggerla: una misura dell'overhead di avvio in una directory vuota, con server MCP e in un repo reale.
- Using Claude Code: Spending your effort, X, Claude Code team. Perché leggerla: come il team ragiona sui livelli di effort; non contiene conteggi di token, ed è proprio questo il punto.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Perché leggerla: uno studio dei log su venti giorni che ridimensiona il filtraggio dell'output della shell rispetto al consumo totale.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Perché leggerla: l'affermazione originale e il thread che riduce il 10% a un tetto.
FAQ
È un taglio del 17% o un aumento del 25%?
Entrambi, misurati da basi diverse. Rispetto alla base pre-promo di 100, il livello permanente di 125 è un aumento del 25%. Rispetto al livello promo di 150 che gli utenti hanno avuto dal 13 maggio al 13 settembre 2026, è un taglio del 17%.
Devo impostare subagentPromptCacheTtl su 1h ovunque?
Solo se i tuoi subagent restano fermi più di cinque minuti tra una richiesta e l'altra. Nei log, lo 0,2% delle richieste successive rientrava in quel caso, quindi un livello 1h generalizzato paga per lo più un prezzo di scrittura più alto per niente. Misura prima la distribuzione delle tue pause.
Abbassare l'effort fa risparmiare token?
Non in modo visibile in questi log: le richieste delle sessioni principali con high hanno prodotto in media 778 token di output contro 837 con medium. I dati sono inquinati da altre variabili, quindi la risposta onesta è che l'effort è una manopola di qualità il cui risparmio va misurato sui tuoi compiti.
Perché il primo prompt dopo pranzo costa così tanto?
La sessione principale scrive una cache da 1 ora. Dopo una pausa superiore a 60 minuti, la richiesta successiva riscrive il prefisso: una mediana di 130.332 token di cache_creation nei log, contro 1.176 per una richiesta a caldo. Finisci i compiti prima delle pause lunghe e ricomincia da zero dopo.
AIDive