TL;DR
- Claude Code की साप्ताहिक सीमा बेस 100 से प्रोमो स्तर 150 पर गई, फिर 14 सितंबर 2026 को स्थायी रूप से 125 पर टिक गई। प्रोमो स्तर के मुकाबले यह 17% की कटौती है; पुराने बेस के मुकाबले 25% की बढ़ोतरी। दोनों बातें एक साथ सच हैं।
- एक महीने के लोकल लॉग में सबअजेंट ने सभी टोकन का 48.1% और भारित लागत का 55.3% खाया। सबसे बड़ा लीवर: कम सबअजेंट चलाएँ और जो रखें उन पर छोटा मॉडल पिन करें।
- सबअजेंट 5 मिनट का कैश लिखते हैं, जबकि मुख्य सेशन 1 घंटे का कैश लिखता है। ठंडे अंतराल के बाद का अगला अनुरोध गर्म अनुरोध से लगभग 19 गुना ज़्यादा कैश दोबारा लिखता है।
- मुख्य सेशन में 60 मिनट से लंबा ब्रेक अगले अनुरोध पर औसतन (मीडियन) 130,332 टोकन का कैश री-राइट माँगता है, जबकि 5 मिनट से कम के अंतराल पर यह 1,176 है।
- इन लॉग में effort घटाने से प्रति अनुरोध आउटपुट नहीं घटा (मुख्य सेशन में high पर औसत 778 टोकन बनाम medium पर 837)। इसे गुणवत्ता का सौदा मानें, मुफ़्त बचत नहीं।
- प्रॉम्प्ट सुझाव बंद करना और शेल आउटपुट फ़िल्टर करना असली हैं, पर छोटे लीवर हैं। इन्हें आख़िर में गिनें।
मापों से क्या निकलता है
हेडलाइन का गणित: बेस 100, प्रोमो स्तर 150, स्थायी स्तर 125। 125 / 150 = 0.8333, यानी कटौती 16.67% है जो राउंड होकर 17% बनती है। बढ़ोतरियों को घटाकर (50% से 25%) इसे 25% कटौती कहना ग़लत पढ़ना है। s2
प्रोमो 13 मई 2026 से 13 सितंबर 2026 तक चला, इसने सिर्फ़ Claude Code में साप्ताहिक सीमाएँ 50% बढ़ाईं और 5 घंटे की सीमाओं को नहीं छुआ। यह Pro, Max, Team और सीट-आधारित Enterprise प्लान पर लागू था। s1
नीचे के माप एक मशीन के Claude Code लॉग से हैं: 455 मुख्य सेशन, 2,631 सबअजेंट रन, 2026-09-03 से 2026-10-03 के बीच 63,398 डी-डुप्लिकेट किए गए अनुरोध। पहली खोज गिनती के बारे में है: हर अनुरोध औसतन 1.96 लॉग पंक्तियों पर दिखता है, इसलिए हर पंक्ति जोड़ने से कुल टोकन 99.3% बढ़कर दिखते हैं। इन लॉग को पढ़ने वाली किसी भी स्क्रिप्ट को पहले (message.id, requestId) पर डी-डुप्लिकेट करना होगा। s11
सबअजेंट सबसे बड़ी मद हैं। डी-डुप्लिकेट के बाद वे कुल टोकन का 48.1%, आउटपुट टोकन का 63.9% और भारित लागत का 55.3% हैं। सबअजेंट रन का पहला अनुरोध कुछ भी करने से पहले औसतन 47,117 टोकन का प्रॉम्प्ट ढोता है; p90 52,681 है और अधिकतम 126,769। सीमित टूल सेट वाले एजेंट बहुत नीचे से शुरू होते हैं (न्यूनतम 5,295)। s8
मॉडल का चुनाव इसे और बढ़ाता है। सबअजेंट मुख्य बातचीत का मॉडल विरासत में लेते हैं, जब तक model फ्रंटमैटर, प्रति-इनवोकेशन model पैरामीटर या CLAUDE_CODE_SUBAGENT_MODEL कुछ और न कहे, और v2.1.251 से अकेला env var फ्रंटमैटर को ओवरराइड नहीं करता: इसके लिए CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 चाहिए। लॉग में अकेला claude-opus-5 सभी टोकन का 31.5% और भारित लागत का 35.8% था, जिसमें से 63.2% सबअजेंट के भीतर खर्च हुआ। s3
कैश टियर इससे तय होता है कि अनुरोध कहाँ चलता है। इस डेटा में सबअजेंट के 100.0% कैश राइट 5 मिनट वाले थे और मुख्य सेशन के 100.0% कैश राइट 1 घंटे वाले; किसी अनुरोध में मिश्रित बँटवारा नहीं था। सबअजेंट रन के भीतर 41,790 में से सिर्फ़ 95 फ़ॉलो-अप अनुरोध (0.2%) 5 मिनट से ज़्यादा अंतराल के बाद आए, पर उन्होंने औसतन 74,582 cache_creation टोकन लिखे, जबकि गर्म अनुरोधों के लिए 3,886। subagentPromptCacheTtl सेटिंग और CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL env var 5m या 1h लेते हैं और इन्हें Claude Code v2.1.242 या नया चाहिए। s4
एक स्वतंत्र रन में यही बँटवारा दिखा: हर सबअजेंट अनुरोध ephemeral_5m_input_tokens के तहत लिखा गया जबकि पैरेंट ने ephemeral_1h_input_tokens इस्तेमाल किया, और एक एजेंट ने पाँच मिनट की खिड़की के बाद आए अनुरोध पर अपने प्रीफ़िक्स के सारे 20,971 टोकन दोबारा लिखे। s6
मुख्य सेशन में इसका जोड़ीदार लंबा ब्रेक है। पिछले अनुरोध के 5 मिनट से कम बाद आए अनुरोधों ने औसतन (मीडियन) 1,176 cache_creation टोकन लिखे (n = 18,029)। 5 से 60 मिनट के बीच 1,327 (n = 414)। 60 मिनट से ऊपर 130,332 (n = 79), जहाँ प्रॉम्प्ट का मीडियन 175,523 टोकन और p90 674,348 था। डॉक्स पुष्टि करते हैं कि ओवरएज बिलिंग भी मुख्य बातचीत को पाँच मिनट वाले टियर पर ला देती है। s3
सेशन की शुरुआत तयशुदा लागत है: मुख्य सेशन का पहला अनुरोध औसतन 55,989 टोकन (p90 72,000) ढोता था, और CLAUDE.md व मेमोरी के आकार के अनुसार प्रति-प्रोजेक्ट फैलाव 15,764 से 105,020 तक था। एक पुराने सार्वजनिक माप में खाली डायरेक्टरी पर लगभग 29k, 3 MCP सर्वर के साथ 30.4k और असली रेपो में 38.8k का न्यूनतम स्तर मिला था। s9
Effort वह लीवर है जिसे डॉक्स आगे रखते हैं और लॉग इनाम नहीं देते। मुख्य सेशन में high अनुरोधों ने औसतन 778 आउटपुट टोकन बनाए, medium के 837 के मुकाबले; high पर सबअजेंट ने 323 बनाए, 642 के मुकाबले। तुलना confounded है (अलग काम, मॉडल, प्रोजेक्ट), इसलिए यह संदेह का कारण है, सबूत नहीं। Claude Code टीम का अपना मार्गदर्शन effort को बजट नॉब नहीं, बल्कि यह मानता है कि तर्क-खर्च कहाँ करना है। s10
दो लोकप्रिय टिप्स छोटे निकले। प्रॉम्प्ट सुझाव अतिरिक्त अनुरोध खाते हैं, और खूब शेयर किया गया "~10% बचाएँ" आँकड़ा सीमा है, सामान्य बचत नहीं; सेटिंग promptSuggestionEnabled: false या CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false है। s12 बीस दिनों में शेल आउटपुट फ़िल्टर करने से 66.7 मिलियन आउटपुट टोकन घटकर 24.1 मिलियन हुए, पर वे 66.7 मिलियन उसी अवधि में खर्च हुए नए टोकन का 7.4% थे। s11
माप
सबअजेंट लॉन्च लागत, पहले अनुरोध का प्रॉम्प्ट टोकन में, मॉडल के अनुसार:
| मॉडल | n | न्यूनतम | मीडियन | p90 | अधिकतम |
|---|---|---|---|---|---|
| सभी | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
सेशन दोबारा शुरू करने पर कैश री-राइट, मुख्य सेशन, अनुरोध से पहले के अंतराल के अनुसार:
| अंतराल | n | cache_creation मीडियन | औसत | cache_read मीडियन | प्रॉम्प्ट मीडियन |
|---|---|---|---|---|---|
| < 5 मिनट | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| 5 से 60 मिनट | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 मिनट | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
प्रोटोकॉल: हर मुख्य सेशन ~/.claude/projects/*/<uuid>.jsonl और हर सबअजेंट रन */<uuid>/subagents/agent-*.jsonl पढ़ें, 2026-09-01 से अनुरोध। असिस्टेंट पंक्तियों को (message.id, requestId) पर डी-डुप्लिकेट करें और प्रति अनुरोध एक usage रिकॉर्ड रखें। कुल टोकन = input + output + cache_read + cache_creation; प्रॉम्प्ट आकार = input + cache_read + cache_creation। अंतराल = एक सेशन या रन के भीतर पिछले अनुरोध की आख़िरी लॉग पंक्ति से इस अनुरोध की पहली पंक्ति तक का समय। भारित लागत सापेक्ष भार लेती है: input 1, कैश राइट 5m 1.25, कैश राइट 1h 2, cache read 0.1, output 5; ये भार एक अनुमान हैं, प्रकाशित दर नहीं।
सोमवार को यह करें
- अपने प्लान पर
/usageचलाएँ और स्किल, सबअजेंट, प्लगइन और MCP के अनुसार ब्रेकडाउन पढ़ें, साथ में हाल के उपयोग के 10% या उससे ज़्यादा पर उठे व्यवहार फ़्लैग भी। - अपनी सबअजेंट परिभाषाओं की सूची बनाएँ और जो सिर्फ़ खोजते, जाँचते या सारांश बनाते हैं उन सब में
model: haikuयाmodel: sonnetफ्रंटमैटर जोड़ें। - अगर फ्रंटमैटर चाहे जो हो, हर सबअजेंट पर एक ही मॉडल चाहिए, तो
CLAUDE_CODE_SUBAGENT_MODELऔरCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1सेट करें। - जाँचें कि आपका Claude Code वर्ज़न 2.1.242 या नया है, फिर हर वर्कफ़्लो के लिए तय करें कि
subagentPromptCacheTtl: "1h"फ़ायदेमंद है या नहीं: यह उन सबअजेंट की मदद करता है जो टूल कॉल के बीच निष्क्रिय रहते हैं, छोटे वालों की नहीं। - एक घंटे से लंबे ब्रेक से पहले मौजूदा सेशन में काम पूरा करें और हैंडऑफ़ फ़ाइल लिखें; लौटकर 175k टोकन के प्रॉम्प्ट को दोबारा शुरू करने की बजाय नया सेशन खोलें।
- अपने ही लॉग पर (message.id, requestId) पर डी-डुप्लिकेट करने वाली read-only स्क्रिप्ट लिखें और कुछ और बदलने से पहले मुख्य बनाम सबअजेंट का हिस्सा तुलना लें।
- अगर आप सुझाव कभी इस्तेमाल नहीं करते तो
promptSuggestionEnabled: falseसेट करें, और बचत को अधिकतम कुछ प्रतिशत मानें।
आगे पढ़ें
- Max 5x बनाम Max 20x: कटौती के बाद उपयोगकर्ताओं द्वारा मापा गया क्षमता अनुपात प्लान चुनने का सवाल है, जिसे वीडियो ने छोड़ दिया। s7
- कैश TTL की पूरी प्राथमिकता श्रृंखला (force env, bucket env, bucket सेटिंग, सबअजेंट
experimental.cacheTtl) और ओवरएज बिलिंग में क्या बदलता है। s4 - सेशन के बीच effort बदलने से ज़्यादातर मॉडल पर पूरा इतिहास बिना कैश हिट के क्यों पढ़ा जा सकता है, और कौन से मॉडल अपवाद हैं। s3
- अपने सेशन लॉग में
usageफ़ील्ड और कैश टियर कैसे पढ़ें, और रोज़ाना बजट व्यू के लिए ccboard का तरीका। s11 - तीन सबअजेंट फ़ाइलें, तीन मॉडल, और हर लॉन्च ने असल में कैश में क्या लिखा, लेखक के अपने सुधारों के साथ। s8
- स्थगित MCP टूल परिभाषाएँ और
ENABLE_TOOL_SEARCH=auto:N, ताकि टूल स्कीमा कब कॉन्टेक्स्ट में लोड हों यह नियंत्रित हो। s3
स्रोत
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. क्यों पढ़ें: 50% प्रोमो की सटीक तारीख़ें, प्लान और दायरा, Anthropic के अपने शब्दों में।
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. क्यों पढ़ें: 25% बढ़ोतरी और 17% कटौती साथ-साथ, उद्धृत घोषणा के साथ।
- Manage costs effectively, Claude Code docs. क्यों पढ़ें:
/usageब्रेकडाउन, सबअजेंट मॉडल विरासत, और effort व MCP के कैश नियम। - How Claude Code uses prompt caching, Claude Code docs. क्यों पढ़ें: 5m और 1h टियर और TTL सेटिंग का इकलौता प्रामाणिक विवरण।
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. क्यों पढ़ें: वह थ्रेड जिसने सबअजेंट के 5 मिनट कैश को उजागर किया, उसे पलटने वाली सेटिंग के साथ।
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. क्यों पढ़ें: कटौती के बाद दोनों Max टियर की उपयोगकर्ता-पक्ष क्षमता तुलना।
- Three Claude Code subagent files, three models in frontmatter, dev.to. क्यों पढ़ें: कच्चे usage फ़ील्ड और ईमानदार सुधारों के साथ दोहराया जा सकने वाला लॉन्च-लागत प्रयोग।
- Claude Code token overhead: what 33k actually costs, devaireviews.com. क्यों पढ़ें: खाली डायरेक्टरी, MCP सर्वर के साथ और असली रेपो में स्टार्ट-अप ओवरहेड का माप।
- Using Claude Code: Spending your effort, X, Claude Code team. क्यों पढ़ें: टीम effort स्तरों के बारे में कैसे सोचती है; इसमें टोकन गिनती नहीं है, और यही असली बात है।
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. क्यों पढ़ें: बीस दिन का लॉग अध्ययन जो शेल-आउटपुट फ़िल्टरिंग को कुल खपत के अनुपात में रखता है।
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. क्यों पढ़ें: मूल दावा और वह थ्रेड जो 10% को ऊपरी सीमा तक सीमित करता है।
FAQ
क्या यह 17% कटौती है या 25% बढ़ोतरी?
दोनों, अलग-अलग आधार से मापी गईं। प्रोमो से पहले के बेस 100 के मुकाबले स्थायी स्तर 125 पर 25% की बढ़ोतरी है। 13 मई से 13 सितंबर 2026 तक उपयोगकर्ताओं के पास रहे प्रोमो स्तर 150 के मुकाबले यह 17% की कटौती है।
क्या मुझे subagentPromptCacheTtl हर जगह 1h कर देना चाहिए?
सिर्फ़ तब, जब आपके सबअजेंट अनुरोधों के बीच पाँच मिनट से ज़्यादा निष्क्रिय रहते हैं। लॉग में 0.2% फ़ॉलो-अप अनुरोध इस स्थिति में थे, इसलिए सब जगह 1h टियर ज़्यादातर बेकार में महँगा राइट चुकाता है। पहले अपने अंतराल का वितरण मापें।
क्या effort घटाने से टोकन बचते हैं?
इन लॉग में साफ़ नहीं दिखता: high पर मुख्य सेशन अनुरोधों ने औसतन 778 आउटपुट टोकन बनाए, medium के 837 के मुकाबले। डेटा confounded है, इसलिए ईमानदार जवाब यह है कि effort गुणवत्ता की नॉब है जिसकी बचत आपको अपने कामों पर मापनी होगी।
लंच के बाद मेरा पहला प्रॉम्प्ट इतना महँगा क्यों पड़ता है?
मुख्य सेशन 1 घंटे का कैश लिखता है। 60 मिनट से लंबे अंतराल के बाद अगला अनुरोध प्रीफ़िक्स दोबारा लिखता है: लॉग में औसतन (मीडियन) 130,332 cache_creation टोकन, जबकि गर्म अनुरोध पर 1,176। लंबे ब्रेक से पहले काम पूरा करें और बाद में नया सेशन शुरू करें।
AIDive