AIDive

वीडियो पैक

Claude Code साप्ताहिक सीमा में कटौती: मापे गए लीवर, कैश टेबल और सोमवार की चेकलिस्ट

10 मिनट पढ़ें

TL;DR

  • Claude Code की साप्ताहिक सीमा बेस 100 से प्रोमो स्तर 150 पर गई, फिर 14 सितंबर 2026 को स्थायी रूप से 125 पर टिक गई। प्रोमो स्तर के मुकाबले यह 17% की कटौती है; पुराने बेस के मुकाबले 25% की बढ़ोतरी। दोनों बातें एक साथ सच हैं।
  • एक महीने के लोकल लॉग में सबअजेंट ने सभी टोकन का 48.1% और भारित लागत का 55.3% खाया। सबसे बड़ा लीवर: कम सबअजेंट चलाएँ और जो रखें उन पर छोटा मॉडल पिन करें।
  • सबअजेंट 5 मिनट का कैश लिखते हैं, जबकि मुख्य सेशन 1 घंटे का कैश लिखता है। ठंडे अंतराल के बाद का अगला अनुरोध गर्म अनुरोध से लगभग 19 गुना ज़्यादा कैश दोबारा लिखता है।
  • मुख्य सेशन में 60 मिनट से लंबा ब्रेक अगले अनुरोध पर औसतन (मीडियन) 130,332 टोकन का कैश री-राइट माँगता है, जबकि 5 मिनट से कम के अंतराल पर यह 1,176 है।
  • इन लॉग में effort घटाने से प्रति अनुरोध आउटपुट नहीं घटा (मुख्य सेशन में high पर औसत 778 टोकन बनाम medium पर 837)। इसे गुणवत्ता का सौदा मानें, मुफ़्त बचत नहीं।
  • प्रॉम्प्ट सुझाव बंद करना और शेल आउटपुट फ़िल्टर करना असली हैं, पर छोटे लीवर हैं। इन्हें आख़िर में गिनें।

मापों से क्या निकलता है

हेडलाइन का गणित: बेस 100, प्रोमो स्तर 150, स्थायी स्तर 125। 125 / 150 = 0.8333, यानी कटौती 16.67% है जो राउंड होकर 17% बनती है। बढ़ोतरियों को घटाकर (50% से 25%) इसे 25% कटौती कहना ग़लत पढ़ना है। s2

प्रोमो 13 मई 2026 से 13 सितंबर 2026 तक चला, इसने सिर्फ़ Claude Code में साप्ताहिक सीमाएँ 50% बढ़ाईं और 5 घंटे की सीमाओं को नहीं छुआ। यह Pro, Max, Team और सीट-आधारित Enterprise प्लान पर लागू था। s1

नीचे के माप एक मशीन के Claude Code लॉग से हैं: 455 मुख्य सेशन, 2,631 सबअजेंट रन, 2026-09-03 से 2026-10-03 के बीच 63,398 डी-डुप्लिकेट किए गए अनुरोध। पहली खोज गिनती के बारे में है: हर अनुरोध औसतन 1.96 लॉग पंक्तियों पर दिखता है, इसलिए हर पंक्ति जोड़ने से कुल टोकन 99.3% बढ़कर दिखते हैं। इन लॉग को पढ़ने वाली किसी भी स्क्रिप्ट को पहले (message.id, requestId) पर डी-डुप्लिकेट करना होगा। s11

सबअजेंट सबसे बड़ी मद हैं। डी-डुप्लिकेट के बाद वे कुल टोकन का 48.1%, आउटपुट टोकन का 63.9% और भारित लागत का 55.3% हैं। सबअजेंट रन का पहला अनुरोध कुछ भी करने से पहले औसतन 47,117 टोकन का प्रॉम्प्ट ढोता है; p90 52,681 है और अधिकतम 126,769। सीमित टूल सेट वाले एजेंट बहुत नीचे से शुरू होते हैं (न्यूनतम 5,295)। s8

मॉडल का चुनाव इसे और बढ़ाता है। सबअजेंट मुख्य बातचीत का मॉडल विरासत में लेते हैं, जब तक model फ्रंटमैटर, प्रति-इनवोकेशन model पैरामीटर या CLAUDE_CODE_SUBAGENT_MODEL कुछ और न कहे, और v2.1.251 से अकेला env var फ्रंटमैटर को ओवरराइड नहीं करता: इसके लिए CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 चाहिए। लॉग में अकेला claude-opus-5 सभी टोकन का 31.5% और भारित लागत का 35.8% था, जिसमें से 63.2% सबअजेंट के भीतर खर्च हुआ। s3

कैश टियर इससे तय होता है कि अनुरोध कहाँ चलता है। इस डेटा में सबअजेंट के 100.0% कैश राइट 5 मिनट वाले थे और मुख्य सेशन के 100.0% कैश राइट 1 घंटे वाले; किसी अनुरोध में मिश्रित बँटवारा नहीं था। सबअजेंट रन के भीतर 41,790 में से सिर्फ़ 95 फ़ॉलो-अप अनुरोध (0.2%) 5 मिनट से ज़्यादा अंतराल के बाद आए, पर उन्होंने औसतन 74,582 cache_creation टोकन लिखे, जबकि गर्म अनुरोधों के लिए 3,886। subagentPromptCacheTtl सेटिंग और CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL env var 5m या 1h लेते हैं और इन्हें Claude Code v2.1.242 या नया चाहिए। s4

एक स्वतंत्र रन में यही बँटवारा दिखा: हर सबअजेंट अनुरोध ephemeral_5m_input_tokens के तहत लिखा गया जबकि पैरेंट ने ephemeral_1h_input_tokens इस्तेमाल किया, और एक एजेंट ने पाँच मिनट की खिड़की के बाद आए अनुरोध पर अपने प्रीफ़िक्स के सारे 20,971 टोकन दोबारा लिखे। s6

मुख्य सेशन में इसका जोड़ीदार लंबा ब्रेक है। पिछले अनुरोध के 5 मिनट से कम बाद आए अनुरोधों ने औसतन (मीडियन) 1,176 cache_creation टोकन लिखे (n = 18,029)। 5 से 60 मिनट के बीच 1,327 (n = 414)। 60 मिनट से ऊपर 130,332 (n = 79), जहाँ प्रॉम्प्ट का मीडियन 175,523 टोकन और p90 674,348 था। डॉक्स पुष्टि करते हैं कि ओवरएज बिलिंग भी मुख्य बातचीत को पाँच मिनट वाले टियर पर ला देती है। s3

सेशन की शुरुआत तयशुदा लागत है: मुख्य सेशन का पहला अनुरोध औसतन 55,989 टोकन (p90 72,000) ढोता था, और CLAUDE.md व मेमोरी के आकार के अनुसार प्रति-प्रोजेक्ट फैलाव 15,764 से 105,020 तक था। एक पुराने सार्वजनिक माप में खाली डायरेक्टरी पर लगभग 29k, 3 MCP सर्वर के साथ 30.4k और असली रेपो में 38.8k का न्यूनतम स्तर मिला था। s9

Effort वह लीवर है जिसे डॉक्स आगे रखते हैं और लॉग इनाम नहीं देते। मुख्य सेशन में high अनुरोधों ने औसतन 778 आउटपुट टोकन बनाए, medium के 837 के मुकाबले; high पर सबअजेंट ने 323 बनाए, 642 के मुकाबले। तुलना confounded है (अलग काम, मॉडल, प्रोजेक्ट), इसलिए यह संदेह का कारण है, सबूत नहीं। Claude Code टीम का अपना मार्गदर्शन effort को बजट नॉब नहीं, बल्कि यह मानता है कि तर्क-खर्च कहाँ करना है। s10

दो लोकप्रिय टिप्स छोटे निकले। प्रॉम्प्ट सुझाव अतिरिक्त अनुरोध खाते हैं, और खूब शेयर किया गया "~10% बचाएँ" आँकड़ा सीमा है, सामान्य बचत नहीं; सेटिंग promptSuggestionEnabled: false या CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false है। s12 बीस दिनों में शेल आउटपुट फ़िल्टर करने से 66.7 मिलियन आउटपुट टोकन घटकर 24.1 मिलियन हुए, पर वे 66.7 मिलियन उसी अवधि में खर्च हुए नए टोकन का 7.4% थे। s11

माप

सबअजेंट लॉन्च लागत, पहले अनुरोध का प्रॉम्प्ट टोकन में, मॉडल के अनुसार:

मॉडल n न्यूनतम मीडियन p90 अधिकतम
सभी 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

सेशन दोबारा शुरू करने पर कैश री-राइट, मुख्य सेशन, अनुरोध से पहले के अंतराल के अनुसार:

अंतराल n cache_creation मीडियन औसत cache_read मीडियन प्रॉम्प्ट मीडियन
< 5 मिनट 18,029 1,176 2,391 184,169 186,412
5 से 60 मिनट 414 1,327 5,575 221,857 225,168
> 60 मिनट 79 130,332 241,499 25,264 175,523

प्रोटोकॉल: हर मुख्य सेशन ~/.claude/projects/*/<uuid>.jsonl और हर सबअजेंट रन */<uuid>/subagents/agent-*.jsonl पढ़ें, 2026-09-01 से अनुरोध। असिस्टेंट पंक्तियों को (message.id, requestId) पर डी-डुप्लिकेट करें और प्रति अनुरोध एक usage रिकॉर्ड रखें। कुल टोकन = input + output + cache_read + cache_creation; प्रॉम्प्ट आकार = input + cache_read + cache_creation। अंतराल = एक सेशन या रन के भीतर पिछले अनुरोध की आख़िरी लॉग पंक्ति से इस अनुरोध की पहली पंक्ति तक का समय। भारित लागत सापेक्ष भार लेती है: input 1, कैश राइट 5m 1.25, कैश राइट 1h 2, cache read 0.1, output 5; ये भार एक अनुमान हैं, प्रकाशित दर नहीं।

सोमवार को यह करें

  • अपने प्लान पर /usage चलाएँ और स्किल, सबअजेंट, प्लगइन और MCP के अनुसार ब्रेकडाउन पढ़ें, साथ में हाल के उपयोग के 10% या उससे ज़्यादा पर उठे व्यवहार फ़्लैग भी।
  • अपनी सबअजेंट परिभाषाओं की सूची बनाएँ और जो सिर्फ़ खोजते, जाँचते या सारांश बनाते हैं उन सब में model: haiku या model: sonnet फ्रंटमैटर जोड़ें।
  • अगर फ्रंटमैटर चाहे जो हो, हर सबअजेंट पर एक ही मॉडल चाहिए, तो CLAUDE_CODE_SUBAGENT_MODEL और CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 सेट करें।
  • जाँचें कि आपका Claude Code वर्ज़न 2.1.242 या नया है, फिर हर वर्कफ़्लो के लिए तय करें कि subagentPromptCacheTtl: "1h" फ़ायदेमंद है या नहीं: यह उन सबअजेंट की मदद करता है जो टूल कॉल के बीच निष्क्रिय रहते हैं, छोटे वालों की नहीं।
  • एक घंटे से लंबे ब्रेक से पहले मौजूदा सेशन में काम पूरा करें और हैंडऑफ़ फ़ाइल लिखें; लौटकर 175k टोकन के प्रॉम्प्ट को दोबारा शुरू करने की बजाय नया सेशन खोलें।
  • अपने ही लॉग पर (message.id, requestId) पर डी-डुप्लिकेट करने वाली read-only स्क्रिप्ट लिखें और कुछ और बदलने से पहले मुख्य बनाम सबअजेंट का हिस्सा तुलना लें।
  • अगर आप सुझाव कभी इस्तेमाल नहीं करते तो promptSuggestionEnabled: false सेट करें, और बचत को अधिकतम कुछ प्रतिशत मानें।

आगे पढ़ें

  • Max 5x बनाम Max 20x: कटौती के बाद उपयोगकर्ताओं द्वारा मापा गया क्षमता अनुपात प्लान चुनने का सवाल है, जिसे वीडियो ने छोड़ दिया। s7
  • कैश TTL की पूरी प्राथमिकता श्रृंखला (force env, bucket env, bucket सेटिंग, सबअजेंट experimental.cacheTtl) और ओवरएज बिलिंग में क्या बदलता है। s4
  • सेशन के बीच effort बदलने से ज़्यादातर मॉडल पर पूरा इतिहास बिना कैश हिट के क्यों पढ़ा जा सकता है, और कौन से मॉडल अपवाद हैं। s3
  • अपने सेशन लॉग में usage फ़ील्ड और कैश टियर कैसे पढ़ें, और रोज़ाना बजट व्यू के लिए ccboard का तरीका। s11
  • तीन सबअजेंट फ़ाइलें, तीन मॉडल, और हर लॉन्च ने असल में कैश में क्या लिखा, लेखक के अपने सुधारों के साथ। s8
  • स्थगित MCP टूल परिभाषाएँ और ENABLE_TOOL_SEARCH=auto:N, ताकि टूल स्कीमा कब कॉन्टेक्स्ट में लोड हों यह नियंत्रित हो। s3

स्रोत

  • Claude Code May to August 2026 weekly limits promotion, Anthropic help center. क्यों पढ़ें: 50% प्रोमो की सटीक तारीख़ें, प्लान और दायरा, Anthropic के अपने शब्दों में।
  • Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. क्यों पढ़ें: 25% बढ़ोतरी और 17% कटौती साथ-साथ, उद्धृत घोषणा के साथ।
  • Manage costs effectively, Claude Code docs. क्यों पढ़ें: /usage ब्रेकडाउन, सबअजेंट मॉडल विरासत, और effort व MCP के कैश नियम।
  • How Claude Code uses prompt caching, Claude Code docs. क्यों पढ़ें: 5m और 1h टियर और TTL सेटिंग का इकलौता प्रामाणिक विवरण।
  • Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. क्यों पढ़ें: वह थ्रेड जिसने सबअजेंट के 5 मिनट कैश को उजागर किया, उसे पलटने वाली सेटिंग के साथ।
  • Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. क्यों पढ़ें: कटौती के बाद दोनों Max टियर की उपयोगकर्ता-पक्ष क्षमता तुलना।
  • Three Claude Code subagent files, three models in frontmatter, dev.to. क्यों पढ़ें: कच्चे usage फ़ील्ड और ईमानदार सुधारों के साथ दोहराया जा सकने वाला लॉन्च-लागत प्रयोग।
  • Claude Code token overhead: what 33k actually costs, devaireviews.com. क्यों पढ़ें: खाली डायरेक्टरी, MCP सर्वर के साथ और असली रेपो में स्टार्ट-अप ओवरहेड का माप।
  • Using Claude Code: Spending your effort, X, Claude Code team. क्यों पढ़ें: टीम effort स्तरों के बारे में कैसे सोचती है; इसमें टोकन गिनती नहीं है, और यही असली बात है।
  • The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. क्यों पढ़ें: बीस दिन का लॉग अध्ययन जो शेल-आउटपुट फ़िल्टरिंग को कुल खपत के अनुपात में रखता है।
  • PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. क्यों पढ़ें: मूल दावा और वह थ्रेड जो 10% को ऊपरी सीमा तक सीमित करता है।

FAQ

क्या यह 17% कटौती है या 25% बढ़ोतरी?

दोनों, अलग-अलग आधार से मापी गईं। प्रोमो से पहले के बेस 100 के मुकाबले स्थायी स्तर 125 पर 25% की बढ़ोतरी है। 13 मई से 13 सितंबर 2026 तक उपयोगकर्ताओं के पास रहे प्रोमो स्तर 150 के मुकाबले यह 17% की कटौती है।

क्या मुझे subagentPromptCacheTtl हर जगह 1h कर देना चाहिए?

सिर्फ़ तब, जब आपके सबअजेंट अनुरोधों के बीच पाँच मिनट से ज़्यादा निष्क्रिय रहते हैं। लॉग में 0.2% फ़ॉलो-अप अनुरोध इस स्थिति में थे, इसलिए सब जगह 1h टियर ज़्यादातर बेकार में महँगा राइट चुकाता है। पहले अपने अंतराल का वितरण मापें।

क्या effort घटाने से टोकन बचते हैं?

इन लॉग में साफ़ नहीं दिखता: high पर मुख्य सेशन अनुरोधों ने औसतन 778 आउटपुट टोकन बनाए, medium के 837 के मुकाबले। डेटा confounded है, इसलिए ईमानदार जवाब यह है कि effort गुणवत्ता की नॉब है जिसकी बचत आपको अपने कामों पर मापनी होगी।

लंच के बाद मेरा पहला प्रॉम्प्ट इतना महँगा क्यों पड़ता है?

मुख्य सेशन 1 घंटे का कैश लिखता है। 60 मिनट से लंबे अंतराल के बाद अगला अनुरोध प्रीफ़िक्स दोबारा लिखता है: लॉग में औसतन (मीडियन) 130,332 cache_creation टोकन, जबकि गर्म अनुरोध पर 1,176। लंबे ब्रेक से पहले काम पूरा करें और बाद में नया सेशन शुरू करें।