AIDive

वीडियो पैक

चार Claude Code टोकन सेवर मापे गए: फ़ैसले की टेबल, चेकलिस्ट और स्रोत

11 मिनट पढ़ें

TL;DR

  • चार टूल Claude Code बिल के चार अलग हिस्सों पर काम करते हैं: graphify उस पर जो पढ़ा जाता है, rtk शेल आउटपुट पर, Superpowers हिस्ट्री और मॉडल के चुनाव पर, caveman उस पर जो एजेंट लिखता है। इन्हें README के प्रतिशत से नहीं, बल्कि इस आधार पर रैंक करें कि वे कितने बड़े हिस्से को छूते हैं।
  • बिल को सिर्फ Superpowers हिलाता है: हर टास्क के लिए नया subagent और सबसे कम ताकतवर मॉडल जो काम कर सके, इससे तय होता है कि क्या पढ़ा जाए और कौन पढ़े। इसकी कीमत है हर टास्क पर एक गेट, छोटे टास्क पर भी।
  • graphify दूसरे नंबर पर है: tree-sitter से लोकल ग्राफ, LLM क्रेडिट शून्य, और हमारे अपने कॉर्पस पर नाइव रीड के मुकाबले हर क्वेरी में 91.8x कम टोकन।
  • rtk सिर्फ उस हिस्से को कंप्रेस करता है जिसे Bash hook देख पाता है। JetBrains ने मॉडल द्वारा पढ़े गए आउटपुट का 19.7% कंप्रेस करने लायक पाया, यानी बिल का करीब 3% तक की सीमा, और एंड-टू-एंड टेस्ट में हर टास्क +7.6%।
  • caveman 65% का दावा करता है और एजेंटिक काम में आउटपुट टोकन पर 8.5% मापा गया। Claude Code में यही आइडिया Concise output style के रूप में पहले से मौजूद है।
  • जो दो आंकड़े सबसे ज़्यादा दोहराए जाते हैं, 11.6M टोकन बचे और +7.6% प्रति टास्क, वे अलग चीज़ें मापते हैं: bash आउटपुट के बाइट बनाम पूरे हुए टास्क की लागत।

माप क्या बताते हैं

पहले नक्शा। rtk का अपना savings doc उस चीज़ का ट्री बनाता है जो एक सेशन पढ़ता है और दिखाता है कि प्रॉक्सी सिर्फ bash आउटपुट को फ़िल्टर करता है, फिर साफ़ कहता है: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3। JetBrains ने 83 बेसलाइन सेशन दोबारा चलाए, 1.9 million अक्षर टूल आउटपुट, और उसे तीन हिस्सों में बांटा: rtk जिस शेल आउटपुट को कंप्रेस कर सकता है 373,339 (19.7%), जिस शेल आउटपुट के लिए उसके पास कोई नियम नहीं 879,326 (46.3%), और फ़ाइल रीडिंग व सर्च टूल जो rtk को बायपास करते हैं 646,613 (34.0%) s1। Read और Grep कभी Bash hook से नहीं गुज़रते। caveman README दूसरी तरफ़ से इसी नतीजे पर पहुंचता है: बिल का बड़ा आधा हिस्सा आम तौर पर पढ़ना होता है s7।

graphify. रिपॉज़िटरी 2026-04-03 को बनी और 2026-09-02 को 113,946 stars और 11,078 forks पर थी, लेटेस्ट रिलीज़ v0.9.53, Python, Apache-2.0 s5। README के benchmark की पंक्ति कहती है "Graph build | LLM credits | 0": कोड tree-sitter से लोकली ~40 भाषाओं में पार्स होता है, कम्युनिटी Leiden से बंटती हैं, मशीन से कुछ बाहर नहीं जाता s5। r/ClaudeAI पर लेखक की पोस्ट में 2.5 महीने में 73k stars और 2.2M डाउनलोड बताए गए s10। 1,701,550 शब्दों के प्रोजेक्ट (नाइव रीड के रूप में लगभग 2,268,733 टोकन) पर हमारे अपने graphify benchmark ने 34,031 nodes और 56,865 edges बनाए, औसत क्वेरी लागत करीब 24,702 टोकन, यानी प्रति क्वेरी 91.8x कम टोकन; सवाल के हिसाब से फ़र्क़ "what is the main entry point" के लिए 679.1x से लेकर "what connects the data layer to the api" के लिए 34.0x तक रहा s5। 91.8x की तुलना नाइव फ़ुल रीड से है, जो कोई जानबूझकर नहीं करता; कोड बदलने के साथ ग्राफ़ पुराना भी पड़ता है और वैकल्पिक semantic pass ही वह कदम है जिसमें मॉडल कॉल की लागत आती है।

rtk. 2026-01-22 को बना, 2026-09-02 को 78,326 stars और 4,942 forks, रिलीज़ v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4। लॉन्च पोस्ट में दावा था "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" और "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9। हमारी मशीन पर rtk 0.42.3 ने 25599 कमांड और 11.6M टोकन बचे (41.6%) बताए, और By Command टेबल में सबसे ऊपर find, read और grep थे s4। JetBrains ने rtk v0.43.0 को ठीक वैसे इंस्टॉल किया जैसा rtk init -g देता है, Claude Code 2.1.201 और claude-sonnet-5 पर, और 86 टास्क दो बार चलाए। हर 3 शेल कमांड में सिर्फ़ 1 ऐसा है जिसे rtk रीराइट कर सकता है (1,056 कमांड में से 349 rewritable, 525 बिना नियम, 182 skipped)। कंप्रेस करने लायक सारे आउटपुट को 70% घटा दें तो भी कुल बचत बिल के करीब 3% पर रुक जाती है; मापा गया नतीजा था प्रति टास्क +7.6% ज़्यादा महंगा, और high effort पर कोई फ़र्क़ नहीं s1। README अब यह बात मान लेता है: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", और जो गिनती वह देता है वह bytes / 4 से अनुमानित है s4।

Superpowers. 2025-10-09 को बना, 2026-09-02 को 280,792 stars और 25,164 forks, रिलीज़ v6.3.0 जिसमें चौदह skills हैं, MIT, एक इंस्टॉल कमांड: /plugin install superpowers@claude-plugins-official s6। brainstorming skill एक कड़े गेट से शुरू होती है: जब तक स्पष्ट intent मंज़ूर न हो, कोई कोड नहीं, कोई scaffolding नहीं, कोई implementation skill नहीं; तीन रास्ते (spike, bounded, architectural) और नियम "When in doubt between two paths, take the heavier one" s12। writing-plans मानती है कि इंजीनियर के पास शून्य संदर्भ है और काम को ऐसे चरणों में बांटती है जहां "Each step is one action (2-5 minutes)" s13। subagent-driven-development हर टास्क को एक नया subagent देती है जिसे सिर्फ़ उसी टास्क का संदर्भ मिलता है, सेशन की हिस्ट्री कभी नहीं, हर टास्क के बाद एक रिव्यू और अंत में ब्रांच का व्यापक रिव्यू। इसका मॉडल सेक्शन कहता है "Use the least powerful model that can handle each role to conserve cost", चेतावनी देता है कि छोड़ा गया model सेशन के मॉडल से इनहेरिट होता है, और कहता है "Turn count beats token price"। हर टास्क के लिए अधिकतम पांच राउंड: राउंड 1 से 3 implementer को फिर चालू करते हैं, राउंड 4 में ज़्यादा सक्षम मॉडल पर नया implementer आता है, राउंड 5 में orchestrator खुद फ़ैसला करता है s14। कहीं कोई कंप्रेशन नहीं: बचत कम हिस्ट्री पढ़ने और मैकेनिकल चरणों के लिए छोटे मॉडल को पैसे देने से आती है। पूरा walkthrough हमारे पिछले वीडियो में है s11।

caveman. 2026-04-04 को बना, 2026-09-02 को 102,548 stars और 5,967 forks, रिलीज़ bin-v1.1.5, Go; skill MIT है, proxy runtime BSL-1.1 s7। इसकी अपनी टेबल, Claude API से दस प्रॉम्प्ट, औसतन बिना caveman 1214 आउटपुट टोकन और caveman के साथ 294 दिखाती है, यानी 65%, सबसे अच्छा केस 87% और सबसे बुरा 22% s7। README का IMPORTANT ब्लॉक ईमानदार है: skill सिर्फ़ आउटपुट छोटा करती है, इनपुट और reasoning टोकन नहीं बदलते, और नियमों की लागत हर टर्न पर करीब 1 से 1.5k इनपुट टोकन है, इसलिए पूरे सेशन की बचत चार्ट से कम निकलती है s7। JetBrains ने Claude Code 2.1.200 पर claude-sonnet-5 के साथ effort low पर 82 जोड़ीदार टास्क चलाए, लागत करीब USD 106: "Advertised saving: 65%. Measured saving: 8.5%", 592k से 542k आउटपुट टोकन, गुणवत्ता में कोई पता लगने लायक गिरावट नहीं (sign test p = 0.82), सिफ़ारिश "use it if you like it" s2। Claude Code की बिल्ट-इन Concise style यही काम करती है: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", इसके लिए v2.1.237 या नया चाहिए, इसे /config से चुना जाता है और .claude/settings.local.json में outputStyle के रूप में सेव होती है। Styles सिर्फ़ मुख्य बातचीत पर लागू होती हैं; subagent अपना सिस्टम प्रॉम्प्ट चलाता है s8।

फ़ैसले की टेबल

टूल बिल का हिस्सा दावा मापा गया किसे हिलाता है
Superpowers हिस्ट्री + हर टास्क का मॉडल कोई आंकड़ा नहीं हर टास्क के लिए नया कॉन्टेक्स्ट, हर रोल के लिए सबसे कम ताकतवर मॉडल बिल को
graphify जो पढ़ा जाता है बनाने में 0 LLM credits नाइव रीड के मुकाबले प्रति क्वेरी 91.8x कम टोकन (हमारा) बिल को, रीड्स पर
rtk कंप्रेस करने लायक शेल आउटपुट कमांड पर 60-90% 19.7% कंप्रेस करने लायक, सीमा करीब 3%, प्रति टास्क +7.6% (JetBrains) मार्जिन को
caveman / Concise जो एजेंट लिखता है 65% आउटपुट टोकन का 8.5% (JetBrains) मार्जिन को

सोमवार को यह करें

  • अपना पिछला लंबा सेशन खोलें और गिनें कि इनपुट कहां गया: Read और Grep कितना, शेल आउटपुट कितना, दोबारा चलाई गई हिस्ट्री कितनी। कुछ भी इंस्टॉल करने से पहले हर टूल को उसके हिस्से पर रखें।
  • /plugin install superpowers@claude-plugins-official से Superpowers इंस्टॉल करें और एक असली फ़ीचर को brainstorming, writing-plans और subagent-driven-development से गुज़ारें। देखें कि orchestrator का context gauge स्थिर रहता है।
  • हर subagent पर, जिसे आप भेजें, model साफ़ तय करें। छोड़ा गया model सेशन के मॉडल से इनहेरिट होता है और आप मैकेनिकल काम के लिए orchestrator की दर चुकाते हैं।
  • अपने सबसे बड़े रेपो पर /graphify . चलाएं, फिर graphify benchmark, और प्रति क्वेरी लागत की तुलना उस नाइव कॉर्पस साइज़ से करें जो वह प्रिंट करता है। कोड बदलने पर ग्राफ़ दोबारा बनाएं।
  • अगर आप पहले से rtk चलाते हैं, तो rtk gain को शेल आउटपुट के बाइट की तरह पढ़ें, पैसे की तरह नहीं। इसे JetBrains के बंटवारे के साथ रखें: find, read और grep जो भी बचाएं, Read और Grep टूल कभी hook से गुज़रे ही नहीं।
  • caveman जोड़ने से पहले /config से Concise output style चालू करें; वह Claude Code के साथ आती है और हर टर्न पर skill के नियमों की लागत नहीं लगती।
  • अपनी एक खुद की माप रखें: हर बदलाव से पहले और बाद टास्क की लागत, वही टास्क सेट, किसी एक कमांड के बाइट की गिनती नहीं।

आगे पढ़ें

  • JetBrains की rtk की पूरी methodology, 83-सेशन रीप्ले और 1,056-कमांड के बंटवारे के साथ, किसी भी शेल प्रॉक्सी को मापने का संदर्भ है s1।
  • caveman बेंचमार्क समझाता है कि 82 जोड़ीदार टास्क और एक sign test कैसे 65% के चार्ट को आउटपुट टोकन के 8.5% में बदल देते हैं s2।
  • rtk का savings-explained पेज इसका सबसे साफ़ ट्री है कि सेशन असल में क्या पढ़ता है; किसी भी "tokens saved" काउंटर पर भरोसा करने से पहले इसे पढ़ें s3।
  • graphify README का benchmarks सेक्शन शून्य-क्रेडिट बिल्ड और semantic pass को दर्ज करता है, जो वह एकमात्र कदम है जिसमें मॉडल कॉल की लागत आती है s5।
  • Superpowers का model selection सेक्शन, "Turn count beats token price" और पांच-राउंड की सीमा के साथ, वह हिस्सा है जिसे अपनी एजेंट परिभाषाओं में कॉपी करना चाहिए s14।
  • brainstorming का कड़ा गेट और तीन रास्ते दिखाते हैं कि टास्क के साथ रस्म कैसे बढ़ती-घटती है, और वह उन छोटे फ़िक्स पर भी कहां चल पड़ती है जो इसके लायक नहीं s12।
  • Claude Code docs में Output styles: Concise style, v2.1.237 की न्यूनतम शर्त, और subagent इसे क्यों अनदेखा करते हैं s8।

स्रोत

  • Does rtk really save tokens in Claude Code?, JetBrains. इसे क्यों पढ़ें: rtk का एकमात्र एंड-टू-एंड टेस्ट, जिसमें एजेंट जो पढ़ता है उसका 19.7% / 46.3% / 34.0% बंटवारा है।
  • Speak to AI agents like cavemen to save tokens, JetBrains. इसे क्यों पढ़ें: 82 जोड़ीदार टास्क जो गुणवत्ता में गिरावट पाए बिना 65% के दावे को 8.5% तक ले आते हैं।
  • How RTK savings work, GitHub. इसे क्यों पढ़ें: मेंटेनर्स का अपना बिल का ट्री और 90% कम बाइट वाला वाक्य।
  • rtk-ai/rtk on GitHub, GitHub. इसे क्यों पढ़ें: README अब बताता है कि rtk क्या मापता है और गिनती कैसे अनुमानित होती है।
  • Graphify-Labs/graphify on GitHub, GitHub. इसे क्यों पढ़ें: benchmarks टेबल, शून्य-क्रेडिट बिल्ड, और यहां इस्तेमाल हुआ graphify benchmark कमांड।
  • obra/superpowers on GitHub, GitHub. इसे क्यों पढ़ें: वह प्लगइन जो बदलता है कि क्या पढ़ा जाए और कौन सा मॉडल पढ़े।
  • JuliusBrussee/caveman on GitHub, GitHub. इसे क्यों पढ़ें: बचत की टेबल और IMPORTANT ब्लॉक जो उसे कमज़ोर करता है।
  • Output styles, Claude Code docs. इसे क्यों पढ़ें: बिल्ट-इन Concise style और subagents के साथ उसकी सीमाएं।
  • rtk launch post on r/ClaudeAI, Reddit. इसे क्यों पढ़ें: 10.2M का मूल दावा, जिसकी JetBrains के माप से तुलना उपयोगी है।
  • Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. इसे क्यों पढ़ें: अपनाए जाने और ग्राफ़ किस काम का है, इस पर लेखक की बात।
  • Superpowers: The Plugin That Disciplines Claude Code, AIDive. इसे क्यों पढ़ें: प्लगइन का हमारा पूरा walkthrough, skill दर skill।
  • Superpowers brainstorming skill (SKILL.md), GitHub. इसे क्यों पढ़ें: कड़ा गेट और तीन रास्ते, शब्दशः।
  • Superpowers writing-plans skill (SKILL.md), GitHub. इसे क्यों पढ़ें: 2 से 5 मिनट की चरण-बारीकी जो subagent के कॉन्टेक्स्ट छोटे रखती है।
  • Superpowers subagent-driven-development skill (SKILL.md), GitHub. इसे क्यों पढ़ें: हर रोल के लिए मॉडल का चुनाव और पांच-राउंड की सीमा।

FAQ

rtk 11.6M टोकन बचे क्यों दिखाता है जबकि वह बिल को मुश्किल से हिलाता है?

काउंटर शेल आउटपुट के बाइट को 4 से भाग देकर नापता है, उन कमांड पर जो hook से गुज़रीं। Read और Grep टूल कॉल, सिस्टम प्रॉम्प्ट और दोबारा चलाई गई हिस्ट्री उससे कभी नहीं गुज़रते, और JetBrains ने पाया कि मॉडल जो पढ़ता है उसका सिर्फ़ 19.7% इस तरह कंप्रेस हो सकता है।

क्या Superpowers कुछ कंप्रेस करता है?

नहीं। वह हर टास्क को सिर्फ़ उसी टास्क के संदर्भ वाला नया subagent देकर कम पढ़ता है, और हर रोल के लिए सबसे कम ताकतवर सक्षम मॉडल देकर कम चुकाता है। कीमत है हर टास्क पर एक गेट।

क्या caveman इंस्टॉल करना सही है?

JetBrains को कोई गुणवत्ता गिरावट नहीं मिली और आउटपुट टोकन 8.5% कम हुए, इसलिए स्टाइल पसंद हो तो इस्तेमाल करें। Claude Code v2.1.237 या नए में Concise output style वही असर देती है, बिना उन 1 से 1.5k इनपुट टोकन के जो skill के नियम हर टर्न पर लेते हैं।

graphify कब फ़ायदा देना बंद कर देता है?

जब ग्राफ़ पुराना हो या सवाल को semantic pass चाहिए, जिसमें मॉडल कॉल की लागत आती है। 91.8x का आंकड़ा एक क्वेरी की तुलना पूरे कॉर्पस को पढ़ने से करता है, इसलिए छोटे रेपो में फ़र्क़ भी छोटा दिखता है।