आठ repos, एक project, 87 runs
आठ GitHub repos इस महीने Claude Code essentials की हर लिस्ट में हैं: Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs और FWC SwiftUI Skills। सबको मिलाकर इनके 37,000 से ज़्यादा stars हैं। ये लिस्टें बताती हैं कि हर repo क्या दावा करता है और उसे कैसे install करें। कोई भी इन्हें साथ में install करके नहीं मापता।
तो सभी आठ को एक असली project पर डाला गया, एक React app जिसमें 111 passing tests हैं। इनमें से एक ने खुद को machine पर मौजूद नौ और AI tools की settings में लिख दिया। एक को कभी run ही नहीं किया गया, सिर्फ इसके source की एक लाइन की वजह से। और तीन ने Claude Code से एक server जोड़ा जिसे 63 runs में एक बार भी नहीं बुलाया गया।
| टेस्ट | मान |
|---|---|
| Install किए गए repos | 8 |
| कुल runs | 87 |
| कुल खर्च | लगभग $6 |
| Project | 1 React app, 111 पास होते tests |
| Model | 1 |
| अवधि | 1 दिन |
बाकी सब तीन सवालों पर टिका है: हर repo की startup पर कीमत क्या है, output में असल में क्या बदला, और कौन-से रखने लायक हैं।
टाइप करने से पहले हर एक की कीमत
Startup cost वो है जो Claude Code आपके पहले message से पहले context में load करता है। खाली project पर यह करीब 17,000 tokens है, और आप हर turn पर इनकी कीमत चुकाते हैं। किसी install को मापने के लिए, Claude से एक शब्द में जवाब देने को कहा गया, और बिल पढ़ा गया। इकाई tokens है, dollars नहीं: सिर्फ caching की वजह से दो identical runs की कीमत में 10 गुना फ़र्क़ आ सकता है।
| Install | जोड़े गए startup tokens |
|---|---|
| Chisle | लगभग 3,500 |
| Ouroboros | लगभग 1,600 |
| Reticle | लगभग 900 |
| img2threejs (33 KB की instruction file) | 107 |
| Anti-Slop (helper skill) | 95 |
| UI Skills | 37 |
| बाकी सब | हर एक 100 से 300 |
| सभी आठ मिलाकर | 7,000 से कम |
आठ में से दो तो web developer के लिए हैं ही नहीं। img2threejs किसी photo को 3D scene में बदलता है, और FWC SwiftUI Skills Apple apps के लिए है। सिर्फ इनकी कीमत मापी गई। यह 3D skill 33-kilobyte का instruction file ship करता है फिर भी इसकी कीमत सिर्फ 107 tokens है, क्योंकि जब तक आप इसे बुलाते नहीं, सिर्फ skill का description लोड होता है।
Servers भी सस्ते हो गए। Claude Code अब किसी server के tools के सिर्फ नाम load करता है और details ज़रूरत पड़ने पर लाता है। यह हर tool के लिए करीब 45 tokens है, चाहे tool कुछ भी करे। सभी आठ install होने पर, कीमतें बस जुड़ती जाती हैं। कुछ भी गुणा नहीं होता।
Claude Code के पास एक command है जो किसी plugin के लिए इस कीमत का अनुमान लगाता है, और यह hooks को मुफ़्त गिनता है। इस machine पर रोज़ इस्तेमाल होने वाले एक plugin के लिए, इसने करीब 540 tokens का अनुमान लगाया। नापने पर यह 744 निकला, क्योंकि इसका startup hook सीधे session में print करता है।
ये repos startup पर महंगे नहीं पड़ते। महंगा turns में पड़ता है।
वही tasks, साथ और बिना
Benchmark तीन tasks है जो कोई developer असल में सौंपेगा: एक bug जिसमें web address बनने का तरीका गलत है, एक feature जो reading time दिखाता है, और form पर एक character counter। हर task एक repo install होने के साथ, सभी आठ के साथ, और किसी के भी बिना चलाया गया, हर बार तीन runs। judge वो test है जिसे agent कभी नहीं देखता, साथ में project का अपना suite, और type checker। हर run में allowed tools की वही fixed लिस्ट इस्तेमाल हुई, कोई permission bypass नहीं।
| नतीजा | मान |
|---|---|
| Task runs | 63 |
| Pass हुए | 63 |
| नई type errors | 0 |
| तीन जुड़े servers को calls | 0 |
| Bug fix, baseline | 7 turns, 27 seconds |
| Form task, baseline | 22 turns, लगभग 1 मिनट |
किसी चीज़ ने Claude को कोई task fail नहीं कराया, और किसी चीज़ ने उसे कोई ऐसा task pass नहीं कराया जो वो बिना उसके fail कर देता।
इनमें से तीन repos एक server जोड़ते हैं जिसमें ढेरों tools हैं। 63 runs में, Claude ने उन tools को ज़ीरो बार बुलाया। इसमें form task भी शामिल है, जो इस तरह लिखा गया था कि design advice और visual testing को करने के लिए कुछ मिले। ईमानदारी से कहें तो, इनमें से दो को उनका असली काम कभी मिला ही नहीं। Reticle को आपके चल रहे app से जुड़ा एक browser चाहिए, और वो जोड़ crash हो गया। Ouroboros को पूरी machine पर setup चाहिए, और उसे वो नहीं दिया गया।
Noise बहुत ज़्यादा है। वही prompt, वही install: एक run ने 4,300 tokens लिखे, दूसरे ने 7,100। सिर्फ दो नतीजे अपने ही noise से आगे निकले, दोनों सबसे छोटे task पर। एक अकेला before-and-after demo कुछ साबित नहीं करता।
Chisle का 52 प्रतिशत, असली coding work पर
Chisle एक output-compression plugin है, और आठों में से इकलौता जो कोई नंबर देने का वादा करता है: इसका benchmark कहता है कि आपका बिल घटकर 52 प्रतिशत रह जाएगा। तीन tasks पर, output baseline के 94 प्रतिशत पर आया। README अपने ही शब्दों में इसकी वजह बताता है: वो आंकड़े बिना tools वाले single prompts के हैं, पूरे session की कीमत के नहीं।
| माप | मान |
|---|---|
| Chisle का benchmark दावा | output 52% पर |
| Chisle तीन tasks पर | output baseline के 94% पर |
| रोज़ इस्तेमाल होने वाला brevity plugin, वही tasks | 113%, noise के अंदर |
| एक bug fix: पढ़े गए tokens | 95,000 |
| एक bug fix: लिखे गए tokens | 1,700 |
असली coding session में, output बिल का छोटा हिस्सा है। Chisle अपने rules शुरुआत में load करता है और आपके भेजे हर prompt पर एक reminder चिपका देता है, इसलिए इसके runs तीन में से दो tasks पर baseline से महंगे पड़े। rules उन शब्दों से भारी हैं जिन्हें ये बचाते हैं। इसका tool output के लिए compressor हर session में चला और कभी कोई saving दर्ज नहीं हुई।
किसी भी plugin ने कुछ भी नापने लायक नहीं बचाया। एक Chisle user को 173 sessions में यही मिला, और author कहते हैं कि वो bug ठीक कर दिया गया है। श्रेय जहां बनता है वहां दें: Chisle अपने घाटे भी खुद publish करता है, और इसका file handling ध्यान से hardened है।
इससे जो सीखने वाली बात है: जो plugin हर turn पर बोलता है, वो सबसे महंगी किस्म का होता है।
जो installs आपके project से बाहर पहुंचते हैं
Install scope यह है कि किसी repo का setup आपके चलाए folder से कितना बाहर तक पहुंचता है। यहां सब कुछ जानबूझकर एक ही folder के अंदर install किया गया, ताकि बाकी machine को कुछ भी न छुए।
Reticle के setup command का इरादा कुछ और था। इसके अपने log के मुताबिक, यह 8 और agents के साथ register हो गया: VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp, और एक और। Gemini में, इसने पहले से खुद को approve कर लिया। Claude Code की settings में, इसने एक rule जोड़ दी जो इसके अपने tools को approve करती है। इसमें कुछ भी छिपा नहीं है, यह सीधे source में मौजूद है, installer खुलकर बताता है कि वो क्या कर रहा है, और यह एक uninstall command भी देता है। लेकिन इसे सिर्फ एक yes flag दिया गया था, एक project के लिए।
Caliper को measuring tool होना था। इसका harness Claude को हर permission check बंद करके launch करता है, इसे बदलने का कोई विकल्प नहीं है, और यह आपके login credentials को हर test run में copy कर लेता है। इसे कभी run नहीं किया गया; इसकी जगह एक custom runner इस्तेमाल हुआ।
| Repo | Project के अंदर साफ़-सुथरा install होता है? | Notes |
|---|---|---|
| Anti-Slop | हां | सिर्फ files copy करता है, और कुछ नहीं |
| UI Skills | हां | Remote skill library |
| img2threejs | हां | एक skill |
| FWC SwiftUI Skills | हां | Plain text |
| Reticle | आंशिक रूप से | 8 और agents के साथ register, खुद को approve करने वाला rule |
| Chisle | नहीं | सिर्फ global, startup पर updates check करता है, raw tool output disk पर save करता है |
| Ouroboros | नहीं | सिर्फ पूरी machine पर, by default usage report करता है, installer internet से एक script आपके shell में pipe कर सकता है |
| Caliper | Run नहीं हुआ | Permission checks बंद, हर run में credentials copy होते हैं |
इनमें से कुछ भी malware नहीं है। यह वो convenience है जो मान लेती है कि आप tool हर जगह चाहते हैं। किसी भी install से पहले तीन चीज़ें खोलें: hooks, install script, और server config।
जब सब साथ आएं तो क्या होता है
Stacking का मतलब है सभी आठ एक साथ install होना: न कोई crash, न कोई error, और कीमतें लगभग ठीक-ठीक जुड़ जाती हैं। एक trap ने एक घंटा खा लिया। scripted runs में, एक project server एक approval का इंतज़ार करता है जो कोई दे ही नहीं सकता, इसलिए वो लगभग मुफ़्त दिखता है। यहां हर server का आंकड़ा उसे ठीक करने के बाद दोबारा मापा गया।
Hooks वहीं हैं जहां ये repos मिलते हैं। hook एक script है जिसे Claude Code एक तय पल पर चलाता है, और वो जो भी print करे वो model के सामने पहुंच सकता है। इनमें से तीन tools जुड़े होने पर, startup पर तीन scripts चलते हैं और हर prompt पर तीन और। एक साधारण टाइप किया वाक्य model तक दो notes के साथ पहुंचा: एक उसे संक्षेप में लिखने को कह रहा था, दूसरा एक ऐसे setup step की मांग कर रहा था जो project के अंदर पूरा ही नहीं हो सकता। वो दूसरा note हर उस prompt पर वापस आता है जिसमें उसका कोई keyword हो।
Tool names टकरा नहीं सकते, क्योंकि हर server अपना prefix लगाता है। hooks के लिए, docs इसकी पुष्टि करते हैं: जब कई hooks context जोड़ते हैं, तो Claude को सारे values मिलते हैं।
May 2026 की एक study ने मापा कि skills का बड़ा ढेर किसी agent पर क्या असर डालता है। करीब 200 skills के साथ, pass rate 21 प्रतिशत तक गिर गया, और उस नुकसान का ज़्यादातर हिस्सा तब आता है जब agent सही skill की जगह उससे मिलती-जुलती दिखने वाली skill चुन लेता है। आठ repos मतलब 10 skills, जो उसके करीब भी नहीं है। जिनके पास दर्जनों installed हैं, वो उस दायरे में हैं।
जिसने code बदल दिया
Anti-Slop lint rules का एक सेट है जो आप अपने project में copy करते हैं, यह कोई plugin नहीं है। install करने के लिए कोई package नहीं है; author चाहता है कि आप rules को copy करें और उन्हें बदलें। linter model के बाहर आपका code पढ़ता है, इसलिए इसकी कोई context कीमत नहीं है: इसकी helper skill के लिए 95 tokens, और हर turn पर कुछ भी नहीं।
Form task में, Claude को एक component में एक नया field जोड़ना था। उसने ऊपर वाली लाइन copy कर ली, साथ में unsafe type cast भी। Anti-Slop ने इसे flag किया, तीन में से तीन runs में। यह वैसी चीज़ है जिसे कोई reviewer यूं ही निकल जाने देता है, क्योंकि यह अपने पड़ोसियों जैसी ही दिखती है।
| Anti-Slop की finding | मान |
|---|---|
| Unsafe type cast flag हुआ | 3 में से 3 runs |
| एक सही छह-लाइन के function में missing blank line flag हुआ | 3 में से 2 runs |
| बिना छुए project पर findings | 109 |
| इनमें से दो style rules का हिस्सा | 83% |
| बाकी rules | 16 |
blank-line वाला finding taste की बात है, bug नहीं, और linter एक बार में सिर्फ एक ही file पढ़ता है। कीमत पहले ही दिन दिखती है: बाकी 16 को परखने से पहले उन दो style rules पर फैसला ले लें। एक gotcha: rules modules के रूप में ship होते हैं, इसलिए आपके project को भी खुद को module घोषित करना होगा, वरना linter crash कर जाता है।
UI Skills रखने में सबसे सस्ता है: design skills की एक remote library के लिए 37 tokens, और इन runs में ज़ीरो calls। July में इसमें 18 dead links थे। video वाली सुबह सभी 300 test किए गए, और एक भी टूटा नहीं है।
मैं क्या रख रहा हूँ, और अपना setup कैसे check करें
आठों repos की छंटाई हो गई। उम्मीद तीन रखने लायक repos की थी। data एक को देता है जिसने इसे कमाया, और तीन को जो मुफ़्त में रखे जा सकते हैं।
| Repo | फैसला |
|---|---|
| Anti-Slop | कमाया: हर बार लगभग मुफ़्त में एक असली गलती पकड़ी |
| UI Skills | मुफ़्त में रखने लायक: 37 tokens, किसी से टकराव नहीं |
| img2threejs, FWC SwiftUI Skills | अगर कभी बुलाएंगे तो मुफ़्त में रखने लायक: साथ मिलाकर कुछ सौ tokens |
| Chisle | असली coding work पर जितना बचाया उससे ज़्यादा खर्च कराया |
| Caliper | कभी चला ही नहीं |
| Reticle, Ouroboros | पूरी machine चाहते हैं, इन्हें कभी असली काम करते नहीं देखा, इसलिए इनके असली मकसद पर कोई फैसला नहीं |
Ouroboros के अपने maintainer के हिसाब से इसके करीब 40 प्रतिशत runs fail होते हैं।
सीमाएं मायने रखती हैं: एक React project, एक model, तीन tasks, हर एक के तीन runs। इतने चौड़े noise के साथ, छोटे असर दिखते ही नहीं। data जो एक बात तय करता है वो यह है कि floor ऊंचा है। Claude ने इन tools के साथ या बिना, सब कुछ pass किया, और जो tools context में बुलाए जाने का इंतज़ार करते बैठे रहते हैं, वो ज़्यादातर बुलाए ही नहीं जाते। उन्हें एक ऐसे workflow की ज़रूरत है जो खुद इनकी तरफ़ हाथ बढ़ाए।
आप अपना setup दो मिनट में check कर सकते हैं। एक command दिखाता है कि अभी क्या load है। एक किसी plugin की कीमत का अनुमान लगाता है, और याद रखें यह hooks को मुफ़्त गिनता है। एक बताता है कि हर skill की कीमत क्या है और वो कितनी बार इस्तेमाल हुई। और किसी भी install से पहले, hooks, install script, और server config खोलें।
AIDive