TL;DR
- Anthropic ने 235,000 लोगों के 400,000 Claude Code सेशन को ग्रेड किया और पाया कि सत्यापित सफलता दर में सबसे ऊपर सॉफ़्टवेयर इंजीनियर नहीं, मैनेजर रहे।
- कोडिंग आना बहुत कम फ़र्क़ डालता है: सॉफ़्टवेयर पेशे कोड बनाने वाले सेशन में से 34% सत्यापित करते हैं, बाकी सभी पेशे 29%, और आंशिक सफलता में दोनों समूह लगभग बराबर हैं, 89% और 88%।
- नतीजों को अलग करता है यूज़र का स्तर। नौसिखिए को प्रति प्रॉम्प्ट लगभग 5 एजेंट एक्शन और 600 शब्द मिलते हैं, सत्यापित सफलता दर 15% रहती है; विशेषज्ञ को 12 एक्शन और 3,200 शब्द मिलते हैं, दर 28 से 33% रहती है।
- लगभग पूरा फ़ायदा तीन आदतों से आता है: प्रॉम्प्ट में अपना संदर्भ डालें, जाँचे जा सकने वाले प्रमाण पर खत्म करें, और सेशन टूटने पर उसे बंद करने की जगह उसी में बने रहें।
- सबके लिए सीमा नीची है: विशेषज्ञ भी ज़्यादा से ज़्यादा एक तिहाई सेशन सत्यापित कर पाते हैं, और मैनेजरों का शीर्ष स्थान कुछ हद तक माप की गड़बड़ी का नतीजा हो सकता है।
स्रोत क्या कहते हैं
यह अध्ययन अक्टूबर 2025 से अप्रैल 2026 के बीच दर्ज 235,000 लोगों के 400,000 इंटरैक्टिव Claude Code सेशन पर एक क्लासिफ़ायर पास है s1। किसी ने बातचीत नहीं पढ़ी। Sonnet 4.6 पर बने क्लासिफ़ायर ने हर सेशन को ग्रेड किया, और उसके ग्रेड की टेलीमेट्री से जाँच की गई, यानी कमिट, कोड बदलाव और टेस्ट नतीजे; कोड बदलने वाले सेशन में क्लासिफ़ायर और टेलीमेट्री 90% से ज़्यादा बार एकमत हैं s1। Claude Code खुद एक टर्मिनल एजेंट है जो सादी भाषा के अनुरोध पर आपकी फ़ाइलें पढ़ता है, कोड लिखता है और कमांड चलाता है s2।
तीन परिभाषाएँ तय करती हैं कि हर आँकड़ा कैसे पढ़ा जाए। सत्यापित सफलता का मतलब है कि क्लासिफ़ायर को लक्ष्य पूरा होने का ठोस सबूत मिला, जैसे टेस्ट पास होना या यूज़र की स्पष्ट पुष्टि। आंशिक सफलता का मतलब है कि लक्ष्य कम से कम आंशिक रूप से पूरा हुआ। विशेषज्ञता कोई जॉब टाइटल नहीं है: क्लासिफ़ायर यह आँकता है कि यूज़र सेशन के भीतर कैसे व्यवहार करता है, नौसिखिए से विशेषज्ञ तक पाँच स्तरों पर, तीन संकेतों के आधार पर: निर्देश की सटीकता, यूज़र एजेंट से क्या जाँचने को कहता है, और क्या यूज़र एजेंट को सुधारता है s1।
पेशे वाला नतीजा मुख्य खबर है। कोड बनाने वाले सेशन में सॉफ़्टवेयर पेशे 34% सत्यापित सफलता तक पहुँचते हैं और बाकी सब 29% तक, पाँच अंक का यह फ़ासला सात महीनों में स्थिर रहा जबकि दोनों समूह बेहतर हुए s1। आंशिक सफलता में दोनों समूह बराबर हैं, 89% बनाम 88% s1। सबसे बड़े दस पेशा-समूह सभी डेवलपर्स से सात अंक के भीतर रहते हैं, और मैनेजमेंट समूह सबसे ऊपर है s1। जो भविष्यसूचक कारक सच में मायने रखता है, उसे Anthropic डोमेन विशेषज्ञता कहता है: जिस समस्या को आप सुलझा रहे हैं, उसे गहराई से जानना।
काम का बँटवारा इसकी वजह समझाता है। एक सामान्य सेशन में इंसान लगभग 70% प्लानिंग फ़ैसले लेता है, यानी क्या बनाना है, लेकिन सिर्फ़ 20% एक्ज़ीक्यूशन फ़ैसले, यानी उसे कैसे लिखना है s1। जो मैनेजर ठीक-ठीक जानता है कि प्रोडक्ट को क्या करना है, वह मायने रखने वाला आधा हिस्सा संभालता है। यही बदलाव इस बात में भी दिखता है कि लोग एजेंट का इस्तेमाल किसके लिए करते हैं: सात महीनों में डीबगिंग सेशन का हिस्सा 33% से घटकर 19% हुआ, सॉफ़्टवेयर चलाना 14% से बढ़कर 21% हुआ, और डेटा विश्लेषण तथा दस्तावेज़ लेखन लगभग दोगुने हो गए, जबकि एजेंट को सौंपे गए औसत टास्क का अनुमानित मूल्य 27% चढ़ा s1।
ऑटोनॉमी हर वाक्य को भारी बना देती है। एक सामान्य सेशन में यूज़र और एजेंट के बीच सिर्फ़ लगभग चार आदान-प्रदान होते हैं, हर प्रॉम्प्ट औसतन करीब दस एक्शन चलाता है, और कभी-कभी एक ही प्रॉम्प्ट सौ से ज़्यादा एक्शन शुरू कर देता है s1। जब आप सिर्फ़ चार बार बोलते हैं, तो हर पंक्ति की सटीकता ही आपका ज़्यादातर योगदान है।
व्यावहारिक आँकड़े स्तरों की सीढ़ी में हैं। नौसिखिया सामान्य निर्देश लिखता है जिनमें कोई डोमेन ज्ञान नहीं होता; हर प्रॉम्प्ट लगभग 5 एजेंट एक्शन शुरू करता है और करीब 600 शब्द का काम लौटाता है, और सत्यापित सफलता 15% पर रुक जाती है s1। विशेषज्ञ संदर्भ से भरे प्रॉम्प्ट लिखता है; वही एजेंट 12 एक्शन जोड़ता है और हर निर्देश पर 3,200 शब्द बनाता है, और सत्यापित सफलता 28% से 33% के बीच रहती है s1। यानी उसी टूल और उसी सब्सक्रिप्शन पर करीब पाँच गुना काम और दोगुनी सफलता दर, जिसमें कीबोर्ड पर बैठा व्यक्ति ही एकमात्र बदलता कारक है। इस फ़ायदे का लगभग पूरा हिस्सा नौसिखिए और मध्यम स्तर के बीच है, और यही वह कदम है जिसे नीचे की तीन आदतें कवर करती हैं।
ये आदतें क्लासिफ़ायर के तीन संकेतों से मेल खाती हैं। निर्देश की सटीकता: बताइए कहाँ काम करना है, किस चीज़ के साथ, और तैयार नतीजा कैसा दिखता है। सत्यापन: प्रॉम्प्ट को जाँचे जा सकने वाली शर्त पर खत्म कीजिए, टेस्ट चलाओ, रेंडर दिखाओ, पुष्टि करो कि पेज लोड होता है; अध्ययन के अनुसार यही आँकी गई सफलता और सत्यापित सफलता में फ़र्क़ करता है s1। सुधार: नौसिखिए आउटपुट को चुपचाप स्वीकार कर लेते हैं और कुछ टूटते ही बाकी यूज़र्स से चार गुना ज़्यादा बार छोड़ देते हैं, जबकि समस्या को अपने शब्दों में दोबारा समझाना ठीक वही है जो तीसरा संकेत मापता है s1। तीनों में से किसी के लिए कोड की एक पंक्ति नहीं चाहिए।
सीमाएँ अध्ययन में खुद बताई गई हैं। विशेषज्ञ भी 28% से 33% सेशन ही सत्यापित करते हैं, यानी तीन में से दो सेशन इस ठोस सबूत के बिना खत्म होते हैं कि लक्ष्य पूरा हुआ, ज़्यादा से ज़्यादा आंशिक सफलता के साथ, जो 90% से ऊपर है s1। मैनेजरों की रैंकिंग में माप की संभावित गड़बड़ी है: सत्यापित सफलता में यूज़र की स्पष्ट पुष्टियाँ गिनी जाती हैं, और काम स्वीकार होने की साफ़ पुष्टि करना मैनेजर की आदत है s1। और सैंपल सिर्फ़ Claude Code यूज़र्स का है, एक कमांड-लाइन ऑडियंस जो औसत से पहले ही ज़्यादा प्रेरित है, इसलिए किसी दूसरे टूल में यही आँकड़े आने की कोई गारंटी नहीं है s1। शुरुआती सुझावों पर कम्युनिटी थ्रेड दूसरी तरफ़ से एक उपयोगी जाँच है: नए लोगों को दी जाने वाली सलाह तीनों संकेतों से मेल खाती है, संदर्भ दो, जाँच माँगो, दिशा देते रहो s3।
निष्कर्ष: अध्ययन क्या समर्थन करता है
| दावा | स्थिति | आधार |
|---|---|---|
| एजेंट से काम करने वाला कोड पाने के लिए कोडिंग आना ज़रूरी है | छोड़ें | 34% बनाम 29% सत्यापित, 89% बनाम 88% आंशिक, मैनेजर सबसे ऊपर s1 |
| प्रॉम्प्ट में अपना संदर्भ डालना फ़ायदेमंद है | रखें | नौसिखिए और विशेषज्ञ के बीच 5 बनाम 12 एक्शन, प्रति प्रॉम्प्ट 600 बनाम 3,200 शब्द s1 |
| प्रॉम्प्ट को प्रमाण की शर्त पर खत्म करना फ़ायदेमंद है | रखें | सत्यापन क्लासिफ़ायर के तीन संकेतों में से एक है; यह आँकी गई और सत्यापित सफलता को अलग करता है s1 |
| विफलता के बाद सेशन में बने रहना फ़ायदेमंद है | रखें | नौसिखिए चार गुना ज़्यादा छोड़ते हैं; सुधार तीसरा संकेत है s1 |
| विशेषज्ञ स्तर पर पहुँचने से एजेंट भरोसेमंद हो जाता है | छोड़ें | विशेषज्ञ भी सिर्फ़ 28 से 33% सेशन सत्यापित करते हैं s1 |
| मैनेजर इसमें इंजीनियरों से बेहतर हैं | सावधानी से आज़माएँ | संभावित गड़बड़ी: सत्यापित सफलता में यूज़र की स्पष्ट पुष्टियाँ गिनी जाती हैं s1 |
| ये आँकड़े दूसरे AI टूल्स पर भी लागू होते हैं | छोड़ें | सैंपल में सिर्फ़ Claude Code यूज़र्स हैं s1 |
सोमवार को यह करें
- एजेंट को भेजा अपना पिछला प्रॉम्प्ट उठाइए और उसे तीन हिस्सों में दोबारा लिखिए: कहाँ काम करना है, किस चीज़ के साथ (मौजूदा फ़ाइल, रूट, डेटासेट या दस्तावेज़), और तैयार काम कैसा दिखता है।
- इस हफ़्ते हर प्रॉम्प्ट के अंत में एक प्रमाण वाली शर्त जोड़िए: टेस्ट चलाओ, पेज खोलो, जाँचो कि हर लिंक खुलता है, मुझे diff दिखाओ।
- जब कोई सेशन बिगड़े, तो उसे बंद करने से पहले एक सुधार लिखिए: क्या हुआ, आप क्या उम्मीद कर रहे थे, कहाँ देखना है। गिनिए कि अगला टर्न कितनी बार इसे ठीक करता है।
- अपने प्रोजेक्ट के वे तीन तथ्य लिखिए जो सिर्फ़ आप जानते हैं (ऑडियंस, बाधाएँ, वह चीज़ जो बदलनी नहीं चाहिए) और उन्हें अपने अगले सेशन की शुरुआत में चिपकाइए।
- एजेंट के साथ एक बिना-कोड वाला टास्क चलाइए, जैसे न्यूज़लेटर ड्राफ़्ट या प्राइसिंग रीराइट, उन्हीं तीन हिस्सों के साथ, और नतीजे की तुलना अपने सामान्य तरीके से कीजिए।
- पाँच सेशन तक टैली रखिए: सत्यापित, आंशिक, या कुछ नहीं। इसकी तुलना अध्ययन के 15% नौसिखिया और 28 से 33% विशेषज्ञ दायरे से कीजिए।
- अगर आपके प्रॉम्प्ट का कोई हिस्सा इसलिए खाली रहता है कि आपको जवाब नहीं पता, तो सेशन शुरू करने से पहले किसी सहकर्मी या दस्तावेज़ से उसे सुलझाइए, बाद में नहीं।
आगे पढ़ें
- कोई भी आँकड़ा उद्धृत करने से पहले मेथडोलॉजी वाला हिस्सा पढ़ें: क्लासिफ़ायर Sonnet 4.6 है, जिसकी टेलीमेट्री से जाँच की गई है और कोड बदलने वाले सेशन में 90% से ज़्यादा सहमति है s1।
- स्तर के अनुसार प्रति प्रॉम्प्ट एक्शन वाला चार्ट नौसिखिए से विशेषज्ञ तक की छलाँग की सबसे साफ़ तस्वीर है, 5 से 12 एक्शन और 600 से 3,200 शब्द s1।
- टास्क-मिक्स वाला हिस्सा सात महीनों में डीबगिंग को 33% से 19% तक गिरते और सॉफ़्टवेयर चलाने को 14% से 21% तक बढ़ते दिखाता है, जो तब काम का तर्क है जब कोई कहे कि एजेंट सिर्फ़ बग ठीक करने के लिए हैं s1।
- 70% प्लानिंग बनाम 20% एक्ज़ीक्यूशन का बँटवारा वह संख्या है जो इस टीम चर्चा में काम आती है कि एजेंट को कौन चलाए s1।
- मैनेजरों वाला नतीजा किसी स्लाइड में इस्तेमाल करने से पहले सत्यापित सफलता और यूज़र की स्पष्ट पुष्टियों वाला गड़बड़ी नोट दोबारा पढ़ें s1।
- एजेंट टर्मिनल में असल में कैसे काम करता है, क्या पढ़ता, लिखता और चलाता है, यह जानने के लिए प्रोडक्ट पेज से शुरू करें s2।
- शुरुआती सुझावों वाला थ्रेड वह जगह है जहाँ नए लोग प्रॉम्प्ट की ठोस आदतें साझा करते हैं; इसे तीनों संकेतों को ध्यान में रखकर पढ़ें और सलाह को इस आधार पर छाँटें कि वह किस संकेत की सेवा करती है s3।
स्रोत
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. क्यों पढ़ें: इस पैक का हर आँकड़ा यहीं से आता है, और मेथडोलॉजी तथा गड़बड़ी के नोट मुख्य नतीजे को पढ़ने का तरीका बदल देते हैं।
- Claude Code, Anthropic. क्यों पढ़ें: जिस एजेंट को अध्ययन ने मापा, और टर्मिनल सेशन में वह क्या करता है।
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. क्यों पढ़ें: अध्ययन के तीन संकेतों से मिलाने के लिए practitioners की सलाह।
FAQ
क्या अध्ययन कहता है कि गैर-कोडर डेवलपर्स जितने ही अच्छे हैं?
पूरी तरह नहीं। सत्यापित सफलता में डेवलपर्स की पाँच अंक की बढ़त बनी रहती है, 34% बनाम 29%, और यह सात महीनों में स्थिर रही। अध्ययन के अनुसार यह बढ़त छोटी है और सेशन के भीतर यूज़र का स्तर जॉब टाइटल से कहीं ज़्यादा बताता है।
सत्यापित सफलता किसे गिना जाता है?
इस बात का ठोस सबूत कि लक्ष्य पूरा हुआ: पास होते टेस्ट, टेलीमेट्री से पुष्ट किया जा सकने वाला काम करता नतीजा, या यूज़र की स्पष्ट पुष्टि। यही आखिरी बात है जिसकी वजह से मैनेजरों वाले नतीजे में संभावित गड़बड़ी है।
क्या मैं कोडिंग सीखे बिना एक स्तर ऊपर जा सकता हूँ?
हाँ। क्लासिफ़ायर निर्देश की सटीकता आँकता है, आप एजेंट से क्या जाँचने को कहते हैं, और क्या आप उसे सुधारते हैं। तीनों आपकी समस्या और आपके मानक का वर्णन हैं, कोड नहीं।
विशेषज्ञों के लिए भी सीमा इतनी नीची क्यों है?
अध्ययन किसी सेशन को सत्यापित तभी गिनता है जब सबूत हो। विशेषज्ञ 28 से 33% सत्यापित तक पहुँचते हैं, लेकिन आंशिक सफलता 90% से ऊपर है, यानी ज़्यादातर सेशन कुछ न कुछ देते हैं; जो कमी है वह इस बात का सबूत है कि काम पूरा हुआ।
AIDive