TL;DR
- Anthropic, 235,000 kişiden gelen 400,000 Claude Code oturumunu değerlendirdi ve doğrulanmış başarı oranı en yüksek olanların yazılım mühendisleri değil, yöneticiler olduğunu buldu.
- Kod yazmayı bilmek çok az şey kazandırıyor: yazılım meslekleri kod üreten oturumların %34'ünü doğrularken diğer tüm meslekler %29'unu doğruluyor, kısmi başarıda ise iki grup %89 ve %88 ile başa baş.
- Sonucu ayıran şey kullanıcının seviyesi. Yeni başlayanlar istem başına yaklaşık 5 ajan eylemi ve 600 kelime alıyor, doğrulanmış başarı oranı %15; uzmanlar 12 eylem ve 3,200 kelime alıyor, oran %28 ile %33 arasında.
- Kazancın neredeyse tamamını üç alışkanlık taşıyor: istemde kendi bağlamınızı vermek, doğrulanabilir bir kanıtla bitirmek ve bir şey bozulduğunda oturumu kapatmak yerine içinde kalmak.
- Tavan herkes için düşük: uzmanlar bile oturumların en fazla üçte birini doğruluyor ve yöneticilerin zirvedeki yeri kısmen bir ölçüm yapaylığı olabilir.
Kaynaklar ne diyor
Çalışma, Ekim 2025 ile Nisan 2026 arasında kaydedilen, 235,000 kişiye ait 400,000 etkileşimli Claude Code oturumu üzerinde yapılmış bir sınıflandırıcı taramasıdır s1. Konuşmaları kimse okumadı. Sonnet 4.6 üzerine kurulu bir sınıflandırıcı her oturumu değerlendirdi ve notlar telemetriyle, yani commit'ler, kod değişiklikleri ve test sonuçlarıyla çapraz kontrol edildi; kodu değiştiren oturumlarda sınıflandırıcı ile telemetri %90'dan fazla oranda uyuşuyor s1. Claude Code ise dosyalarınızı okuyan, kod yazan ve düz dille yaptığınız bir istekten komut çalıştıran terminal ajanıdır s2.
Üç tanım, her rakamın nasıl okunacağını belirler. Doğrulanmış başarı, sınıflandırıcının hedefe ulaşıldığına dair sağlam kanıt bulması demektir; geçen testler veya kullanıcının açık onayı buna dahildir. Kısmi başarı, hedefe en azından kısmen ulaşıldığı anlamına gelir. Uzmanlık bir unvan değildir: sınıflandırıcı kullanıcının oturum içindeki davranışını, yeni başlayandan uzmana beş seviyede, üç sinyalle puanlar: talimat hassasiyeti, kullanıcının ajandan neyi doğrulamasını istediği ve kullanıcının ajanı düzeltip düzeltmediği s1.
Meslek sonucu ana bulgudur. Kod üreten oturumlarda yazılım meslekleri %34 doğrulanmış başarıya, diğer herkes %29'a ulaşıyor; beş puanlık bu fark, iki grup da gelişirken yedi ay boyunca sabit kaldı s1. Kısmi başarıda iki grup eşit, %89'a karşı %88 s1. En büyük on meslek grubunun tamamı geliştiricilerin yedi puan yakınında kalıyor ve yönetim grubu zirvede yer alıyor s1. Gerçekten önemli olan belirleyiciye Anthropic alan uzmanlığı diyor: çözdüğünüz problemi derinlemesine bilmek.
İş bölümü bunu açıklıyor. Tipik bir oturumda insan planlama kararlarının yaklaşık %70'ini, yani ne inşa edileceğini verir, ama uygulama kararlarının yalnızca %20'sini, yani nasıl yazılacağını verir s1. Ürünün tam olarak ne yapması gerektiğini bilen bir yönetici, işe yarayan yarıyı elinde tutar. Aynı kayma, ajanın ne için kullanıldığında da görülüyor: yedi ay içinde hata ayıklama oturumlarının payı %33'ten %19'a düştü, yazılım çalıştırma %14'ten %21'e çıktı, veri analizi ve belge yazımı neredeyse ikiye katlandı ve ajana verilen ortalama görevin tahmini değeri %27 arttı s1.
Özerklik her cümlenin ağırlığını artırır. Tipik bir oturumda kullanıcı ile ajan arasında yalnızca yaklaşık dört alışveriş olur, her istem ortalama on civarı eylemi tetikler ve tek bir istem bazen yüzden fazla eylemi tetikler s1. Yalnızca dört kez konuştuğunuzda, her satırın hassasiyeti katkınızın büyük kısmıdır.
Pratik rakamlar seviye merdiveninde yatıyor. Yeni başlayan, alan bilgisi içermeyen genel talimatlar yazar; her istem yaklaşık 5 ajan eylemini tetikler ve kabaca 600 kelimelik iş döndürür, doğrulanmış başarı en fazla %15'e çıkar s1. Uzman bağlamla dolu istemler yazar; aynı ajan 12 eylemi zincirler ve talimat başına 3,200 kelime üretir, doğrulanmış başarı %28 ile %33 arasında olur s1. Bu, aynı araçtan ve aynı abonelikten, tek değişken klavyedeki kişi olacak şekilde, yaklaşık beş kat teslim edilen iş ve iki kat başarı oranı demektir. Bu kazancın neredeyse tamamı yeni başlayanla orta seviye arasındaki adımda yatıyor ve aşağıdaki üç alışkanlık tam olarak bu adımı kapsıyor.
Alışkanlıklar sınıflandırıcının üç sinyaliyle eşleşir. Talimat hassasiyeti: nerede, neyle çalışılacağını ve bitmiş sonucun neye benzediğini söyleyin. Doğrulama: istemi kontrol edilebilir bir koşulla bitirin, testleri çalıştır, render'ı göster, sayfanın yüklendiğini doğrula; çalışmaya göre değerlendirilmiş başarıyı doğrulanmış başarıdan ayıran şey budur s1. Düzeltme: yeni başlayanlar çıktıyı pasif biçimde kabul eder ve bir şey bozulur bozulmaz diğer kullanıcılardan dört kat daha sık oturumu bırakır; sorunu kendi sözlerinizle yeniden anlatmak ise üçüncü sinyalin ölçtüğü şeydir s1. Üçü de tek satır kod istemez.
Sınırlar çalışmanın kendisinde belirtiliyor. Uzmanlar bile oturumların %28 ile %33'ünü doğruluyor; yani üç oturumdan ikisi hedefe ulaşıldığına dair sağlam kanıt olmadan biter, en iyi ihtimalle %90'ı aşan kısmi başarıyla s1. Yöneticilerin sıralaması olası bir ölçüm yanlılığı taşıyor: doğrulanmış başarı kullanıcının açık onaylarını sayar ve işin kabul edildiğini net biçimde onaylamak bir yönetici alışkanlığıdır s1. Ayrıca örneklem Claude Code kullanıcılarıdır; ortalamadan daha motive bir komut satırı kitlesidir, dolayısıyla başka bir araçta aynı rakamların çıkacağının garantisi yoktur s1. Yeni başlayanlara yönelik ipuçları üzerine topluluk konusu, öbür yönden yararlı bir kontroldür: insanların yeni gelenlere verdiği tavsiyeler üç sinyalle örtüşüyor, bağlam ver, kontrol iste, yönlendirmeye devam et s3.
Karar: çalışmanın desteklediği şeyler
| İddia | Durum | Dayanak |
|---|---|---|
| Ajandan çalışan kod almak için kod yazmayı bilmeniz gerekir | Skip | %34'e karşı %29 doğrulanmış, %89'a karşı %88 kısmi, yöneticiler zirvede s1 |
| İstemde kendi bağlamınızı vermek karşılığını verir | Keep | Yeni başlayan ile uzman arasında 5'e karşı 12 eylem, istem başına 600'e karşı 3,200 kelime s1 |
| İstemi bir kanıt koşuluyla bitirmek karşılığını verir | Keep | Doğrulama sınıflandırıcının üç sinyalinden biridir; değerlendirilmiş başarıyı doğrulanmış başarıdan ayırır s1 |
| Bir başarısızlıktan sonra oturumda kalmak karşılığını verir | Keep | Yeni başlayanlar dört kat daha sık bırakır; düzeltme üçüncü sinyaldir s1 |
| Uzman seviyesine çıkmak ajanı güvenilir yapar | Skip | Uzmanlar hâlâ oturumların yalnızca %28 ile %33'ünü doğruluyor s1 |
| Yöneticiler bunda mühendislerden daha iyi | Try, dikkatle | Olası yanlılık: doğrulanmış başarı kullanıcının açık onaylarını sayar s1 |
| Bu rakamlar diğer yapay zeka araçlarına aktarılır | Skip | Örneklem yalnızca Claude Code kullanıcılarıdır s1 |
Pazartesi yapılacaklar
- Bir ajana gönderdiğiniz son istemi alın ve üç blokla yeniden yazın: nerede çalışılacak, neyle (mevcut dosya, route, veri seti veya belge) ve bitmiş hâl neye benzeyecek.
- Bu hafta her istemin sonuna bir kanıt cümlesi ekleyin: testleri çalıştır, sayfayı aç, tüm bağlantıların açıldığını kontrol et, diff'i göster.
- Bir oturum kötü gittiğinde, kapatmadan önce tek bir düzeltme yazın: ne oldu, ne bekliyordunuz, nereye bakılmalı. Sonraki turun bunu ne sıklıkla düzelttiğini sayın.
- Projeniz hakkında yalnızca sizin bildiğiniz üç gerçeği (hedef kitle, kısıtlar, değişmemesi gereken şey) yazın ve bir sonraki oturumun en başına yapıştırın.
- Ajana kod olmayan bir görevi, bir bülten taslağını veya bir fiyatlandırma yeniden yazımını, aynı üç blokla verin ve sonucu alışılmış yönteminizle karşılaştırın.
- Beş oturum boyunca bir sayaç tutun: doğrulanmış, kısmi veya hiçbir şey. Çalışmanın bantlarıyla karşılaştırın: yeni başlayanlarda %15, uzmanlarda %28 ile %33.
- İstemizdeki bir blok cevabı bilmediğiniz için boş kalıyorsa, bunu oturumu başlatmadan önce bir meslektaşla veya bir belgeyle çözün, sonra değil.
Daha fazlası
- Herhangi bir rakamı alıntılamadan önce metodoloji bölümünü okuyun: sınıflandırıcı Sonnet 4.6, kodu değiştiren oturumlarda %90'dan fazla uyumla telemetriyle çapraz kontrol edilmiş s1.
- Seviyeye göre istem başına eylem grafiği, yeni başlayandan uzmana sıçramanın en net resmidir: 5'ten 12 eyleme ve 600'den 3,200 kelimeye s1.
- Görev dağılımı bölümü, yedi ayda hata ayıklamanın %33'ten %19'a düştüğünü ve yazılım çalıştırmanın %14'ten %21'e çıktığını gösteriyor; biri ajanların yalnızca hata düzeltmek için olduğunu söylediğinde işe yarar bir argüman s1.
- %70 planlama ve %20 uygulama oranı, bir ajanı kimin yönetmesi gerektiği konusunda ekip tartışmasına götürülecek rakamdır s1.
- Yöneticiler sonucunu bir slaytta kullanmadan önce, doğrulanmış başarı ve kullanıcının açık onayları hakkındaki yanlılık notunu yeniden okuyun s1.
- Ajanın bir terminalde gerçekte nasıl çalıştığını, neyi okuyup yazıp çalıştırdığını görmek için ürün sayfasından başlayın s2.
- Yeni başlayan ipuçları konusu, yeni gelenlerin somut istem alışkanlıklarını paylaştığı yerdir; üç sinyali aklınızda tutarak okuyun ve tavsiyeleri hangi sinyale hizmet ettiğine göre ayırın s3.
Kaynaklar
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. Neden okunmalı: bu paketteki her rakam buradan geliyor ve metodoloji ile yanlılık notları ana bulgunun nasıl okunacağını değiştiriyor.
- Claude Code, Anthropic. Neden okunmalı: çalışmanın ölçtüğü ajan ve bir terminal oturumunda neler yaptığı.
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. Neden okunmalı: çalışmanın üç sinyaliyle karşılaştırılacak uygulayıcı tavsiyeleri.
FAQ
Çalışma, kod yazmayanların geliştiriciler kadar iyi olduğunu mu söylüyor?
Tam olarak değil. Geliştiriciler doğrulanmış başarıda beş puanlık bir üstünlüğü koruyor, %34'e karşı %29, ve bu yedi ay boyunca sabit kaldı. Çalışma, farkın küçük olduğunu ve oturum içindeki kullanıcı seviyesinin iş unvanından çok daha fazlasını öngördüğünü söylüyor.
Doğrulanmış başarı ne sayılır?
Hedefe ulaşıldığına dair sağlam kanıt: geçen testler, sınıflandırıcının telemetriden doğrulayabildiği çalışan bir sonuç veya kullanıcının açık onayı. Yöneticiler sonucunun olası bir yanlılık taşımasının nedeni bu son kalemdir.
Kod yazmayı öğrenmeden bir seviye yukarı çıkabilir miyim?
Evet. Sınıflandırıcı talimat hassasiyetini, ajandan neyi doğrulamasını istediğinizi ve onu düzeltip düzeltmediğinizi puanlar. Üçü de koda değil, sizin probleminizin ve standardınızın tarifidir.
Uzmanlar için bile tavan neden bu kadar düşük?
Çalışma bir oturumu yalnızca kanıt varsa doğrulanmış sayar. Uzmanlar %28 ile %33 doğrulanmışa ulaşıyor, ama kısmi başarı %90'ı aşıyor; yani oturumların çoğu bir şey teslim ediyor, eksik olan işin bittiğine dair kanıt.
AIDive