Kimsenin ölçmediği playbook
Anthropic, Claude Code için yapay zeka odaklı bir SDLC playbook'u yayımladı: altı aşama, her biri commit'lenmiş bir dosyayla bitiyor ve ücretsiz bir kurs olarak öğretiliyor. Temel iddiası şu: darboğaz artık kod değil, onu yöneten şey commit'lenmiş artifact zinciri. Belgenin kendisinde hiçbir ölçüm yok: ne süre, ne maliyet, ne benchmark. Biz de gerçek bir repoda ilk zamanlı testi yaptık: on altı zamanlı Claude Code oturumu, fiyatı çıkarılmış her gate ve zinciri ortadan ikiye bölen bir sonuç. Yol boyunca iki dakikalık bir hatanın tam zincirden geçirilmesi bu törenin faturasını çıkardı, kendi deploy'umuz da iki kez durduruldu, bir seferinde dört satırlık bir shell betiğiyle.
Playbook ve test düzeneği
Test düzeneği: on altı zamanlı Claude Code oturumu, yaklaşık 12 $'lık işlem gücü, tek bir gerçek repo. Playbook altı aşamadan oluşuyor: plan, design, build, test, deploy, maintain. Her aşama commit'lenmiş bir dosyayla bitiyor ve sonraki aşama o dosyayı okuyor: intent, spec, plan, pull request, olay kaydı. Commit'ler denetim izini oluşturuyor. Anthropic bunu ücretsiz, 14 derslik, yaklaşık bir saatlik bir kurs olarak öğretiyor ve kurs, review gate'leri olan şirketler için yazılmış; biz tek bir geliştiriciyle temasta nelerin ayakta kaldığını test ettik.
Repo, RealWorld demo uygulaması (Express, TypeScript, Prisma, Postgres): gerçek testleri olan gerçek bir proje ve temiz bir clone'da bozuk olan bir test paketi (dört geçen paket, 14 yeşil test, çalışması iki saniye). Bu hata daha sonra kontrol grubumuz olacak. Puanlama kuralı: bir gate, çıktısı gönderilen şeyi değiştiriyorsa ve maliyetinden ucuzsa karşılığını verir.
Giriş bileti, repo kökündeki bir bellek dosyası: komutlar, kurallar, mimari, modelin tekrar tekrar yaptığı hatalar; bir sayfanın altında tutuluyor. Bizimki 63 saniyede, 0,44 $'a yazıldı ve commit'lendi. Yöntem hakkında dürüst bir not: headless çalıştırmalar playbook'un görüşmelerini tek prompt'lara sıkıştırıyor.
Plan: yirmi dokuz saniyede intent.md
İlk gate, kimse bir şey tasarlamadan önce fikri yakalıyor. Özellik talebi: okurlar, akışlarını dolduran yazarları sessize almak istiyor. Playbook sonucu bir proto-spec olarak adlandırıyor: model ile birlikte yazılır, sahibi sizsiniz; üç kaynağa izin veriyor: bir fikir, açılmış bir ticket ya da bir olay alarmı. Şablonun beş bölümü var ve düşünme işini başlıkları yapıyor: problem, önerilen sonuç, etkilenen kullanıcılar ve sistemler, kısıtlar, açık sorular. Çalışma döngüsü beş hamle: anlat, beyin fırtınası yap, şablondan üret, düzelt, commit'le.
| intent.md | süre | maliyet |
|---|---|---|
| Yazar sessize alma özelliği | 29 s | 0,18 $ |
| Bozuk test paketi | 39 s | — |
Değer en altta, açık sorularda yatıyor: sessize alınan bir yazarın favorilerine ne olur? Sayfaları erişilebilir kalır mı? Bunlar, bir kodlama agent'ının aksi halde sessizce vereceği kararlar; şimdi yazıya dökülmüş ve tarihlenmiş durumda. Dosya commit'lendiği için yazarlık ve zaman damgası sohbetten sonra da kalıyor, ürün sahibi de taslağı kabul etmeden önce düzeltiyor. Anthropic'in bu aşama için kendi hedefi haftalar değil saatler içinde görüş toplamak; tek başına çalışınca bu bir dakikanın altında.
Design: spec kendi ön koşulunu işaretliyor
İkinci gate, kurstaki tek bir prompt'la intent'i bir spec'e dönüştürüyor: intent'i oku, gereksinim ve tasarım spec'i üret, mevcut skill'leri uygula; bu skill'lerin markanızı, güvenlik ve UX politikanızı taşıması bekleniyor. İki dakika sonra yaklaşık 2.300 kelimelik yetkin bir spec'imiz vardı: endpoint'ler, veri modeli, akış davranışı, uç durumlar. Prompt'un istediği gibi, karşılayamadığı şeyleri de kaydetmişti.
Sürpriz, modelin kendi yazdığı işaretli endişelerinde: "C0. Hiçbir org skill'i yok. Bu spec hiçbir politikaya karşı kontrol edilmedi." Aşamanın tüm öncülü, çoğu kurulumda var olmayan dosyaları varsayıyordu; anlatım videoları bu ön koşulu atlıyor, agent ise yazıya döktü. İkinci işaret daha sakindi: açık soruların varsayılanları build'den önce ürün onayı gerektiriyor.
Ders, eşleştirme konusunda katı (spec ve intent birlikte commit'lenir, build'e geçişi bir insan onaylar) ve bir okuma faturası da var: spec başına yaklaşık 12 dakika ürün sahibi zamanı. Playbook yeniden işi bile takip ediyor: build başladıktan sonra tarihlenen spec commit'leri aleyhinize sayılıyor. Politikalarını kodlamış bir ekipte bu gate, o politikaların çalıştığı yer. Tek başınıza ise, kurulumun henüz tutamayacağı bir söz için ödeme yapıyorsunuz.
Build: plan mode, TDD ve döngünün gerçekte neyi kontrol ettiği
Üçüncü gate Plan Mode ve çıta acımasız ama yararlı: konuşmayı hiç görmemiş bir mühendis yalnızca plana bakarak uygulayabilmeli. Plan Mode okuma yarısını kendisi zorluyor: plan kabul edilene kadar model dosyaları düzenleyemiyor. Bizimki dört dakikada yaklaşık 4.000 kelime çıktı; değişecek dosyaları, işlerin sırasını, riskleri ve kanıtı adlandırıyor, ayrıca spec'ten üç etiketli sapmayı kaydediyor ve bunlar review'da geri dönüyor.
Build bir döngüde çalışıyor: başarısız testi yaz, geçir, tek hedef, hepsi yeşil ya da görev bitmiş değil. Döngü korunuyor (kodu düzelten bir agent, o koda ait kontrolü zayıflatmamalı) ve bir verifier ile eşleştirilmiş: taze bir bağlamda ikinci bir kontrol, kodu yazan oturumdan etkilenmeyen.
| Build sonucu | değer |
|---|---|
| Agent süresi | ~9 dk, 91 tur |
| Maliyet | ~2 $ |
| Değişiklik | 15 dosya, Mutes tablosu, iki endpoint, iki akış da filtrelendi |
| Testler | 5 paket, 50 test, bağımsız yeniden çalıştırmada hepsi yeşil |
| İlk geçişte merge | evet |
Yıldız işareti şu: yeşil yalnızca döngünün içerdiğini kanıtlar, fazlasını değil. Uçtan uca test hiç çalıştırılmadı; canlı bir sunucu ve veri yüklenmiş bir veritabanı gerektiriyor ve eski sahtelere yönelmiş bir döngü de aynı derecede yeşil yanardı. Ekip ölçeği, worktree'lerde paralel oturumlar ekliyor (belirtilen üst sınır iki ya da üç); bunu test etmedik.
Deploy: review ve hayır diyen gate
Deploy gate'inin iki katmanı var ve ikisi de bize hayır dedi. Birinci katman, repo kökündeki yazılı bir politika altında diff'i okuyor: üç geçiş (hatalar, güvenlik, spec ve plana göre uyumluluk), "Important" yalnızca bozuk davranış, sızan veri ya da ihlal edilen politika için ayrılmış, en fazla beş nit, gerisi sayı olarak özetleniyor; politika kendi gürültüsüne tavan koyuyor. İki dakikalık review, 0,80 $ ve gerçek kontrolleri çalıştırdı: testler, build, planın kaydettiği baseline'a karşı lint, dokuz dosyada biçimlendirme. Sonuç: sıfır Important bulgu, altı nit, tavanı aşan biri özetlendi. Prompt vermediğimiz bir cümleyle bitirdi: bu agent onaylamaz; onay, branch protection arkasındaki bir insan kod sahibinde kalır.
İkinci katman gate'in kendisi. Deploy istedik; model, özellik yayın dalında olmadığı için kendiliğinden reddetti. Bu yargı, zorlama değil. Biz de merge edip yeniden sorduk: dört satırlık shell 14 saniyede yanıt verdi: engellendi, yayın yetkisi gerekli. Exit code 2 araç çağrısını durduruyor ve sebep modele geri dönüyor. Pipeline tarafı da aynı muameleyi gördü: bozuk bir build headless olarak 11 saniyede, 0,13 $'a triyaj edildi; logu okudu, kesin nedeni adlandırdı ve hiçbir dosyaya dokunmadan diff önerdi. Deterministik olan kibar olanı yener; bir hook yalnızca deseni kadar iyidir ve bizimki tek bir betikle eşleşti.
Gate vergisi
Aynı hata, aynı bozuk başlangıç, iki yol: kontrol deneyi. Birinci yol: doğrudan düzelt. İkinci yol: intent'ten build'e tam zincir.
| doğrudan düzeltme | tam zincir | çarpan | |
|---|---|---|---|
| Toplam süre | 2:13 | 11:31 | ×5.2 |
| Maliyet | 0,70 $ | 3,46 $ | ×4.9 |
| Tur | 40 | 169 | — |
| Sonuç | paket yeşil | paket yeşil | aynı |
Makine faturası küçük yarısı. Zincir, tek satırlık bir düzeltme için yaklaşık 5.500 kelimelik artifact yazdı; tek bakışta tarayabileceğiniz bir diff için kabaca 27 dakikalık insan okuması. Zincir yazma süresini okuma süresine çeviriyor; gate vergisi bu.
Playbook buna yinelenen bir ücret ekliyor: sürekli eval'ler. Yirmi ila elli gerçek görev, her yapılandırma değişikliğinde yeniden çalıştırılıyor; her vaka gerçek bir geçmiş görev, prompt olduğu gibi, değişiklikten önceki commit'ten çalıştırılıyor ve kontrol edilebilir kabul ölçütü var. Geçmişten beş vaka yazmak beş dakika sürdü; bunları doğru çalıştırmak o kadar kolay değil: ilk harness'imiz iki vakayı yanlış commit'e yöneltti ve iki agent da sahte bir geçiş üretmek yerine bunu yakaladı. Vaka başına yaklaşık bir dakikayla, tam bir paket çalıştırma başına bir saate kadar agent süresine mal oluyor ve her üretim olayının kalıcı bir regresyon eval'i olarak pakete katılması bekleniyor. Regüle edilen bir ekipte o okuma teslim edilen şeyin kendisi; tek başınıza ise ek yük.
Karar: altı gate'ten üçü karşılığını veriyor
Altı gate'ten üçü kendini amorti ediyor:
| Aşama | karar | kanıt |
|---|---|---|
| Plan | tut | 40 s, kimsenin sormadığı soruları satın alıyor |
| Build | tut | plan mode + test döngüsü 50 yeşil test teslim etti |
| Deploy | tut | gerçek kontrollü 0,80 $'lık review, 14 s'lik deterministik engel |
| Design | tek başına atla | kodlamadığınız politikaların faturasını size kesiyor |
| Test (sürekli eval'ler) | bekleyebilir | çalıştırma başına bir saate kadar, yanlış hedeflemesi kolay |
| Maintain | kanıtsız | haftalarca üretim telemetrisi gerektiriyor |
Maintain kağıt üzerinde zarif: deterministik betikler kontrol bantlarını izliyor ve bir ihlal yeni bir intent dosyası yazıyor; ancak bunu kanıtlamak elimizde olmayan üretim telemetrisi gerektiriyor. Anthropic'in kendi belgesi, bir analistin dediği gibi, hiçbir yerde ölçüm içermiyor; bunlar ilk sayılar ve bariz sınırları var: tek repo, tek geliştirici, tek gün.
Dış veriler baskının gerçek olduğunu söylüyor. Faros, 1.200'den fazla ekipte 10.000'den fazla geliştiriciyi izledi: yüksek benimseme oranına sahip ekipler %98 daha fazla pull request merge ediyor, review süresi %91 artıyor ve ortalama pull request boyutu iki katından fazlaya çıkıyor. En son DORA raporu da aynı tonda: yapay zekayla verim artıyor, kararlılık düşüyor. Review darboğaz haline geliyor ve playbook tam olarak oraya nişan alıyor. Topluluk varyantları zinciri şimdiden iki insan kararına indirdi: biri şablonlar ve bir gate defteri sunuyor, diğeri insanları yalnızca design ve test aşamasında tutuyor. Karşılığını veren üç gate'i benimseyin, gerisine ekibiniz büyüdükçe geçin. Anthropic'in kendi kapanış cümlesi doğru mezar taşı: döngü çalışmaya devam ediyor, insan yargısı onun üstünde kalıyor.
AIDive