AIDive

Video paketi

AI-native SDLC playbook ölçüldü: aşama süreleri, gate bedeli, karar tablosu

12 dk okuma

Özet

  • Playbook'un altı aşamasının her biri commit edilmiş bir çıktıyla biter (intent.md, spec.md, plan.md, PR, olay kaydı). Duyuru yazısı ve 14 derslik kurs yapıyı anlatıyor, ikisi de hiçbir ölçüm yayımlamıyor.
  • Gerçek bir Express + Prisma deposunda uçtan uca çalıştırıldığında, tüm zincir bir hatayı 11 min 31 s ve $3.46 ile düzeltti; doğrudan bir prompt aynı işi 2 min 13 s ve $0.70 ile yaptı: süre ×5.2, maliyet ×4.9, ikisi de yeşil.
  • Asıl bedel okumak: tek satırlık bir sınıf düzeltmesi için 5,488 kelimelik çıktı, dakikada 200 kelimeyle yaklaşık 27 dakika. Zincir yazma süresini okuma süresine çeviriyor.
  • Altı aşamadan üçü bu bağlamda karşılığını verdi: Plan (intent.md), Build (plan mode + CLAUDE.md + TDD), Deploy (REVIEW.md + bir hook). Design ve sürekli evals tek başına çalışan geliştirici için karşılığını vermedi; Maintain çalıştırılmadı.
  • Spec aşaması kendi ön koşulunu işaretledi: kurumsal skills yoktu, bu yüzden marka, güvenlik veya UX politikasına karşı hiç kontrol edilmedi. Playbook bu skills'in zaten yazılmış olduğunu varsayıyor.
  • Deterministik gate çalışıyor: bir PreToolUse hook'u deploy'u 14 s içinde exit 2 ile engelledi. Hook devreye girmeden önce model kendi yargısıyla zaten bir kez reddetmişti.

Ölçümler ne söylüyor

Playbook, değişimi "kod artık darboğaz değil" diye çerçeveliyor ve her aşamanın commit edilmiş bir çıktıyla bitmesini istiyor: intent.md'den spec.md ve plan.md üzerinden PR'a ve olay kaydına, Maintain'de kontrol bantlarıyla s1. Kurs, alıntılanabilir somut rakamları taşıyor: eval seti olarak 20 to 50 gerçek görev, REVIEW.md'de 5 nit sınırı, en fazla 2 to 3 paralel oturum ve iki kez yapılan hatanın CLAUDE.md'ye girmesi kuralı s2. En keskin tarafsız okuma, her çıktıyı kimin yazdığını ve kimin onayladığını tablolaştırıyor ve belgeyi "vendor-claim throughout" ile "no measurement anywhere" diye niteliyor s4.

Düzeltme görevi gerçek bir upstream hatasıydı: yeni bir clone'da npx nx test api çalıştırıldığında kutudan çıktığı gibi 1 suite başarısız oldu (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 geçti, 14 test yeşil, 2.2 s. Doğrudan yol testleri 2 min 13 s, $0.70, 40 turns ile tamamen yeşile getirdi. Zincir yolu, yani intent, sonra spec, sonra plan, sonra build, da yeşile ulaştı: 11 min 31 s, $3.46, 169 turns. Sadece makine tarafında bu ×5.2 süre ve ×4.9 maliyet demek s2.

Zincir asıl insan tarafında acıtıyor. Okunacak 5,488 kelimelik çıktı üretti (intent 558 + spec 2,167 + plan 2,763), dakikada 200 kelimeyle yaklaşık 27 dakika; oysa bu düzeltmenin doğrudan inceleme yükü küçük bir diff s4. Özellik görevi (yazarları sessize alma) tam zincirle 15 min 13 s, $4.11, 158 turns sürdü ve migration'lı bir Prisma Mute modeli, mute ve unmute endpoint'leri, feed filtreleme, 15 dosyada 1,422 satır ekleme, 3 yeni veya genişletilmiş test dosyası ve bir e2e spec ile 50 yeşil test teslim etti. Çıktıları 6,852 kelime tuttu (intent 450 + spec 2,337 + plan 4,065), kabaca 34 dakikalık okuma s2.

Design aşamasına şüpheyle bakan okuma doğrulandı. LinkedIn eleştirisi, playbook'un ön koşullarını gizlediğini söylüyor: marka, güvenlik ve UX için kurumsal skills önceden var olmalı ve brainstorm'u nasıl yürüteceğini bilen biri bulunmalı s7. Agent bunu kendiliğinden doğruladı. spec.md'nin işaretlediği C0 endişesi birebir şöyle: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Kod tabanını yeniden anlatan ve politikayı kontrol edemeyen 2,000'den fazla kelimelik bir spec, tek başına çalışırken atlanacak aşamadır s7.

Altyapı eleştirisi de tuttu. Argüman şu: testler eskimiş fake'lere vurduğunda "the agent sees the tests pass and reports the work finished", çünkü çıktı zinciri neyin kararlaştırıldığını kaydeder, gerçekte neyin çalıştığını değil s8. Denemede döngü yalnızca unit testleri ve build'i doğruladı; review'in kendisi nx e2e'yi "Not run: needs a running server and a seeded DB", prisma migrate status'u ise "Not run: needs a DB" diye listeledi. Yeşil döngü canlı bir sisteme hiç dokunmadı s8.

Deploy aşaması ucuz kazançtı. REVIEW.md 117 s ve $0.80 ile çalıştı: nx test (5/5 suite, 50 passed), nx build (pass), plan taban çizgisine göre lint farkı (34 karşı 33, +1 plan maddesi A3 tarafından açıkça izinli) ve prettier kontrolü (9 dosya başarısız, nit N1 olarak kaydedildi). Karar: 0 Important, 6 nit, 5'i listelendi, 1'i sınır nedeniyle özetlendi. Review, kendi işini onaylamayı "this agent does not approve" diyerek reddetti; kursun yazdığı görev ayrılığı tam olarak bu s2. Hook gate'i belgelerdeki gibi davrandı: merge'den önce deploy istendiğinde agent kendi yargısıyla reddetti ve betiği çalıştırmadı, yani hook hiç tetiklenmedi. Merge'den sonra deploy denemesi PreToolUse hook'u (exit 2) tarafından 14 s içinde gate'in mesajıyla engellendi s19.

Evals yazması ucuz ama yanlış yapması kolaydı. Beş vaka git geçmişinden 283 s ve $1.44 ile çıktı. İki çalıştırma da yanlış tabana karşı koştu, çünkü runner dalı düzeltme merge edildikten sonra açtı; iki agent de bunu fark etti ("the bug was already fixed here") ve geçmiş gibi davranmadı. Bir eval çalıştırması yaklaşık 60 to 70 s tutuyor, dolayısıyla playbook'un kendi önerdiği 20 to 50 vaka, CI çalıştırması başına kabaca 20 to 55 dakika agent süresi demek s2. CLAUDE.md kurulumu commit edilmiş tek sayfa için 63 s ve $0.44 sürdü, en ucuz hamle; salt okunur bir CI log triyajı doğru nedeni 11 s ve $0.13 ile buldu s2.

Topluluk tartışması daha geniş telemetriyi getiriyor: 10,000 geliştirici genelinde, AI kullanımı yüksek ekipler %98 daha fazla PR merge ediyor, ancak review süresi %91, PR boyutu %154 artıyor s6.

Ölçümler

Protokol: zincir headless çalıştı (claude -p, model claude-opus-5-5, izinler acceptEdits artı bir allowlist ile sınırlı, --setting-sources project,local), gothinkster/node-express-realworld-example-app'in geçici bir clone'unda (Express + TypeScript + Prisma + Docker'da Postgres 16, Nx workspace). Her aşama zamanlandı ve exp/metrics.jsonl dosyasına kaydedildi (17 satır). Toplam: $11.90 artı hook yeniden çalıştırması için $0.14, 539 + 3 turns, yaklaşık 41 dakika agent süresi.

Aşama Süre Turns Maliyet
CLAUDE.md kurulumu (ders 5) 63 s 27 $0.44
FIX doğrudan (zincirsiz) 133 s 40 $0.70
FIX intent.md 39 s 8 $0.22
FIX spec.md 162 s 39 $0.83
FIX plan.md 180 s 46 $1.00
FIX build 310 s 76 $1.40
FEAT intent.md 29 s 6 $0.18
FEAT spec.md 118 s 20 $0.62
FEAT plan.md 240 s 41 $1.17
FEAT build (TDD) 526 s 91 $2.14
Review (REVIEW.md) 117 s 19 $0.80
Hook demosu (reddedildi) 20 s 5 $0.14
Hook demosu (engellendi) 14 s 3 $0.14
CI triyajı (salt okunur) 11 s 3 $0.13
Evals: 5 vaka yaz 283 s 76 $1.44
Eval çalıştırması 1 / 2 72 s / 59 s 24 / 18 $0.38 / $0.29
Playbook aşaması Karar Neden
Plan (intent.md) Tut 29 to 39 s, gerçek açık soruları ortaya çıkarır, sessiz mimari seçimlerini bitirir
Design (spec.md) Tek başınaysan atla Kod tabanını yeniden anlatan 2,000'den fazla kelime; değeri var olmayan kurumsal skills'e bağlı (kendi C0 işareti)
Build (plan mode + CLAUDE.md + TDD döngüsü) Tut 50 test yeşil, sapmalar kaydedildi, review plana yaslandı
Test (sürekli evals) Şimdilik atla Playbook'un kendi boyutuyla CI çalıştırması başına 20 to 55 dakika; önce taban commit disiplini bozuldu
Deploy (REVIEW.md + hooks) Tut Gerçek kontrollerle $0.80'lik review ve 14 s'lik deterministik engel
Maintain (kontrol bantları) Kanıtlanmadı haftalarca üretim telemetrisi gerekir; öngörüldü, çalıştırılmadı

Sınırlamalar: tek depo, tek geliştirici, tek gün. Ekip ölçeğindeki hamleler çalıştırılmadı, headless mod görüşme adımlarını tek prompt'a sıkıştırıyor ve eval çalıştırmaları yalnızca çalıştırma başına maliyetle sayılıyor.

Pazartesi yapılacaklar

  • Ana deponuz için bir sayfalık CLAUDE.md yazın: build, test ve lint komutları, agent'ın geçen hafta yaptığı iki hata. Commit edin. Bütçe 63 s agent süresi.
  • Bir sonraki önemsiz olmayan görevden önce önce intent.md isteyin: hedef, hedef dışı olanlar, açık kararlar. Açık soruları yanıtlayın, sonra agent'ın planlamasına izin verin. Karşısında kontrol edeceğiniz kurumsal politika skills'iniz yoksa spec.md'yi atlayın.
  • Build aşamasını plan mode ve TDD döngüsüyle çalıştırın ve planın sapmaları (D1, D2, ...) kaydetmesini isteyin ki review'in yaslanacağı bir şey olsun.
  • Taze bir oturumun yürüttüğü, nit sınırı olan ve açık bir "this agent does not approve" satırı içeren bir REVIEW.md geçişi ekleyin. Testleri, build'i, lint farkını ve formatter kontrolünü çalıştırsın.
  • Tek bir deterministik gate koyun: dal main değilken deploy üzerinde exit 2 ile çıkan bir PreToolUse hook'u.
  • Yeşil bir döngüye güvenmeden önce, review'in altına onun çalıştırmadıklarını yazın (e2e, migrations, canlı DB gerektiren her şey).
  • Kendi gate vergınızı ölçün: aynı küçük hata üzerinde doğrudan yolu ve zincir yolunu zamanlayın, sonra okumak zorunda kaldığınız kelimeleri sayın.

Daha ileri

  • İki gate'li varyant: bir çekişmeli review gate'i (sdlc-gate) ve aşama başına bir yerine yalnızca iki insan karar noktası; küçük ekip için pragmatik biçim s12.
  • Kurulabilir eksiksiz zincir: intent, spec, plan ve REVIEW şablonları, bir gate doğrulayıcı, bir eval runner ve kontrol bandı tespiti; iskeleti elle kurmak istemiyorsanız s5.
  • Önce görüşmeyle planlama: tek seferde bir soru, toplu sorudan iyidir ve "AI agents don't ask clarifying questions. They assume." Zamanlama içermeyen bir kurulum yazısı s11.
  • Tek sabit hattın neden dolanıldığı: "a docs fix and a payments migration shouldn't travel the same path", ve gerçek süreç görünmez olur. Playbook'u Kiro ve GitHub Spec Kit ile aynı gruba koyar s9.
  • Bir platform satıcısının size satacağı boşluklar: sinyalden intent'e alım, etki alanı yönlendirmesi, bir metrik panosu. s13.
  • Aynı yapıyı (CRAFT) Ocak'tan beri müşteri ekiplerinde uygulayan ve "we don't yet have a formal answer for what a control band looks like" diyen bir danışmanlık şirketi s10.
  • Dosyanın işini gösteren tek bir çalışılmış intent.md örneği (bir Select All onay kutusu): agent sessizce seçmesin diye açık kararları ortaya çıkarmak s14.

Kaynaklar

FAQ

Tek satırlık bir düzeltme için tam zincir hiç değer mi?

Bu denemede hayır: aynı yeşil sonuç için ×5.2 süre ve ×4.9 maliyet, üstüne okunacak 5,488 kelime. Küçük görevlerde yalnızca intent.md kullanın.

Tek başına çalışırken spec.md neden atlanır?

Spec kendini işaretledi: marka, güvenlik veya UX için kurumsal skills olmadan politikayı kontrol edemedi ve kod tabanını yeniden anlatmaya 2,000'den fazla kelime harcadı.

Hook modelin yargısının yerini alır mı?

Hayır, ona arka çıkar. Agent merge öncesi deploy'u kendi başına reddetti; hook merge sonrası denemeyi 14 s içinde exit 2 ile engelledi.