TL;DR
- Enam tahap playbook ini masing-masing berakhir pada artefak yang di-commit (intent.md, spec.md, plan.md, PR, catatan insiden). Postingan peluncuran dan kursus 14 pelajaran menjelaskan bentuknya, tetapi tidak ada yang menerbitkan pengukuran.
- Dijalankan dari awal sampai akhir pada repo Express + Prisma yang nyata, rantai penuh memperbaiki satu bug dalam 11 min 31 s dengan biaya $3.46, sedangkan prompt langsung butuh 2 min 13 s dan $0.70: ×5.2 waktu, ×4.9 biaya, keduanya hijau.
- Pajak sebenarnya adalah membaca: 5,488 kata artefak untuk perbaikan kelas satu baris, sekitar 27 min pada 200 wpm. Rantai ini mengubah waktu menulis menjadi waktu membaca.
- Tiga dari enam tahap terbayar dalam konteks ini: Plan (intent.md), Build (plan mode + CLAUDE.md + TDD), Deploy (REVIEW.md + sebuah hook). Design dan eval berkelanjutan tidak untuk dev solo; Maintain tidak dijalankan.
- Tahap spec menandai sendiri prasyaratnya: tidak ada skill org, jadi spec tidak pernah diperiksa terhadap kebijakan brand, keamanan, atau UX. Playbook mengasumsikan skill itu sudah ditulis.
- Gate deterministik bekerja: hook PreToolUse memblokir deploy dalam 14 s dengan exit 2. Model sudah menolak sekali atas penilaiannya sendiri sebelum hook sempat berjalan.
Apa kata pengukurannya
Playbook membingkai perubahan ini sebagai "code is no longer the bottleneck" dan meminta setiap tahap berakhir pada artefak yang di-commit, dari intent.md lewat spec.md dan plan.md sampai PR dan catatan insiden, dengan control band di Maintain s1. Kursusnya memuat detail yang layak dikutip: 20 sampai 50 tugas nyata sebagai suite eval, batas 5 nit di REVIEW.md, paling banyak 2 sampai 3 sesi paralel, dan aturan bahwa kesalahan yang terjadi dua kali masuk ke CLAUDE.md s2. Pembacaan netral yang paling tajam memetakan siapa yang menyusun dan siapa yang menyetujui tiap artefak, dan menyebut dokumen ini "vendor-claim throughout" dengan "no measurement anywhere" s4.
Tugas perbaikannya adalah bug upstream yang nyata: clone baru yang menjalankan npx nx test api langsung gagal di 1 suite (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 lolos, 14 tes hijau, 2.2 s. Jalur langsung mencapai tes hijau penuh dalam 2 min 13 s, $0.70, 40 turn. Jalur rantai, intent lalu spec lalu plan lalu build, juga mencapai hijau dalam 11 min 31 s, $3.46, 169 turn. Itu ×5.2 waktu dan ×4.9 biaya, hanya dari sisi mesin s2.
Sisi manusia adalah tempat rantai ini menyakitkan. Rantai menghasilkan 5,488 kata artefak untuk dibaca (intent 558 + spec 2,167 + plan 2,763), sekitar 27 min pada 200 wpm, untuk perbaikan yang beban review langsungnya hanyalah satu diff kecil s4. Tugas fitur (membisukan penulis) lewat rantai penuh memakan 15 min 13 s, $4.11, 158 turn dan menghasilkan model Prisma Mute dengan migrasi, endpoint mute dan unmute, penyaringan feed, 1,422 baris tambahan di 15 file, 50 tes hijau dengan 3 file tes baru atau diperluas dan satu spec e2e. Artefaknya seberat 6,852 kata (intent 450 + spec 2,337 + plan 4,065), sekitar 34 min membaca s2.
Pembacaan skeptis atas tahap Design terbukti benar. Kritik di LinkedIn menyebut playbook menyembunyikan prasyaratnya: skill org untuk brand, keamanan, dan UX harus sudah ada, dan seseorang harus tahu cara menjalankan brainstorm s7. Agen mengonfirmasinya tanpa diminta. Concern C0 yang ditandai di spec.md berbunyi, kata demi kata: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Spec dengan lebih dari 2,000 kata yang merangkum ulang codebase dan tidak bisa memeriksa kebijakan adalah tahap yang dilewati saat bekerja sendiri s7.
Kritik soal infrastruktur juga terbukti. Argumennya: saat tes mengenai fake yang basi, "the agent sees the tests pass and reports the work finished", karena rantai artefak mencatat apa yang diputuskan, bukan apa yang benar-benar berjalan s8. Dalam percobaan ini, loop hanya memverifikasi unit test dan build; review sendiri mendaftar nx e2e sebagai "Not run: needs a running server and a seeded DB" dan prisma migrate status sebagai "Not run: needs a DB". Loop hijau itu tidak pernah menyentuh sistem live s8.
Tahap Deploy adalah kemenangan murah. REVIEW.md berjalan 117 s dengan biaya $0.80: nx test (5/5 suite, 50 lolos), nx build (lolos), delta lint terhadap baseline plan (34 vs 33, +1 yang diizinkan eksplisit oleh butir plan A3), dan pemeriksaan prettier (9 file gagal, dicatat sebagai nit N1). Putusan: 0 Important, 6 nit, 5 didaftar dan 1 diringkas karena batas berlaku. Review menolak menyetujui pekerjaannya sendiri dengan "this agent does not approve", pemisahan tugas seperti yang ditulis kursus s2. Gate hook berperilaku seperti di dokumentasi: diminta deploy sebelum merge, agen menolak atas penilaiannya sendiri tanpa menjalankan skrip, jadi hook tidak pernah aktif. Setelah merge, upaya deploy diblokir hook PreToolUse (exit 2) dalam 14 s dengan pesan dari gate s19.
Eval murah ditulis tetapi mudah salah. Lima kasus dihasilkan dari riwayat git dalam 283 s dengan biaya $1.44. Kedua run berjalan pada base yang salah, karena runner bercabang setelah perbaikan di-merge, dan kedua agen mendeteksinya ("the bug was already fixed here") alih-alih memalsukan kelulusan. Satu run eval memakan sekitar 60 sampai 70 s, jadi ukuran 20 sampai 50 kasus dari playbook sendiri berarti kira-kira 20 sampai 55 min waktu agen per run CI s2. Setup CLAUDE.md memakan 63 s dan $0.44 untuk satu halaman yang di-commit, langkah termurah dari semuanya; triase log CI read only menyebut penyebab yang benar dalam 11 s dengan biaya $0.13 s2.
Thread komunitas membawa telemetri yang lebih luas: dari 10,000 developer, tim dengan adopsi AI tinggi me-merge 98% lebih banyak PR sementara waktu review naik 91% dan ukuran PR naik 154% s6.
Pengukuran
Protokol: rantai dijalankan headless (claude -p, model claude-opus-5-5, izin dibatasi acceptEdits plus allowlist, --setting-sources project,local) pada clone scratch dari gothinkster/node-express-realworld-example-app (Express + TypeScript + Prisma + Postgres 16 di Docker, workspace Nx). Setiap tahap diukur waktunya dan dicatat di exp/metrics.jsonl (17 baris). Total: $11.90 + $0.14 untuk ulang hook, 539 + 3 turn, sekitar 41 min waktu jalan agen.
| Tahap | Waktu | Turn | Biaya |
|---|---|---|---|
| CLAUDE.md setup (lesson 5) | 63 s | 27 | $0.44 |
| FIX direct (no chain) | 133 s | 40 | $0.70 |
| FIX intent.md | 39 s | 8 | $0.22 |
| FIX spec.md | 162 s | 39 | $0.83 |
| FIX plan.md | 180 s | 46 | $1.00 |
| FIX build | 310 s | 76 | $1.40 |
| FEAT intent.md | 29 s | 6 | $0.18 |
| FEAT spec.md | 118 s | 20 | $0.62 |
| FEAT plan.md | 240 s | 41 | $1.17 |
| FEAT build (TDD) | 526 s | 91 | $2.14 |
| Review (REVIEW.md) | 117 s | 19 | $0.80 |
| Hook demo (refused) | 20 s | 5 | $0.14 |
| Hook demo (blocked) | 14 s | 3 | $0.14 |
| CI triage (read only) | 11 s | 3 | $0.13 |
| Evals: write 5 cases | 283 s | 76 | $1.44 |
| Eval run 1 / run 2 | 72 s / 59 s | 24 / 18 | $0.38 / $0.29 |
| Tahap playbook | Putusan | Alasan |
|---|---|---|
| Plan (intent.md) | Pertahankan | 29 sampai 39 s, memunculkan pertanyaan terbuka yang nyata, menghentikan pilihan arsitektur diam-diam |
| Design (spec.md) | Lewati saat solo | Lebih dari 2,000 kata yang merangkum ulang codebase; nilainya mengandaikan skill org yang tidak ada (flag C0 miliknya sendiri) |
| Build (plan mode + CLAUDE.md + loop TDD) | Pertahankan | 50 tes hijau, deviasi tercatat, review bersandar pada plan |
| Test (eval berkelanjutan) | Lewati dulu | 20 sampai 55 min per run CI pada ukuran playbook sendiri; disiplin base commit gagal lebih dulu |
| Deploy (REVIEW.md + hook) | Pertahankan | Review $0.80 dengan pemeriksaan nyata plus blokir deterministik 14 s |
| Maintain (control band) | Belum terbukti | butuh berminggu-minggu telemetri produksi; diproyeksikan, tidak dijalankan |
Catatan: satu repo, satu developer, satu hari. Langkah skala tim tidak dijalankan, mode headless memadatkan langkah wawancara menjadi satu prompt, dan run eval hanya dihitung biaya per run.
Lakukan ini hari Senin
- Tulis satu halaman CLAUDE.md untuk repo utamamu: perintah build, test, dan lint, serta dua kesalahan yang dibuat agen minggu lalu. Commit. Anggarkan 63 s waktu agen.
- Sebelum tugas non-trivial berikutnya, minta intent.md dulu: tujuan, non-tujuan, keputusan terbuka. Jawab pertanyaan terbukanya, baru biarkan agen merencanakan. Lewati spec.md kecuali kamu punya skill kebijakan org untuk memeriksanya.
- Jalankan tahap build dalam plan mode dengan loop TDD dan wajibkan plan mencatat deviasi (D1, D2, ...) agar review punya sandaran.
- Tambahkan putaran REVIEW.md oleh sesi baru dengan batas nit dan baris eksplisit "this agent does not approve". Suruh menjalankan tes, build, delta lint, dan pemeriksaan formatter.
- Pasang satu gate deterministik: hook PreToolUse yang exit 2 pada
deploybila branch bukan main. - Sebelum memercayai loop hijau, daftar apa yang tidak dijalankannya (e2e, migrasi, apa pun yang butuh DB live) di bagian bawah review.
- Ukur pajak gate-mu sendiri: catat waktu jalur langsung dan jalur rantai pada bug kecil yang sama, lalu hitung kata yang harus kamu baca.
Lanjutkan lebih jauh
- Varian dua gate: gate review adversarial (sdlc-gate) dan hanya dua titik keputusan manusia, bukan satu per tahap, bentuk pragmatis untuk tim kecil s12.
- Rantai lengkap yang bisa dipasang: template intent, spec, plan, dan REVIEW, validator gate, runner eval, dan deteksi control band, kalau kamu tidak mau membangun kerangkanya sendiri s5.
- Perencanaan dengan wawancara lebih dulu: satu pertanyaan sekali jalan lebih baik daripada batch, dan "AI agents don't ask clarifying questions. They assume." Tulisan setup tanpa pengukuran waktu s11.
- Mengapa satu pipeline tetap dihindari: "a docs fix and a payments migration shouldn't travel the same path", dan proses yang sebenarnya jadi tak terlihat. Mengelompokkan playbook bersama Kiro dan GitHub Spec Kit s9.
- Celah yang akan dijual vendor platform kepadamu: intake dari sinyal ke intent, routing blast radius, dasbor metrik. s13.
- Sebuah konsultan yang menjalankan bentuk yang sama (CRAFT) di tim klien sejak Januari dan mengakui "we don't yet have a formal answer for what a control band looks like" s10.
- Satu contoh intent.md (checkbox Select All) yang menunjukkan tugas file ini: memunculkan keputusan terbuka alih-alih membiarkan agen memilih diam-diam s14.
Sumber
- The AI-Native SDLC Playbook (launch post), claude.com. Kenapa dibaca: bentuk enam tahap dan aturan artefak yang di-commit dalam lima menit.
- The AI-native SDLC playbook (course, 14 lessons), Claude Academy. Kenapa dibaca: satu-satunya tempat angka-angkanya ada (20 sampai 50 tugas eval, batas 5 nit, 2 sampai 3 sesi), gratis dan tanpa login.
- The Committed-Artifact Chain, howardism.dev. Kenapa dibaca: siapa yang menyusun dan siapa yang menyetujui tiap artefak, dan penegasan blak-blakan bahwa tidak ada yang diukur di playbook.
- bashebr/ai-native-sdlc, GitHub. Kenapa dibaca: template, validator gate, dan runner eval yang bisa dipasang alih-alih ditulis sendiri.
- Anthropic published an AI-native SDLC playbook, r/ClaudeAI. Kenapa dibaca: thread yang membawa telemetri Faros (98% lebih banyak PR, +91% waktu review) ke dalam perdebatan.
- The AI-native SDLC Playbook is basically "do everything you did before, but inside Claude", LinkedIn. Kenapa dibaca: argumen prasyarat tersembunyi yang dikonfirmasi sendiri oleh tahap spec.
- The AI-Native SDLC Starts With Your Infrastructure, MetalBear blog. Kenapa dibaca: masalah fake basi, disuarakan vendor, tetapi argumennya berdiri sendiri.
- The AI-native SDLC won't be one process, worldprogramming.org. Kenapa dibaca: argumen seremoni melawan satu jalur untuk setiap perubahan.
- Anthropic Wrote the AI-Native SDLC Playbook in August. We Wrote Ours in January., Substack. Kenapa dibaca: tim independen yang sampai pada bentuk yang sama dan mengakui lubang di Maintain.
- AI-Native SDLC: First Try, kyle.pericak.com. Kenapa dibaca: satu-satunya run pertama dengan wawancara lebih dulu secara langsung, ditulis sebelum playbook ada.
- TsCarpe/claude-sdlc-skills, GitHub. Kenapa dibaca: varian dua gate dengan langkah review adversarial.
- Implementing the Anthropic AI-Native SDLC Playbook, Port blog. Kenapa dibaca: daftar hal yang ditinggalkan playbook, dibaca sebagai peta celah.
- What Is intent.md in Claude Code?, dev.to. Kenapa dibaca: satu intent.md konkret yang strukturnya bisa kamu tiru.
- Hooks guide, Claude Code docs. Kenapa dibaca: bagaimana hook PreToolUse dengan exit 2 menjadi gate deterministik yang diandalkan playbook.
FAQ
Apakah rantai penuh pernah sepadan untuk perbaikan satu baris?
Tidak dalam percobaan ini: ×5.2 waktu dan ×4.9 biaya untuk hasil hijau yang sama, plus 5,488 kata untuk dibaca. Pakai intent.md saja untuk tugas kecil.
Kenapa melewati spec.md saat bekerja solo?
Spec menandai dirinya sendiri: tanpa skill org untuk brand, keamanan, atau UX ia tidak bisa memeriksa kebijakan, dan ia menghabiskan lebih dari 2,000 kata untuk merangkum ulang codebase.
Apakah hook menggantikan penilaian model?
Tidak, hook menopangnya. Agen menolak deploy sebelum merge atas inisiatifnya sendiri; hook memblokir upaya setelah merge dalam 14 s dengan exit 2.
AIDive