AIDive

Paket video

Playbook SDLC AI-native, terukur: waktu tiap tahap, pajak gate, tabel putusan

12 menit baca

TL;DR

  • Enam tahap playbook ini masing-masing berakhir pada artefak yang di-commit (intent.md, spec.md, plan.md, PR, catatan insiden). Postingan peluncuran dan kursus 14 pelajaran menjelaskan bentuknya, tetapi tidak ada yang menerbitkan pengukuran.
  • Dijalankan dari awal sampai akhir pada repo Express + Prisma yang nyata, rantai penuh memperbaiki satu bug dalam 11 min 31 s dengan biaya $3.46, sedangkan prompt langsung butuh 2 min 13 s dan $0.70: ×5.2 waktu, ×4.9 biaya, keduanya hijau.
  • Pajak sebenarnya adalah membaca: 5,488 kata artefak untuk perbaikan kelas satu baris, sekitar 27 min pada 200 wpm. Rantai ini mengubah waktu menulis menjadi waktu membaca.
  • Tiga dari enam tahap terbayar dalam konteks ini: Plan (intent.md), Build (plan mode + CLAUDE.md + TDD), Deploy (REVIEW.md + sebuah hook). Design dan eval berkelanjutan tidak untuk dev solo; Maintain tidak dijalankan.
  • Tahap spec menandai sendiri prasyaratnya: tidak ada skill org, jadi spec tidak pernah diperiksa terhadap kebijakan brand, keamanan, atau UX. Playbook mengasumsikan skill itu sudah ditulis.
  • Gate deterministik bekerja: hook PreToolUse memblokir deploy dalam 14 s dengan exit 2. Model sudah menolak sekali atas penilaiannya sendiri sebelum hook sempat berjalan.

Apa kata pengukurannya

Playbook membingkai perubahan ini sebagai "code is no longer the bottleneck" dan meminta setiap tahap berakhir pada artefak yang di-commit, dari intent.md lewat spec.md dan plan.md sampai PR dan catatan insiden, dengan control band di Maintain s1. Kursusnya memuat detail yang layak dikutip: 20 sampai 50 tugas nyata sebagai suite eval, batas 5 nit di REVIEW.md, paling banyak 2 sampai 3 sesi paralel, dan aturan bahwa kesalahan yang terjadi dua kali masuk ke CLAUDE.md s2. Pembacaan netral yang paling tajam memetakan siapa yang menyusun dan siapa yang menyetujui tiap artefak, dan menyebut dokumen ini "vendor-claim throughout" dengan "no measurement anywhere" s4.

Tugas perbaikannya adalah bug upstream yang nyata: clone baru yang menjalankan npx nx test api langsung gagal di 1 suite (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 lolos, 14 tes hijau, 2.2 s. Jalur langsung mencapai tes hijau penuh dalam 2 min 13 s, $0.70, 40 turn. Jalur rantai, intent lalu spec lalu plan lalu build, juga mencapai hijau dalam 11 min 31 s, $3.46, 169 turn. Itu ×5.2 waktu dan ×4.9 biaya, hanya dari sisi mesin s2.

Sisi manusia adalah tempat rantai ini menyakitkan. Rantai menghasilkan 5,488 kata artefak untuk dibaca (intent 558 + spec 2,167 + plan 2,763), sekitar 27 min pada 200 wpm, untuk perbaikan yang beban review langsungnya hanyalah satu diff kecil s4. Tugas fitur (membisukan penulis) lewat rantai penuh memakan 15 min 13 s, $4.11, 158 turn dan menghasilkan model Prisma Mute dengan migrasi, endpoint mute dan unmute, penyaringan feed, 1,422 baris tambahan di 15 file, 50 tes hijau dengan 3 file tes baru atau diperluas dan satu spec e2e. Artefaknya seberat 6,852 kata (intent 450 + spec 2,337 + plan 4,065), sekitar 34 min membaca s2.

Pembacaan skeptis atas tahap Design terbukti benar. Kritik di LinkedIn menyebut playbook menyembunyikan prasyaratnya: skill org untuk brand, keamanan, dan UX harus sudah ada, dan seseorang harus tahu cara menjalankan brainstorm s7. Agen mengonfirmasinya tanpa diminta. Concern C0 yang ditandai di spec.md berbunyi, kata demi kata: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Spec dengan lebih dari 2,000 kata yang merangkum ulang codebase dan tidak bisa memeriksa kebijakan adalah tahap yang dilewati saat bekerja sendiri s7.

Kritik soal infrastruktur juga terbukti. Argumennya: saat tes mengenai fake yang basi, "the agent sees the tests pass and reports the work finished", karena rantai artefak mencatat apa yang diputuskan, bukan apa yang benar-benar berjalan s8. Dalam percobaan ini, loop hanya memverifikasi unit test dan build; review sendiri mendaftar nx e2e sebagai "Not run: needs a running server and a seeded DB" dan prisma migrate status sebagai "Not run: needs a DB". Loop hijau itu tidak pernah menyentuh sistem live s8.

Tahap Deploy adalah kemenangan murah. REVIEW.md berjalan 117 s dengan biaya $0.80: nx test (5/5 suite, 50 lolos), nx build (lolos), delta lint terhadap baseline plan (34 vs 33, +1 yang diizinkan eksplisit oleh butir plan A3), dan pemeriksaan prettier (9 file gagal, dicatat sebagai nit N1). Putusan: 0 Important, 6 nit, 5 didaftar dan 1 diringkas karena batas berlaku. Review menolak menyetujui pekerjaannya sendiri dengan "this agent does not approve", pemisahan tugas seperti yang ditulis kursus s2. Gate hook berperilaku seperti di dokumentasi: diminta deploy sebelum merge, agen menolak atas penilaiannya sendiri tanpa menjalankan skrip, jadi hook tidak pernah aktif. Setelah merge, upaya deploy diblokir hook PreToolUse (exit 2) dalam 14 s dengan pesan dari gate s19.

Eval murah ditulis tetapi mudah salah. Lima kasus dihasilkan dari riwayat git dalam 283 s dengan biaya $1.44. Kedua run berjalan pada base yang salah, karena runner bercabang setelah perbaikan di-merge, dan kedua agen mendeteksinya ("the bug was already fixed here") alih-alih memalsukan kelulusan. Satu run eval memakan sekitar 60 sampai 70 s, jadi ukuran 20 sampai 50 kasus dari playbook sendiri berarti kira-kira 20 sampai 55 min waktu agen per run CI s2. Setup CLAUDE.md memakan 63 s dan $0.44 untuk satu halaman yang di-commit, langkah termurah dari semuanya; triase log CI read only menyebut penyebab yang benar dalam 11 s dengan biaya $0.13 s2.

Thread komunitas membawa telemetri yang lebih luas: dari 10,000 developer, tim dengan adopsi AI tinggi me-merge 98% lebih banyak PR sementara waktu review naik 91% dan ukuran PR naik 154% s6.

Pengukuran

Protokol: rantai dijalankan headless (claude -p, model claude-opus-5-5, izin dibatasi acceptEdits plus allowlist, --setting-sources project,local) pada clone scratch dari gothinkster/node-express-realworld-example-app (Express + TypeScript + Prisma + Postgres 16 di Docker, workspace Nx). Setiap tahap diukur waktunya dan dicatat di exp/metrics.jsonl (17 baris). Total: $11.90 + $0.14 untuk ulang hook, 539 + 3 turn, sekitar 41 min waktu jalan agen.

Tahap Waktu Turn Biaya
CLAUDE.md setup (lesson 5) 63 s 27 $0.44
FIX direct (no chain) 133 s 40 $0.70
FIX intent.md 39 s 8 $0.22
FIX spec.md 162 s 39 $0.83
FIX plan.md 180 s 46 $1.00
FIX build 310 s 76 $1.40
FEAT intent.md 29 s 6 $0.18
FEAT spec.md 118 s 20 $0.62
FEAT plan.md 240 s 41 $1.17
FEAT build (TDD) 526 s 91 $2.14
Review (REVIEW.md) 117 s 19 $0.80
Hook demo (refused) 20 s 5 $0.14
Hook demo (blocked) 14 s 3 $0.14
CI triage (read only) 11 s 3 $0.13
Evals: write 5 cases 283 s 76 $1.44
Eval run 1 / run 2 72 s / 59 s 24 / 18 $0.38 / $0.29
Tahap playbook Putusan Alasan
Plan (intent.md) Pertahankan 29 sampai 39 s, memunculkan pertanyaan terbuka yang nyata, menghentikan pilihan arsitektur diam-diam
Design (spec.md) Lewati saat solo Lebih dari 2,000 kata yang merangkum ulang codebase; nilainya mengandaikan skill org yang tidak ada (flag C0 miliknya sendiri)
Build (plan mode + CLAUDE.md + loop TDD) Pertahankan 50 tes hijau, deviasi tercatat, review bersandar pada plan
Test (eval berkelanjutan) Lewati dulu 20 sampai 55 min per run CI pada ukuran playbook sendiri; disiplin base commit gagal lebih dulu
Deploy (REVIEW.md + hook) Pertahankan Review $0.80 dengan pemeriksaan nyata plus blokir deterministik 14 s
Maintain (control band) Belum terbukti butuh berminggu-minggu telemetri produksi; diproyeksikan, tidak dijalankan

Catatan: satu repo, satu developer, satu hari. Langkah skala tim tidak dijalankan, mode headless memadatkan langkah wawancara menjadi satu prompt, dan run eval hanya dihitung biaya per run.

Lakukan ini hari Senin

  • Tulis satu halaman CLAUDE.md untuk repo utamamu: perintah build, test, dan lint, serta dua kesalahan yang dibuat agen minggu lalu. Commit. Anggarkan 63 s waktu agen.
  • Sebelum tugas non-trivial berikutnya, minta intent.md dulu: tujuan, non-tujuan, keputusan terbuka. Jawab pertanyaan terbukanya, baru biarkan agen merencanakan. Lewati spec.md kecuali kamu punya skill kebijakan org untuk memeriksanya.
  • Jalankan tahap build dalam plan mode dengan loop TDD dan wajibkan plan mencatat deviasi (D1, D2, ...) agar review punya sandaran.
  • Tambahkan putaran REVIEW.md oleh sesi baru dengan batas nit dan baris eksplisit "this agent does not approve". Suruh menjalankan tes, build, delta lint, dan pemeriksaan formatter.
  • Pasang satu gate deterministik: hook PreToolUse yang exit 2 pada deploy bila branch bukan main.
  • Sebelum memercayai loop hijau, daftar apa yang tidak dijalankannya (e2e, migrasi, apa pun yang butuh DB live) di bagian bawah review.
  • Ukur pajak gate-mu sendiri: catat waktu jalur langsung dan jalur rantai pada bug kecil yang sama, lalu hitung kata yang harus kamu baca.

Lanjutkan lebih jauh

  • Varian dua gate: gate review adversarial (sdlc-gate) dan hanya dua titik keputusan manusia, bukan satu per tahap, bentuk pragmatis untuk tim kecil s12.
  • Rantai lengkap yang bisa dipasang: template intent, spec, plan, dan REVIEW, validator gate, runner eval, dan deteksi control band, kalau kamu tidak mau membangun kerangkanya sendiri s5.
  • Perencanaan dengan wawancara lebih dulu: satu pertanyaan sekali jalan lebih baik daripada batch, dan "AI agents don't ask clarifying questions. They assume." Tulisan setup tanpa pengukuran waktu s11.
  • Mengapa satu pipeline tetap dihindari: "a docs fix and a payments migration shouldn't travel the same path", dan proses yang sebenarnya jadi tak terlihat. Mengelompokkan playbook bersama Kiro dan GitHub Spec Kit s9.
  • Celah yang akan dijual vendor platform kepadamu: intake dari sinyal ke intent, routing blast radius, dasbor metrik. s13.
  • Sebuah konsultan yang menjalankan bentuk yang sama (CRAFT) di tim klien sejak Januari dan mengakui "we don't yet have a formal answer for what a control band looks like" s10.
  • Satu contoh intent.md (checkbox Select All) yang menunjukkan tugas file ini: memunculkan keputusan terbuka alih-alih membiarkan agen memilih diam-diam s14.

Sumber

FAQ

Apakah rantai penuh pernah sepadan untuk perbaikan satu baris?

Tidak dalam percobaan ini: ×5.2 waktu dan ×4.9 biaya untuk hasil hijau yang sama, plus 5,488 kata untuk dibaca. Pakai intent.md saja untuk tugas kecil.

Kenapa melewati spec.md saat bekerja solo?

Spec menandai dirinya sendiri: tanpa skill org untuk brand, keamanan, atau UX ia tidak bisa memeriksa kebijakan, dan ia menghabiskan lebih dari 2,000 kata untuk merangkum ulang codebase.

Apakah hook menggantikan penilaian model?

Tidak, hook menopangnya. Agen menolak deploy sebelum merge atas inisiatifnya sendiri; hook memblokir upaya setelah merge dalam 14 s dengan exit 2.