TL;DR
- Die sechs Stufen des Playbooks enden jeweils in einem committeten Artefakt (intent.md, spec.md, plan.md, PR, Incident-Record). Der Launch-Post und der Kurs mit 14 Lektionen beschreiben die Form, aber keiner veröffentlicht eine Messung.
- Von Anfang bis Ende auf einem echten Express + Prisma Repo ausgeführt, behob die komplette Kette einen Bug in 11 min 31 s für $3.46, während ein direkter Prompt 2 min 13 s und $0.70 brauchte: ×5.2 Wall-Time, ×4.9 Kosten, beide grün.
- Die eigentliche Steuer ist das Lesen: 5,488 Wörter Artefakte für einen einzeiligen Klassen-Fix, etwa 27 min bei 200 wpm. Die Kette wandelt Schreibzeit in Lesezeit um.
- Drei von sechs Stufen haben sich in diesem Kontext gelohnt: Plan (intent.md), Build (Plan Mode + CLAUDE.md + TDD), Deploy (REVIEW.md + ein Hook). Design und kontinuierliche Evals nicht für Solo-Entwickler; Maintain wurde nicht ausgeführt.
- Die Spec-Stufe meldete ihre eigene Voraussetzung: Es gab keine Org-Skills, also wurde sie nie gegen Brand-, Security- oder UX-Richtlinien geprüft. Das Playbook setzt voraus, dass diese Skills schon geschrieben sind.
- Das deterministische Gate funktioniert: Ein PreToolUse-Hook blockierte ein Deployment in 14 s mit exit 2. Das Modell hatte zuvor schon einmal aus eigenem Urteil abgelehnt, bevor der Hook überhaupt auslöste.
Was die Messungen sagen
Das Playbook beschreibt den Wandel als "code is no longer the bottleneck" und verlangt, dass jede Stufe in einem committeten Artefakt endet, von intent.md über spec.md und plan.md bis zum PR und zum Incident-Record, mit Control Bands in Maintain s1. Der Kurs liefert die zitierbaren Details: 20 bis 50 echte Aufgaben als Eval-Suite, ein Limit von 5 Nits in REVIEW.md, höchstens 2 bis 3 parallele Sessions und die Regel, dass ein Fehler, der zweimal passiert, in CLAUDE.md gehört s2. Die schärfste neutrale Lesart tabelliert, wer jedes Artefakt entwirft und wer es abnimmt, und nennt das Dokument "vendor-claim throughout" mit "no measurement anywhere" s4.
Die Fix-Aufgabe war ein echter Upstream-Bug: Ein frischer Clone führte npx nx test api aus, und 1 Suite schlug direkt fehl (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 bestanden, 14 Tests grün, 2.2 s. Der direkte Weg erreichte vollständig grüne Tests in 2 min 13 s, $0.70, 40 Turns. Der Weg über die Kette, intent dann spec dann plan dann build, wurde ebenfalls grün, in 11 min 31 s, $3.46, 169 Turns. Das sind ×5.2 Wall-Time und ×4.9 Kosten allein auf Maschinenseite s2.
Auf der menschlichen Seite tut die Kette weh. Sie erzeugte 5,488 Wörter Artefakte zum Lesen (intent 558 + spec 2,167 + plan 2,763), etwa 27 min bei 200 wpm, für einen Fix, dessen direkter Review-Aufwand ein kleiner Diff ist s4. Die Feature-Aufgabe (Autoren stummschalten) durch die volle Kette dauerte 15 min 13 s, $4.11, 158 Turns und lieferte ein Prisma-Mute-Modell mit Migration, Mute- und Unmute-Endpunkte, Feed-Filterung, 1,422 Einfügungen in 15 Dateien, 50 grüne Tests mit 3 neuen oder erweiterten Testdateien und einer e2e-Spec. Ihre Artefakte umfassten 6,852 Wörter (intent 450 + spec 2,337 + plan 4,065), rund 34 min Lesezeit s2.
Die skeptische Lesart der Design-Stufe hielt stand. Die LinkedIn-Kritik sagt, das Playbook verstecke seine Voraussetzungen: Org-Skills für Brand, Security und UX müssen schon existieren, und jemand muss wissen, wie man das Brainstorming durchführt s7. Der Agent bestätigte das ungefragt. Der markierte Punkt C0 in spec.md lautet wörtlich: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Eine Spec mit über 2,000 Wörtern, die die Codebasis nacherzählt und keine Richtlinien prüfen kann, ist die Stufe, die man allein überspringt s7.
Auch die Infrastruktur-Kritik traf zu. Das Argument: Wenn Tests auf veraltete Fakes laufen, "the agent sees the tests pass and reports the work finished", weil die Artefaktkette festhält, was entschieden wurde, nicht was tatsächlich läuft s8. Im Lauf prüfte die Schleife nur Unit-Tests und den Build; das Review selbst listete nx e2e als "Not run: needs a running server and a seeded DB" und prisma migrate status als "Not run: needs a DB". Die grüne Schleife berührte nie ein Live-System s8.
Die Deploy-Stufe war der günstige Gewinn. REVIEW.md lief in 117 s für $0.80: nx test (5/5 Suites, 50 bestanden), nx build (bestanden), ein Lint-Delta gegen die Baseline aus dem Plan (34 vs 33, das +1 ausdrücklich erlaubt durch Plan-Punkt A3) und ein Prettier-Check (9 Dateien fehlerhaft, als Nit N1 protokolliert). Urteil: 0 Important, 6 Nits, 5 aufgelistet und 1 zusammengefasst, weil das Limit griff. Das Review weigerte sich, seine eigene Arbeit abzunehmen, mit "this agent does not approve", die Aufgabentrennung, wie der Kurs sie beschreibt s2. Das Hook-Gate verhielt sich wie in der Doku beschrieben: Als der Agent vor dem Merge deployen sollte, lehnte er aus eigenem Urteil ab, ohne das Script auszuführen, der Hook löste also nie aus. Nach dem Merge blockierte der PreToolUse-Hook (exit 2) den Deploy-Versuch in 14 s mit der Meldung des Gates s19.
Evals waren schnell geschrieben und leicht falsch gemacht. Fünf Fälle entstanden aus der Git-Historie in 283 s für $1.44. Beide Läufe liefen gegen die falsche Basis, weil der Runner erst nach dem gemergten Fix abzweigte, und beide Agenten bemerkten das ("the bug was already fixed here"), statt ein Bestehen vorzutäuschen. Ein Eval-Lauf kostet etwa 60 bis 70 s, bei der im Playbook empfohlenen Größe von 20 bis 50 Fällen sind das also grob 20 bis 55 min Agentenzeit pro CI-Lauf s2. Das CLAUDE.md-Setup dauerte 63 s und $0.44 für eine committete Seite, die günstigste Maßnahme überhaupt; eine schreibgeschützte CI-Log-Triage nannte die richtige Ursache in 11 s für $0.13 s2.
Der Community-Thread liefert die breitere Telemetrie: Über 10,000 Entwickler hinweg mergen Teams mit hoher KI-Nutzung 98% mehr PRs, während die Review-Zeit um 91% und die PR-Größe um 154% steigt s6.
Messungen
Protokoll: Die Kette lief headless (claude -p, Modell claude-opus-5-5, Rechte begrenzt auf acceptEdits plus Allowlist, --setting-sources project,local) auf einem Scratch-Clone von gothinkster/node-express-realworld-example-app (Express + TypeScript + Prisma + Postgres 16 in Docker, Nx-Workspace). Jede Stufe wurde gemessen und in exp/metrics.jsonl protokolliert (17 Zeilen). Gesamt: $11.90 + $0.14 für einen Hook-Rerun, 539 + 3 Turns, etwa 41 min Agenten-Wall-Time.
| Stufe | Wall | Turns | Kosten |
|---|---|---|---|
| CLAUDE.md setup (lesson 5) | 63 s | 27 | $0.44 |
| FIX direct (no chain) | 133 s | 40 | $0.70 |
| FIX intent.md | 39 s | 8 | $0.22 |
| FIX spec.md | 162 s | 39 | $0.83 |
| FIX plan.md | 180 s | 46 | $1.00 |
| FIX build | 310 s | 76 | $1.40 |
| FEAT intent.md | 29 s | 6 | $0.18 |
| FEAT spec.md | 118 s | 20 | $0.62 |
| FEAT plan.md | 240 s | 41 | $1.17 |
| FEAT build (TDD) | 526 s | 91 | $2.14 |
| Review (REVIEW.md) | 117 s | 19 | $0.80 |
| Hook demo (refused) | 20 s | 5 | $0.14 |
| Hook demo (blocked) | 14 s | 3 | $0.14 |
| CI triage (read only) | 11 s | 3 | $0.13 |
| Evals: write 5 cases | 283 s | 76 | $1.44 |
| Eval run 1 / run 2 | 72 s / 59 s | 24 / 18 | $0.38 / $0.29 |
| Playbook-Stufe | Urteil | Warum |
|---|---|---|
| Plan (intent.md) | Behalten | 29 bis 39 s, deckt echte offene Fragen auf, beendet stille Architekturentscheidungen |
| Design (spec.md) | Solo überspringen | Über 2,000 Wörter, die die Codebasis nacherzählen; ihr Nutzen setzt Org-Skills voraus, die es nicht gibt (ihr eigenes C0-Flag) |
| Build (Plan Mode + CLAUDE.md + TDD-Schleife) | Behalten | 50 Tests grün, Abweichungen protokolliert, das Review stützte sich auf den Plan |
| Test (kontinuierliche Evals) | Vorerst überspringen | 20 bis 55 min pro CI-Lauf bei der im Playbook empfohlenen Größe; die Disziplin bei der Basis-Commit scheiterte zuerst |
| Deploy (REVIEW.md + Hooks) | Behalten | $0.80 Review mit echten Prüfungen plus ein deterministischer Block in 14 s |
| Maintain (Control Bands) | Nicht belegt | braucht Wochen an Produktions-Telemetrie; projiziert, nicht ausgeführt |
Einschränkungen: ein Repo, ein Entwickler, ein Tag. Team-Maßnahmen wurden nicht ausgeführt, der Headless-Modus presst die Interview-Schritte in einzelne Prompts, und bei den Eval-Läufen sind nur die Kosten pro Lauf gezählt.
Das machst du am Montag
- Schreibe eine Seite CLAUDE.md für dein Haupt-Repo: Build-, Test- und Lint-Befehle, die zwei Fehler, die der Agent letzte Woche gemacht hat. Committe sie. Plane 63 s Agentenzeit ein.
- Bitte vor deiner nächsten nicht trivialen Aufgabe zuerst um eine intent.md: Ziel, Nicht-Ziele, offene Entscheidungen. Beantworte die offenen Fragen und lass den Agenten dann planen. Überspringe spec.md, solange du keine Org-Policy-Skills hast, gegen die man sie prüfen kann.
- Führe die Build-Stufe im Plan Mode mit einer TDD-Schleife aus und verlange, dass der Plan Abweichungen festhält (D1, D2, ...), damit das Review etwas hat, woran es sich stützen kann.
- Füge einen REVIEW.md-Durchlauf durch eine frische Session hinzu, mit Nit-Limit und einer ausdrücklichen Zeile "this agent does not approve". Lass sie Tests, Build, ein Lint-Delta und einen Formatter-Check ausführen.
- Richte ein deterministisches Gate ein: einen PreToolUse-Hook, der bei
deploymit exit 2 abbricht, wenn der Branch nicht main ist. - Bevor du einer grünen Schleife traust, liste am Ende des Reviews auf, was sie nicht ausgeführt hat (e2e, Migrationen, alles, was eine Live-DB braucht).
- Miss deine eigene Gate-Steuer: Stoppe die Zeit für den direkten Weg und den Weg über die Kette am selben kleinen Bug und zähle dann die Wörter, die du lesen musstest.
Weiterführend
- Die Variante mit zwei Gates: ein adversariales Review-Gate (sdlc-gate) und nur zwei menschliche Entscheidungspunkte statt einem pro Stufe, die pragmatische Form für ein kleines Team s12.
- Die komplette installierbare Kette: Templates für intent, spec, plan und REVIEW, ein Gate-Validator, ein Eval-Runner und Control-Band-Erkennung, falls du das Gerüst nicht von Hand bauen willst s5.
- Planung mit Interview zuerst: eine Frage nach der anderen schlägt Batching, und "AI agents don't ask clarifying questions. They assume." Ein Setup-Bericht ohne Zeitmessungen s11.
- Warum ein starrer Pipeline-Ablauf umgangen wird: "a docs fix and a payments migration shouldn't travel the same path", und der echte Prozess wird unsichtbar. Ordnet das Playbook zusammen mit Kiro und GitHub Spec Kit ein s9.
- Die Lücken, die dir ein Plattformanbieter verkaufen wird: Signal-zu-Intent-Intake, Blast-Radius-Routing, ein Metrik-Dashboard. s13.
- Eine Beratung, die dieselbe Form (CRAFT) seit Januar bei Kundenteams einsetzt und zugibt: "we don't yet have a formal answer for what a control band looks like" s10.
- Ein durchgespieltes intent.md-Beispiel (eine Select-All-Checkbox), das die Aufgabe der Datei zeigt: offene Entscheidungen sichtbar machen, statt den Agenten still wählen zu lassen s14.
Quellen
- The AI-Native SDLC Playbook (launch post), claude.com. Warum lesen: die Form mit sechs Stufen und die Regel des committeten Artefakts in fünf Minuten.
- The AI-native SDLC playbook (course, 14 lessons), Claude Academy. Warum lesen: der einzige Ort, an dem die Zahlen stehen (20 bis 50 Eval-Aufgaben, 5 Nits, 2 bis 3 Sessions), kostenlos und ohne Login.
- The Committed-Artifact Chain, howardism.dev. Warum lesen: wer jedes Artefakt entwirft und wer es abnimmt, und die klare Feststellung, dass im Playbook nichts gemessen ist.
- bashebr/ai-native-sdlc, GitHub. Warum lesen: Templates, Gate-Validator und Eval-Runner zum Installieren statt Selberschreiben.
- Anthropic published an AI-native SDLC playbook, r/ClaudeAI. Warum lesen: der Thread, der die Faros-Telemetrie (98% mehr PRs, +91% Review-Zeit) in die Debatte bringt.
- The AI-native SDLC Playbook is basically "do everything you did before, but inside Claude", LinkedIn. Warum lesen: das Argument der versteckten Voraussetzungen, das die Spec-Stufe von selbst bestätigte.
- The AI-Native SDLC Starts With Your Infrastructure, MetalBear blog. Warum lesen: das Problem veralteter Fakes, aus Anbietersicht geschrieben, aber das Argument trägt für sich.
- The AI-native SDLC won't be one process, worldprogramming.org. Warum lesen: das Zeremonie-Argument gegen einen einzigen Pfad für jede Änderung.
- Anthropic Wrote the AI-Native SDLC Playbook in August. We Wrote Ours in January., Substack. Warum lesen: ein unabhängiges Team, das bei derselben Form landet und die Lücke bei Maintain zugibt.
- AI-Native SDLC: First Try, kyle.pericak.com. Warum lesen: der einzige praktische Erstlauf mit Interview zuerst, geschrieben bevor das Playbook existierte.
- TsCarpe/claude-sdlc-skills, GitHub. Warum lesen: die Variante mit zwei Gates und einem adversarialen Review-Schritt.
- Implementing the Anthropic AI-Native SDLC Playbook, Port blog. Warum lesen: die Liste dessen, was das Playbook auslässt, als Landkarte der Lücken gelesen.
- What Is intent.md in Claude Code?, dev.to. Warum lesen: eine konkrete intent.md, deren Struktur du übernehmen kannst.
- Hooks guide, Claude Code docs. Warum lesen: wie ein PreToolUse-Hook mit exit 2 zum deterministischen Gate wird, auf das sich das Playbook stützt.
FAQ
Lohnt sich die komplette Kette je für einen einzeiligen Fix?
Nicht in diesem Lauf: ×5.2 Wall-Time und ×4.9 Kosten für dasselbe grüne Ergebnis, dazu 5,488 Wörter zu lesen. Nutze für kleine Aufgaben nur die intent.md.
Warum spec.md überspringen, wenn man allein arbeitet?
Die Spec meldete es selbst: Ohne Org-Skills für Brand, Security oder UX konnte sie keine Richtlinien prüfen, und sie verbrauchte über 2,000 Wörter damit, die Codebasis nachzuerzählen.
Ersetzt der Hook das Urteil des Modells?
Nein, er stützt es. Der Agent lehnte das Deployment vor dem Merge von selbst ab; der Hook blockierte den Versuch nach dem Merge in 14 s mit exit 2.
AIDive