Коротко
- Каждый из шести этапов playbook заканчивается закоммиченным артефактом (intent.md, spec.md, plan.md, PR, запись об инциденте). Анонс и курс из 14 уроков описывают форму процесса, но ни один не публикует измерений.
- На реальном репозитории Express + Prisma вся цепочка исправила один баг за 11 min 31 s и $3.46, а прямой промпт справился за 2 min 13 s и $0.70: ×5.2 по времени, ×4.9 по стоимости, оба результата зелёные.
- Настоящая цена это чтение: 5,488 слов артефактов ради однострочного исправления класса, около 27 минут при 200 словах в минуту. Цепочка превращает время письма во время чтения.
- Три этапа из шести окупились в этом контексте: Plan (intent.md), Build (plan mode + CLAUDE.md + TDD), Deploy (REVIEW.md + hook). Design и непрерывные evals не окупились для одиночного разработчика; Maintain не запускался.
- Этап spec сам указал на свою предпосылку: корпоративных skills не существовало, поэтому спецификацию ни разу не сверили с политиками по бренду, безопасности и UX. Playbook исходит из того, что эти skills уже написаны.
- Детерминированный gate работает: hook PreToolUse заблокировал деплой за 14 s с кодом exit 2. До срабатывания hook модель уже один раз отказалась сама, по собственной оценке.
Что говорят измерения
Playbook подаёт сдвиг как «код больше не узкое место» и требует, чтобы каждый этап заканчивался закоммиченным артефактом: от intent.md через spec.md и plan.md к PR и записи об инциденте, с контрольными границами в Maintain s1. Курс даёт конкретику, которую удобно цитировать: 20 to 50 реальных задач как набор eval, лимит 5 nit в REVIEW.md, не более 2 to 3 параллельных сессий и правило «ошибка, совершённая дважды, попадает в CLAUDE.md» s2. Самый резкий нейтральный разбор сводит в таблицу, кто пишет и кто принимает каждый артефакт, и называет документ «vendor-claim throughout» с «no measurement anywhere» s4.
Задачей на исправление стал реальный баг из upstream: после свежего клона npx nx test api сразу давал 1 упавший suite из пяти (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 прошли, 14 тестов зелёные, 2.2 s. Прямой путь довёл тесты до зелёного за 2 min 13 s, $0.70, 40 turns. Путь через цепочку, intent, затем spec, затем plan, затем build, тоже пришёл к зелёному за 11 min 31 s, $3.46, 169 turns. Это ×5.2 по времени и ×4.9 по стоимости только со стороны машины s2.
Больнее всего цепочка бьёт по человеку. Она выдала 5,488 слов артефактов для чтения (intent 558 + spec 2,167 + plan 2,763), около 27 минут при 200 словах в минуту, ради исправления, чья прямая нагрузка на ревью это один небольшой diff s4. Задача-фича (mute авторов) через всю цепочку заняла 15 min 13 s, $4.11, 158 turns и выдала модель Prisma Mute с миграцией, endpoints mute и unmute, фильтрацию ленты, 1,422 добавленных строки в 15 файлах, 50 зелёных тестов с 3 новыми или расширенными тестовыми файлами и e2e-спецификацией. Артефакты весили 6,852 слова (intent 450 + spec 2,337 + plan 4,065), примерно 34 минуты чтения s2.
Скептический взгляд на этап Design подтвердился. Критика в LinkedIn говорит, что playbook скрывает свои предпосылки: корпоративные skills по бренду, безопасности и UX уже должны существовать, а кто-то должен уметь провести brainstorm s7. Агент подтвердил это без подсказки. Замечание C0 в spec.md звучит дословно: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Спецификация на 2,000 с лишним слов, которая пересказывает кодовую базу и не может проверить политики, это тот этап, который стоит пропустить, когда работаешь один s7.
Критика инфраструктуры тоже подтвердилась. Довод такой: когда тесты бьют по устаревшим fake, "the agent sees the tests pass and reports the work finished", потому что цепочка артефактов фиксирует, что решили, а не что реально запускается s8. В эксперименте цикл проверил только unit-тесты и сборку; само ревью записало nx e2e как "Not run: needs a running server and a seeded DB", а prisma migrate status как "Not run: needs a DB". Зелёный цикл ни разу не коснулся живой системы s8.
Этап Deploy оказался самой дешёвой победой. REVIEW.md отработал за 117 s и $0.80: nx test (5/5 suites, 50 passed), nx build (pass), дельта lint относительно базовой линии плана (34 против 33, +1 прямо разрешён пунктом A3 плана) и проверка prettier (9 файлов не прошли, записано как nit N1). Вердикт: 0 Important, 6 nit, 5 перечислены и 1 сведён в резюме из-за лимита. Ревью отказалось одобрять собственную работу фразой "this agent does not approve", то есть разделение обязанностей в том виде, как его описывает курс s2. Hook-gate повёл себя так, как описано в документации: на просьбу задеплоить до merge агент отказался по собственной оценке и не запустил скрипт, так что hook не сработал. После merge попытку деплоя заблокировал hook PreToolUse (exit 2) за 14 s с сообщением gate s19.
Evals писать дёшево, но легко написать неправильно. Пять кейсов вышли из истории git за 283 s и $1.44. Оба запуска шли на неверной базе, потому что runner создал ветку уже после merge исправления, и оба агента это заметили ("the bug was already fixed here"), а не подделали успех. Один запуск eval стоит примерно 60 to 70 s, так что при собственной оценке playbook в 20 to 50 кейсов получается примерно 20 to 55 минут времени агента на один прогон CI s2. Настройка CLAUDE.md заняла 63 s и $0.44 ради одной закоммиченной страницы, это самый дешёвый приём; триаж лога CI только на чтение назвал верную причину за 11 s и $0.13 s2.
Обсуждение в сообществе приносит более широкую телеметрию: по 10,000 разработчиков команды с высоким уровнем AI мерджат на 98% больше PR, при этом время ревью растёт на 91%, а размер PR на 154% s6.
Измерения
Протокол: цепочка шла в headless-режиме (claude -p, модель claude-opus-5-5, права ограничены acceptEdits плюс allowlist, --setting-sources project,local) на временном клоне gothinkster/node-express-realworld-example-app (Express + TypeScript + Prisma + Postgres 16 в Docker, рабочее пространство Nx). Каждый этап замерен и записан в exp/metrics.jsonl (17 строк). Итого: $11.90 плюс $0.14 за повторный прогон hook, 539 + 3 turns, около 41 минуты времени агента.
| Этап | Время | Turns | Стоимость |
|---|---|---|---|
| Настройка CLAUDE.md (урок 5) | 63 s | 27 | $0.44 |
| FIX напрямую (без цепочки) | 133 s | 40 | $0.70 |
| FIX intent.md | 39 s | 8 | $0.22 |
| FIX spec.md | 162 s | 39 | $0.83 |
| FIX plan.md | 180 s | 46 | $1.00 |
| FIX build | 310 s | 76 | $1.40 |
| FEAT intent.md | 29 s | 6 | $0.18 |
| FEAT spec.md | 118 s | 20 | $0.62 |
| FEAT plan.md | 240 s | 41 | $1.17 |
| FEAT build (TDD) | 526 s | 91 | $2.14 |
| Ревью (REVIEW.md) | 117 s | 19 | $0.80 |
| Демо hook (отказ) | 20 s | 5 | $0.14 |
| Демо hook (блокировка) | 14 s | 3 | $0.14 |
| Триаж CI (только чтение) | 11 s | 3 | $0.13 |
| Evals: написать 5 кейсов | 283 s | 76 | $1.44 |
| Запуск eval 1 / запуск 2 | 72 s / 59 s | 24 / 18 | $0.38 / $0.29 |
| Этап playbook | Вердикт | Почему |
|---|---|---|
| Plan (intent.md) | Оставить | 29 to 39 s, вскрывает реальные открытые вопросы, убирает молчаливый выбор архитектуры |
| Design (spec.md) | Пропустить в одиночку | 2,000 с лишним слов пересказа кодовой базы; ценность держится на корпоративных skills, которых нет (собственный флаг C0) |
| Build (plan mode + CLAUDE.md + цикл TDD) | Оставить | 50 тестов зелёные, отклонения записаны, ревью опиралось на план |
| Test (непрерывные evals) | Пока пропустить | 20 to 55 минут на прогон CI при размерах самого playbook; первой сломалась дисциплина базового коммита |
| Deploy (REVIEW.md + hooks) | Оставить | Ревью за $0.80 с реальными проверками плюс детерминированная блокировка за 14 s |
| Maintain (контрольные границы) | Не доказано | нужны недели телеметрии из production; расчёт, не запуск |
Оговорки: один репозиторий, один разработчик, один день. Приёмы для масштаба команды не запускались, headless-режим сжимает шаги интервью в один промпт, а запуски eval считаются только по стоимости одного прогона.
Сделайте в понедельник
- Напишите одну страницу CLAUDE.md для основного репозитория: команды build, test и lint, две ошибки, которые агент сделал на прошлой неделе. Закоммитьте. Бюджет 63 s времени агента.
- Перед следующей нетривиальной задачей сначала попросите intent.md: цель, не-цели, открытые решения. Ответьте на открытые вопросы и только потом пусть агент строит план. Пропускайте spec.md, если у вас нет корпоративных skills с политиками, по которым его можно проверить.
- Запускайте этап build в plan mode с циклом TDD и требуйте, чтобы план фиксировал отклонения (D1, D2, ...), чтобы у ревью было на что опереться.
- Добавьте проход REVIEW.md в свежей сессии с лимитом nit и явной строкой "this agent does not approve". Пусть он запускает тесты, сборку, дельту lint и проверку форматтера.
- Поставьте один детерминированный gate: hook PreToolUse, который завершается с exit 2 на
deploy, если ветка не main. - Прежде чем доверять зелёному циклу, перечислите внизу ревью, что он не запускал (e2e, миграции, всё, что требует живую БД).
- Измерьте собственный налог на gate: засеките прямой путь и путь через цепочку на одном небольшом баге, затем посчитайте слова, которые пришлось прочитать.
Идти дальше
- Вариант с двумя gate: состязательный gate ревью (sdlc-gate) и всего две точки человеческого решения вместо одной на этап, прагматичная форма для небольшой команды s12.
- Полная устанавливаемая цепочка: шаблоны intent, spec, plan и REVIEW, валидатор gate, runner для eval и обнаружение выхода за контрольные границы, если не хочется собирать каркас вручную s5.
- Планирование через интервью: один вопрос за раз лучше пачки, а "AI agents don't ask clarifying questions. They assume." Запись о настройке без замеров времени s11.
- Почему один фиксированный конвейер начинают обходить: "a docs fix and a payments migration shouldn't travel the same path", и настоящий процесс становится невидимым. Группирует playbook с Kiro и GitHub Spec Kit s9.
- Пробелы, которые вам продаст платформенный вендор: приём сигнала в intent, маршрутизация по радиусу поражения, дашборд метрик. s13.
- Консалтинговая компания, которая с января применяла ту же форму (CRAFT) в клиентских командах и признаёт: "we don't yet have a formal answer for what a control band looks like" s10.
- Один разобранный пример intent.md (чекбокс Select All), показывающий задачу файла: вскрыть открытые решения, а не позволить агенту выбирать молча s14.
Источники
- The AI-Native SDLC Playbook (launch post), claude.com. Зачем читать: шесть этапов и правило закоммиченного артефакта за пять минут.
- The AI-native SDLC playbook (course, 14 lessons), Claude Academy. Зачем читать: единственное место, где есть числа (20 to 50 задач eval, лимит 5 nit, 2 to 3 сессии), бесплатно и без входа.
- The Committed-Artifact Chain, howardism.dev. Зачем читать: кто пишет и кто принимает каждый артефакт, и прямое заявление, что в playbook ничего не измерено.
- bashebr/ai-native-sdlc, GitHub. Зачем читать: шаблоны, валидатор gate и runner eval, которые можно установить, а не писать.
- Anthropic published an AI-native SDLC playbook, r/ClaudeAI. Зачем читать: ветка, которая вносит в спор телеметрию Faros (на 98% больше PR, +91% времени ревью).
- The AI-native SDLC Playbook is basically "do everything you did before, but inside Claude", LinkedIn. Зачем читать: довод о скрытых предпосылках, который этап spec подтвердил сам.
- The AI-Native SDLC Starts With Your Infrastructure, MetalBear blog. Зачем читать: проблема устаревших fake; голос вендора, но довод держится сам по себе.
- The AI-native SDLC won't be one process, worldprogramming.org. Зачем читать: довод о церемониях против единого пути для любого изменения.
- Anthropic Wrote the AI-Native SDLC Playbook in August. We Wrote Ours in January., Substack. Зачем читать: независимая команда пришла к той же форме и признаёт дыру в Maintain.
- AI-Native SDLC: First Try, kyle.pericak.com. Зачем читать: единственный практический первый запуск с интервью в начале, написанный до появления playbook.
- TsCarpe/claude-sdlc-skills, GitHub. Зачем читать: вариант с двумя gate и состязательным шагом ревью.
- Implementing the Anthropic AI-Native SDLC Playbook, Port blog. Зачем читать: список того, что playbook оставляет за скобками, как карта пробелов.
- What Is intent.md in Claude Code?, dev.to. Зачем читать: один конкретный intent.md, структуру которого можно взять за образец.
- Hooks guide, Claude Code docs. Зачем читать: как hook PreToolUse с exit 2 становится детерминированным gate, на который опирается playbook.
FAQ
Стоит ли вся цепочка того ради однострочного исправления?
Не в этом эксперименте: ×5.2 по времени и ×4.9 по стоимости за тот же зелёный результат, плюс 5,488 слов для чтения. Для мелких задач хватает одного intent.md.
Почему пропускать spec.md, когда работаешь один?
Спецификация сама это отметила: без корпоративных skills по бренду, безопасности и UX она не смогла проверить политики и потратила 2,000 с лишним слов на пересказ кодовой базы.
Заменяет ли hook суждение модели?
Нет, он его страхует. Агент сам отказался от деплоя до merge; hook заблокировал попытку после merge за 14 s с exit 2.
AIDive