AIDive

Пакет к видео

Playbook AI-native SDLC в цифрах: время этапов, налог на gate, таблица вердиктов

12 мин чтения

Коротко

  • Каждый из шести этапов playbook заканчивается закоммиченным артефактом (intent.md, spec.md, plan.md, PR, запись об инциденте). Анонс и курс из 14 уроков описывают форму процесса, но ни один не публикует измерений.
  • На реальном репозитории Express + Prisma вся цепочка исправила один баг за 11 min 31 s и $3.46, а прямой промпт справился за 2 min 13 s и $0.70: ×5.2 по времени, ×4.9 по стоимости, оба результата зелёные.
  • Настоящая цена это чтение: 5,488 слов артефактов ради однострочного исправления класса, около 27 минут при 200 словах в минуту. Цепочка превращает время письма во время чтения.
  • Три этапа из шести окупились в этом контексте: Plan (intent.md), Build (plan mode + CLAUDE.md + TDD), Deploy (REVIEW.md + hook). Design и непрерывные evals не окупились для одиночного разработчика; Maintain не запускался.
  • Этап spec сам указал на свою предпосылку: корпоративных skills не существовало, поэтому спецификацию ни разу не сверили с политиками по бренду, безопасности и UX. Playbook исходит из того, что эти skills уже написаны.
  • Детерминированный gate работает: hook PreToolUse заблокировал деплой за 14 s с кодом exit 2. До срабатывания hook модель уже один раз отказалась сама, по собственной оценке.

Что говорят измерения

Playbook подаёт сдвиг как «код больше не узкое место» и требует, чтобы каждый этап заканчивался закоммиченным артефактом: от intent.md через spec.md и plan.md к PR и записи об инциденте, с контрольными границами в Maintain s1. Курс даёт конкретику, которую удобно цитировать: 20 to 50 реальных задач как набор eval, лимит 5 nit в REVIEW.md, не более 2 to 3 параллельных сессий и правило «ошибка, совершённая дважды, попадает в CLAUDE.md» s2. Самый резкий нейтральный разбор сводит в таблицу, кто пишет и кто принимает каждый артефакт, и называет документ «vendor-claim throughout» с «no measurement anywhere» s4.

Задачей на исправление стал реальный баг из upstream: после свежего клона npx nx test api сразу давал 1 упавший suite из пяти (auth.service.test.ts, "TypeError: Cannot read properties of undefined (reading 'prototype')"), 4 прошли, 14 тестов зелёные, 2.2 s. Прямой путь довёл тесты до зелёного за 2 min 13 s, $0.70, 40 turns. Путь через цепочку, intent, затем spec, затем plan, затем build, тоже пришёл к зелёному за 11 min 31 s, $3.46, 169 turns. Это ×5.2 по времени и ×4.9 по стоимости только со стороны машины s2.

Больнее всего цепочка бьёт по человеку. Она выдала 5,488 слов артефактов для чтения (intent 558 + spec 2,167 + plan 2,763), около 27 минут при 200 словах в минуту, ради исправления, чья прямая нагрузка на ревью это один небольшой diff s4. Задача-фича (mute авторов) через всю цепочку заняла 15 min 13 s, $4.11, 158 turns и выдала модель Prisma Mute с миграцией, endpoints mute и unmute, фильтрацию ленты, 1,422 добавленных строки в 15 файлах, 50 зелёных тестов с 3 новыми или расширенными тестовыми файлами и e2e-спецификацией. Артефакты весили 6,852 слова (intent 450 + spec 2,337 + plan 4,065), примерно 34 минуты чтения s2.

Скептический взгляд на этап Design подтвердился. Критика в LinkedIn говорит, что playbook скрывает свои предпосылки: корпоративные skills по бренду, безопасности и UX уже должны существовать, а кто-то должен уметь провести brainstorm s7. Агент подтвердил это без подсказки. Замечание C0 в spec.md звучит дословно: "No org skills available. … This spec has therefore not been checked against brand, security or UX policy." Спецификация на 2,000 с лишним слов, которая пересказывает кодовую базу и не может проверить политики, это тот этап, который стоит пропустить, когда работаешь один s7.

Критика инфраструктуры тоже подтвердилась. Довод такой: когда тесты бьют по устаревшим fake, "the agent sees the tests pass and reports the work finished", потому что цепочка артефактов фиксирует, что решили, а не что реально запускается s8. В эксперименте цикл проверил только unit-тесты и сборку; само ревью записало nx e2e как "Not run: needs a running server and a seeded DB", а prisma migrate status как "Not run: needs a DB". Зелёный цикл ни разу не коснулся живой системы s8.

Этап Deploy оказался самой дешёвой победой. REVIEW.md отработал за 117 s и $0.80: nx test (5/5 suites, 50 passed), nx build (pass), дельта lint относительно базовой линии плана (34 против 33, +1 прямо разрешён пунктом A3 плана) и проверка prettier (9 файлов не прошли, записано как nit N1). Вердикт: 0 Important, 6 nit, 5 перечислены и 1 сведён в резюме из-за лимита. Ревью отказалось одобрять собственную работу фразой "this agent does not approve", то есть разделение обязанностей в том виде, как его описывает курс s2. Hook-gate повёл себя так, как описано в документации: на просьбу задеплоить до merge агент отказался по собственной оценке и не запустил скрипт, так что hook не сработал. После merge попытку деплоя заблокировал hook PreToolUse (exit 2) за 14 s с сообщением gate s19.

Evals писать дёшево, но легко написать неправильно. Пять кейсов вышли из истории git за 283 s и $1.44. Оба запуска шли на неверной базе, потому что runner создал ветку уже после merge исправления, и оба агента это заметили ("the bug was already fixed here"), а не подделали успех. Один запуск eval стоит примерно 60 to 70 s, так что при собственной оценке playbook в 20 to 50 кейсов получается примерно 20 to 55 минут времени агента на один прогон CI s2. Настройка CLAUDE.md заняла 63 s и $0.44 ради одной закоммиченной страницы, это самый дешёвый приём; триаж лога CI только на чтение назвал верную причину за 11 s и $0.13 s2.

Обсуждение в сообществе приносит более широкую телеметрию: по 10,000 разработчиков команды с высоким уровнем AI мерджат на 98% больше PR, при этом время ревью растёт на 91%, а размер PR на 154% s6.

Измерения

Протокол: цепочка шла в headless-режиме (claude -p, модель claude-opus-5-5, права ограничены acceptEdits плюс allowlist, --setting-sources project,local) на временном клоне gothinkster/node-express-realworld-example-app (Express + TypeScript + Prisma + Postgres 16 в Docker, рабочее пространство Nx). Каждый этап замерен и записан в exp/metrics.jsonl (17 строк). Итого: $11.90 плюс $0.14 за повторный прогон hook, 539 + 3 turns, около 41 минуты времени агента.

Этап Время Turns Стоимость
Настройка CLAUDE.md (урок 5) 63 s 27 $0.44
FIX напрямую (без цепочки) 133 s 40 $0.70
FIX intent.md 39 s 8 $0.22
FIX spec.md 162 s 39 $0.83
FIX plan.md 180 s 46 $1.00
FIX build 310 s 76 $1.40
FEAT intent.md 29 s 6 $0.18
FEAT spec.md 118 s 20 $0.62
FEAT plan.md 240 s 41 $1.17
FEAT build (TDD) 526 s 91 $2.14
Ревью (REVIEW.md) 117 s 19 $0.80
Демо hook (отказ) 20 s 5 $0.14
Демо hook (блокировка) 14 s 3 $0.14
Триаж CI (только чтение) 11 s 3 $0.13
Evals: написать 5 кейсов 283 s 76 $1.44
Запуск eval 1 / запуск 2 72 s / 59 s 24 / 18 $0.38 / $0.29
Этап playbook Вердикт Почему
Plan (intent.md) Оставить 29 to 39 s, вскрывает реальные открытые вопросы, убирает молчаливый выбор архитектуры
Design (spec.md) Пропустить в одиночку 2,000 с лишним слов пересказа кодовой базы; ценность держится на корпоративных skills, которых нет (собственный флаг C0)
Build (plan mode + CLAUDE.md + цикл TDD) Оставить 50 тестов зелёные, отклонения записаны, ревью опиралось на план
Test (непрерывные evals) Пока пропустить 20 to 55 минут на прогон CI при размерах самого playbook; первой сломалась дисциплина базового коммита
Deploy (REVIEW.md + hooks) Оставить Ревью за $0.80 с реальными проверками плюс детерминированная блокировка за 14 s
Maintain (контрольные границы) Не доказано нужны недели телеметрии из production; расчёт, не запуск

Оговорки: один репозиторий, один разработчик, один день. Приёмы для масштаба команды не запускались, headless-режим сжимает шаги интервью в один промпт, а запуски eval считаются только по стоимости одного прогона.

Сделайте в понедельник

  • Напишите одну страницу CLAUDE.md для основного репозитория: команды build, test и lint, две ошибки, которые агент сделал на прошлой неделе. Закоммитьте. Бюджет 63 s времени агента.
  • Перед следующей нетривиальной задачей сначала попросите intent.md: цель, не-цели, открытые решения. Ответьте на открытые вопросы и только потом пусть агент строит план. Пропускайте spec.md, если у вас нет корпоративных skills с политиками, по которым его можно проверить.
  • Запускайте этап build в plan mode с циклом TDD и требуйте, чтобы план фиксировал отклонения (D1, D2, ...), чтобы у ревью было на что опереться.
  • Добавьте проход REVIEW.md в свежей сессии с лимитом nit и явной строкой "this agent does not approve". Пусть он запускает тесты, сборку, дельту lint и проверку форматтера.
  • Поставьте один детерминированный gate: hook PreToolUse, который завершается с exit 2 на deploy, если ветка не main.
  • Прежде чем доверять зелёному циклу, перечислите внизу ревью, что он не запускал (e2e, миграции, всё, что требует живую БД).
  • Измерьте собственный налог на gate: засеките прямой путь и путь через цепочку на одном небольшом баге, затем посчитайте слова, которые пришлось прочитать.

Идти дальше

  • Вариант с двумя gate: состязательный gate ревью (sdlc-gate) и всего две точки человеческого решения вместо одной на этап, прагматичная форма для небольшой команды s12.
  • Полная устанавливаемая цепочка: шаблоны intent, spec, plan и REVIEW, валидатор gate, runner для eval и обнаружение выхода за контрольные границы, если не хочется собирать каркас вручную s5.
  • Планирование через интервью: один вопрос за раз лучше пачки, а "AI agents don't ask clarifying questions. They assume." Запись о настройке без замеров времени s11.
  • Почему один фиксированный конвейер начинают обходить: "a docs fix and a payments migration shouldn't travel the same path", и настоящий процесс становится невидимым. Группирует playbook с Kiro и GitHub Spec Kit s9.
  • Пробелы, которые вам продаст платформенный вендор: приём сигнала в intent, маршрутизация по радиусу поражения, дашборд метрик. s13.
  • Консалтинговая компания, которая с января применяла ту же форму (CRAFT) в клиентских командах и признаёт: "we don't yet have a formal answer for what a control band looks like" s10.
  • Один разобранный пример intent.md (чекбокс Select All), показывающий задачу файла: вскрыть открытые решения, а не позволить агенту выбирать молча s14.

Источники

  • The AI-Native SDLC Playbook (launch post), claude.com. Зачем читать: шесть этапов и правило закоммиченного артефакта за пять минут.
  • The AI-native SDLC playbook (course, 14 lessons), Claude Academy. Зачем читать: единственное место, где есть числа (20 to 50 задач eval, лимит 5 nit, 2 to 3 сессии), бесплатно и без входа.
  • The Committed-Artifact Chain, howardism.dev. Зачем читать: кто пишет и кто принимает каждый артефакт, и прямое заявление, что в playbook ничего не измерено.
  • bashebr/ai-native-sdlc, GitHub. Зачем читать: шаблоны, валидатор gate и runner eval, которые можно установить, а не писать.
  • Anthropic published an AI-native SDLC playbook, r/ClaudeAI. Зачем читать: ветка, которая вносит в спор телеметрию Faros (на 98% больше PR, +91% времени ревью).
  • The AI-native SDLC Playbook is basically "do everything you did before, but inside Claude", LinkedIn. Зачем читать: довод о скрытых предпосылках, который этап spec подтвердил сам.
  • The AI-Native SDLC Starts With Your Infrastructure, MetalBear blog. Зачем читать: проблема устаревших fake; голос вендора, но довод держится сам по себе.
  • The AI-native SDLC won't be one process, worldprogramming.org. Зачем читать: довод о церемониях против единого пути для любого изменения.
  • Anthropic Wrote the AI-Native SDLC Playbook in August. We Wrote Ours in January., Substack. Зачем читать: независимая команда пришла к той же форме и признаёт дыру в Maintain.
  • AI-Native SDLC: First Try, kyle.pericak.com. Зачем читать: единственный практический первый запуск с интервью в начале, написанный до появления playbook.
  • TsCarpe/claude-sdlc-skills, GitHub. Зачем читать: вариант с двумя gate и состязательным шагом ревью.
  • Implementing the Anthropic AI-Native SDLC Playbook, Port blog. Зачем читать: список того, что playbook оставляет за скобками, как карта пробелов.
  • What Is intent.md in Claude Code?, dev.to. Зачем читать: один конкретный intent.md, структуру которого можно взять за образец.
  • Hooks guide, Claude Code docs. Зачем читать: как hook PreToolUse с exit 2 становится детерминированным gate, на который опирается playbook.

FAQ

Стоит ли вся цепочка того ради однострочного исправления?

Не в этом эксперименте: ×5.2 по времени и ×4.9 по стоимости за тот же зелёный результат, плюс 5,488 слов для чтения. Для мелких задач хватает одного intent.md.

Почему пропускать spec.md, когда работаешь один?

Спецификация сама это отметила: без корпоративных skills по бренду, безопасности и UX она не смогла проверить политики и потратила 2,000 с лишним слов на пересказ кодовой базы.

Заменяет ли hook суждение модели?

Нет, он его страхует. Агент сам отказался от деплоя до merge; hook заблокировал попытку после merge за 14 s с exit 2.