AIDive

Anthropic의 Claude Code 플레이북, 실제 레포에서 처음 돌려봤다

AIDive · 게시

코딩 에이전트자동화와 워크플로

아무도 측정하지 않은 플레이북

Anthropic은 Claude Code용 AI 네이티브 SDLC 플레이북을 공개했다. 여섯 단계로 이뤄져 있고 각 단계는 커밋된 파일 하나로 끝나며, 무료 강좌로 제공된다. 핵심 주장은 이제 코드가 병목이 아니고, 진짜 병목은 커밋된 산출물의 연쇄가 관리한다는 것이다. 정작 문서에는 측정값이 하나도 없다. 시간도, 비용도, 벤치마크도 없다. 그래서 실제 레포에서 처음으로 시간을 재고 돌려 봤다. 시간을 잰 Claude Code 세션 16번, 가격을 매긴 모든 게이트, 그리고 체인을 정확히 반으로 가르는 결론이다. 그 과정에서 2분짜리 수정을 전체 체인에 태워 형식 절차의 비용을 계산했고, 우리 배포는 두 번 막혔는데 한 번은 셸 네 줄 때문이었다.

플레이북과 테스트 환경

테스트 환경은 이렇다. 시간을 잰 Claude Code 세션 16번, 컴퓨팅 비용 약 12달러, 실제 레포 하나. 플레이북은 계획, 설계, 빌드, 테스트, 배포, 유지보수의 여섯 단계로 돈다. 모든 단계는 커밋된 파일로 끝나고, 다음 단계가 그 파일을 읽는다. intent, spec, plan, 풀 리퀘스트, 인시던트 기록이 그 파일이다. 커밋이 곧 감사 추적이다. Anthropic은 이를 약 한 시간짜리 14강 무료 강좌로 가르치는데, 리뷰 게이트가 있는 기업을 대상으로 쓰였다. 우리는 개발자 한 명이 실제로 부딪히면 무엇이 살아남는지 테스트했다.

레포는 RealWorld 데모 앱(Express, TypeScript, Prisma, Postgres)이다. 실제 테스트가 있는 진짜 프로젝트인데, 새로 클론하면 스위트 하나가 깨져 있다(통과하는 스위트 4개, 초록불 테스트 14개, 실행 시간 2초). 이 버그가 나중에 대조군이 된다. 채점 규칙은 이렇다. 게이트의 산출물이 실제로 배포되는 결과를 바꾸고, 그 비용보다 적게 들면 그 게이트는 값을 한다.

입장권은 레포 루트에 두는 메모리 파일이다. 명령어, 컨벤션, 아키텍처, 모델이 계속 반복하는 실수를 한 페이지 안에 담는다. 우리 파일은 63초 만에 작성하고 커밋했고 비용은 0.44달러였다. 방법론상 솔직히 밝혀 둘 점이 하나 있다. 헤드리스 실행은 플레이북의 인터뷰를 프롬프트 한 번으로 압축한다.

계획: 29초 만에 만든 intent.md

첫 번째 게이트는 누구든 설계를 시작하기 전에 아이디어를 붙잡아 둔다. 기능 요청은 피드를 도배하는 작성자를 독자가 뮤트하고 싶어 한다는 것이었다. 플레이북은 이 결과물을 프로토 스펙이라고 부른다. 모델과 함께 쓰되 소유는 사람이 한다. 출발점은 아이디어, 등록된 티켓, 인시던트 알림 이렇게 세 가지를 허용한다. 템플릿은 다섯 개 섹션으로 구성되고, 그 제목이 생각을 대신 해 준다. 문제, 제안하는 결과, 영향받는 사용자와 시스템, 제약 조건, 열린 질문이다. 작업 루프는 다섯 동작이다. 설명하고, 브레인스토밍하고, 템플릿으로 생성하고, 고치고, 커밋한다.

intent.md 시간 비용
작성자 뮤트 기능 29 s $0.18
깨진 테스트 스위트 39 s —

가치는 맨 아래의 열린 질문에 있다. 뮤트한 작성자가 즐겨찾기에 넣은 글은 어떻게 되나? 그 작성자의 페이지는 계속 접근할 수 있나? 코딩 에이전트가 아니었다면 조용히 알아서 결정해 버렸을 사안들이, 이제 글로 적히고 날짜까지 남는다. 파일이 커밋되므로 작성자와 시각은 채팅이 사라져도 남고, 제품 오너는 초안을 수락하기 전에 직접 고친다. Anthropic이 이 단계에 잡은 목표는 요구 도출을 몇 주가 아니라 몇 시간 안에 끝내는 것이다. 혼자 하면 1분도 걸리지 않는다.

설계: 스펙이 스스로 전제 조건을 짚어낸다

두 번째 게이트는 강좌의 프롬프트 하나로 intent를 스펙으로 바꾼다. intent를 읽고, 요구사항과 설계 스펙을 만들고, 사용 가능한 스킬을 적용하라는 내용이다. 그 스킬은 브랜드, 보안, UX 정책을 담고 있어야 하는 것들이다. 2분 뒤 약 2,300단어의 탄탄한 스펙이 나왔다. 엔드포인트, 데이터 모델, 피드 동작, 엣지 케이스가 들어 있었다. 프롬프트가 요구한 대로, 충족하지 못한 항목까지 스스로 기록했다.

반전은 모델이 직접 쓴 우려 사항에 있다. "C0. 사용 가능한 조직 스킬이 없음. 이 스펙은 어떤 정책에 대해서도 검증되지 않았음." 이 단계의 전제는 대부분의 환경에 존재하지 않는 파일이 있다는 것이었고, 소개 영상들은 그 전제 조건을 건너뛴다. 에이전트는 그것을 글로 못 박았다. 두 번째 경고는 더 소소했다. 열린 질문의 기본값은 빌드 전에 제품 쪽 승인이 필요하다는 것이다.

강좌는 짝짓기에 엄격하다(spec과 intent는 함께 커밋하고, 빌드로 넘어가는 것은 사람이 승인한다). 읽는 데 드는 비용도 있다. 스펙 하나당 제품 오너의 시간이 약 12분이다. 플레이북은 재작업도 추적한다. 빌드가 시작된 뒤의 날짜가 찍힌 spec 커밋은 감점이다. 정책을 코드로 만들어 둔 팀이라면 이 게이트가 그 정책이 실행되는 곳이다. 혼자 쓴다면, 지금의 환경으로는 지킬 수 없는 약속에 돈을 내는 셈이다.

빌드: 플랜 모드, TDD, 그리고 루프가 실제로 검증하는 것

세 번째 게이트는 플랜 모드이고, 기준은 가혹하면서도 쓸모 있다. 대화를 본 적 없는 엔지니어가 계획서만으로 구현할 수 있어야 한다. 플랜 모드는 읽기 쪽을 스스로 강제한다. 계획이 수락되기 전까지 모델은 파일을 수정할 수 없다. 우리 계획서는 4분 만에 약 4,000단어가 나왔고, 바뀌는 파일, 작업 순서, 위험, 증명 방법을 짚었으며, 스펙에서 벗어난 세 가지 편차에 라벨을 붙여 기록했다. 이 편차는 나중에 리뷰에서 다시 등장한다.

빌드는 루프로 돈다. 실패하는 테스트를 쓰고, 통과시키고, 목표는 하나, 전부 초록이 아니면 작업은 끝난 것이 아니다. 이 루프는 보호된다(코드를 고치는 에이전트가 그 코드의 검사를 약하게 만들어서는 안 된다). 여기에 검증자가 짝지어진다. 코드를 쓴 세션에 휘둘리지 않는, 새 컨텍스트에서 도는 두 번째 검사다.

빌드 결과 값
에이전트 시간 약 9분, 91턴
비용 약 $2
변경 파일 15개, Mutes 테이블, 엔드포인트 2개, 피드 2개 모두 필터링
테스트 스위트 5개, 테스트 50개, 독립 재실행에서도 전부 초록
첫 시도 머지 예

단서가 하나 붙는다. 초록불이 증명하는 것은 루프가 담고 있는 범위까지이고, 그 이상은 아니다. 엔드투엔드 테스트는 돌리지 않았다. 라이브 서버와 시드된 데이터베이스가 필요하고, 낡은 가짜 객체를 겨냥한 루프는 똑같이 초록으로 빛날 것이다. 팀 규모에서는 워크트리의 병렬 세션이 더해진다(2~3개가 명시된 상한선이다). 이건 테스트하지 않았다.

배포: 리뷰, 그리고 아니라고 말한 게이트

배포 게이트는 두 겹이고, 둘 다 우리에게 안 된다고 말했다. 첫 번째 겹은 레포 루트에 적어 둔 정책에 따라 diff를 읽는다. 패스는 세 번(버그, 보안, 스펙과 계획 대비 컴플라이언스)이고, "Important"는 동작이 깨졌거나 데이터가 유출됐거나 정책을 위반한 경우에만 쓴다. 사소한 지적은 최대 다섯 개까지만 내고 나머지는 개수로 요약한다. 정책이 스스로 소음에 상한을 둔다. 리뷰는 2분, 0.80달러였고, 실제 검사를 돌렸다. 테스트, 빌드, 계획에 기록된 기준선 대비 린트, 파일 아홉 개에 대한 포매팅이다. 결과는 Important 지적 0건, 사소한 지적 6건, 상한을 넘은 1건은 요약 처리였다. 우리가 시키지 않은 한 줄로 끝맺었다. 이 에이전트는 승인하지 않는다. 승인은 브랜치 보호 뒤에 있는 사람 코드 오너의 몫이다.

두 번째 겹이 게이트 자체다. 배포를 요청했더니 모델이 스스로 거부했다. 기능이 배포 브랜치에 없었기 때문이다. 그건 판단이지 강제가 아니다. 그래서 머지하고 다시 요청했더니, 셸 네 줄이 14초 만에 답했다. 차단됨, 릴리스 승인이 필요함. 종료 코드 2는 도구 호출을 막고 그 사유를 모델에게 돌려보낸다. 파이프라인 쪽에도 같은 처방을 썼다. 깨진 빌드를 헤드리스로 11초, 0.13달러에 분류했고, 로그를 읽고 정확한 원인을 짚은 뒤 파일은 건드리지 않고 diff를 제안했다. 결정적인 방식이 공손한 방식을 이긴다. 다만 훅은 패턴만큼만 유효하고, 우리 훅은 스크립트 하나에만 걸렸다.

게이트 세금

같은 버그, 같은 깨진 출발점, 두 갈래 길의 대조 실험이다. 첫 번째 길은 그냥 고친다. 두 번째 길은 intent부터 빌드까지 전체 체인을 탄다.

직접 수정 전체 체인 배수
소요 시간 2:13 11:31 ×5.2
비용 $0.70 $3.46 ×4.9
턴 40 169 —
결과 스위트 초록 스위트 초록 동일

기계가 치르는 비용은 작은 쪽이다. 체인은 한 줄짜리 수정을 위해 약 5,500단어의 산출물을 썼다. 한 번에 훑어볼 수 있는 diff 하나에 사람이 읽는 시간이 약 27분이다. 체인은 쓰는 시간을 읽는 시간으로 바꿔 놓는다. 이것이 게이트 세금이다.

플레이북은 반복 비용도 하나 더한다. 지속적 평가다. 실제 작업 20~50개를 설정이 바뀔 때마다 다시 돌린다. 각 케이스는 실제로 있었던 과거 작업이고, 프롬프트는 당시 그대로이며, 변경 이전 커밋에서 실행하고, 검증 가능한 합격 기준이 붙는다. 이력에서 케이스 다섯 개를 쓰는 데 5분이 걸렸다. 제대로 돌리는 건 그만큼 쉽지 않다. 우리 첫 하네스는 케이스 두 개를 엉뚱한 커밋에 겨냥했고, 두 에이전트 모두 통과인 척하지 않고 그 사실을 잡아냈다. 케이스당 약 1분이면 전체 스위트는 한 번 돌릴 때마다 에이전트 시간이 최대 한 시간이고, 프로덕션 인시던트는 하나하나가 영구적인 회귀 평가로 스위트에 합류하게 되어 있다. 규제를 받는 팀에게는 그 읽기 작업이 곧 납품물이다. 혼자 쓰면 오버헤드다.

결론: 여섯 중 셋이 값을 한다

여섯 게이트 중 셋은 제값을 한다.

단계 판정 근거
계획 유지 40초로 아무도 묻지 않은 질문을 산다
빌드 유지 플랜 모드와 테스트 루프로 초록불 테스트 50개를 배포
배포 유지 실제 검사를 돌린 0.80달러짜리 리뷰, 14초짜리 결정적 차단
설계 혼자라면 건너뛰기 아직 코드로 만들지 않은 정책의 비용을 청구한다
테스트(지속적 평가) 미뤄도 된다 한 번 돌리는 데 최대 한 시간, 엉뚱한 곳을 겨냥하기 쉽다
유지보수 검증되지 않음 몇 주치의 프로덕션 텔레메트리가 필요하다

유지보수는 종이 위에서는 우아하다. 결정적 스크립트가 관리 한계를 감시하고, 한계를 넘으면 새 intent 파일이 만들어진다. 하지만 그걸 증명하려면 우리에게 없는 프로덕션 텔레메트리가 필요하다. 한 분석가의 말대로 Anthropic의 문서에는 어디에도 측정값이 없다. 이것이 첫 번째 숫자들이고, 한계도 분명하다. 레포 하나, 개발자 한 명, 하루다.

외부 데이터는 이 압박이 실재한다고 말한다. Faros는 1,200개 이상의 팀에 속한 개발자 1만 명 이상을 추적했다. 도입률이 높은 팀은 풀 리퀘스트를 98% 더 많이 머지하고, 리뷰 시간은 91% 늘며, 평균 풀 리퀘스트 크기는 두 배를 넘는다. 최신 DORA 보고서도 비슷하다. AI로 처리량은 오르고 안정성은 내려간다. 리뷰가 병목이 되고 있고, 플레이북은 정확히 거기를 겨냥한다. 커뮤니티 변형판은 이미 체인을 사람의 결정 두 번으로 줄였다. 하나는 템플릿과 게이트 장부를 제공하고, 다른 하나는 설계와 테스트에서만 사람을 둔다. 값을 하는 세 게이트를 도입하고, 나머지는 팀이 자랄 때 따라 키우자. Anthropic의 마지막 한 줄이 가장 어울리는 묘비명이다. 루프는 계속 돌고, 사람의 판단은 그 위에 남는다.

출처

자주 묻는 질문

Anthropic의 AI 네이티브 SDLC 플레이북이란 무엇인가?
AI 개발을 여섯 단계(계획, 설계, 빌드, 테스트, 배포, 유지보수)로 구조화한 14강짜리 무료 Claude Academy 강좌다. 각 단계는 커밋된 파일로 끝나고 다음 단계가 그 파일을 읽는다. intent.md, spec.md, plan.md, 풀 리퀘스트, 인시던트 기록이 그 파일이다.
AI 네이티브 SDLC 플레이북을 따를 만한 가치가 있나?
실제 레포에서 측정해 보니 여섯 게이트 중 셋이 제값을 한다. 계획(아무도 묻지 않은 질문을 29~40초에 확보), 빌드(플랜 모드와 TDD 루프로 파일 15개짜리 기능을 초록불 테스트 50개와 함께 배포), 배포(실제 검사를 돌린 0.80달러짜리 리뷰와 결정적인 훅 차단)다. 설계, 지속적 평가, 유지보수는 팀이 정책을 코드로 만들고 프로덕션 텔레메트리를 갖춘 뒤에야 값을 한다.
전체 산출물 체인은 직접 수정에 비해 비용이 얼마나 드나?
같은 버그에서 직접 수정은 2:13에 $0.70이 들었고, intent → spec → plan → 빌드의 전체 체인은 11:31에 $3.46이 들었다. 결과는 같은데 시간과 비용은 약 다섯 배이고, 사람이 읽는 시간이 약 27분 더 든다.
Claude Code 훅은 배포 게이트로 어떻게 동작하나?
PreToolUse 훅은 모든 Bash 명령을 실행 전에 읽는다. 보호 대상 패턴(예: deploy-prod)과 맞으면 사유를 출력하고 종료 코드 2로 끝내는데, 이것이 도구 호출을 막고 사유를 모델에게 돌려준다. 우리 훅은 14초 만에 답했다.
플레이북에서 말하는 지속적 평가란 무엇인가?
과거의 실제 작업 20~50개를 설정이 바뀔 때마다 다시 돌리는 스위트로, 각 케이스에는 검증 가능한 합격 기준이 붙는다. 케이스 다섯 개를 쓰는 데 5분이 걸렸지만, 전체 스위트는 한 번 돌릴 때마다 에이전트 시간이 최대 한 시간 들고, 프로덕션 인시던트는 하나하나 회귀 평가로 스위트에 합류하게 되어 있다.
AI 코딩은 정말 병목을 리뷰로 옮겨 놓나?
현장 데이터는 그렇다고 말한다. 개발자 1만 명 이상을 대상으로 한 Faros 텔레메트리에서 도입률이 높은 팀은 풀 리퀘스트를 98% 더 많이 머지하는 반면 리뷰 시간은 91% 늘고 평균 PR 크기는 두 배를 넘는다. 최신 DORA 보고서도 처리량은 오르고 안정성은 내려간다고 보여 준다.

관련 영상