TL;DR
- Anthropic은 235,000명이 만든 Claude Code 세션 400,000개를 평가했고, 검증된 성공률이 가장 높은 쪽은 소프트웨어 엔지니어가 아니라 관리자라는 결과를 얻었다.
- 코딩을 아는 것은 거의 이점이 되지 않는다. 코드를 만들어 내는 세션 중 소프트웨어 직군은 34%, 다른 모든 직군은 29%가 검증에 성공했고, 부분 성공률은 89%와 88%로 사실상 같다.
- 결과를 가르는 것은 사용자의 숙련도다. 초보자는 프롬프트당 에이전트 행동 약 5회, 600단어, 검증된 성공률 15%이고, 전문가는 12회, 3,200단어, 28~33%다.
- 성과의 대부분은 세 가지 습관에서 나온다. 프롬프트에 자신만의 맥락을 넣고, 검증 가능한 증거로 끝맺고, 세션이 꼬여도 닫지 않고 그 안에서 계속 수정하는 것이다.
- 상한선은 모두에게 낮다. 전문가도 세션의 3분의 1 이하만 검증에 성공하며, 관리자가 1위인 것은 부분적으로 측정 오류일 수 있다.
출처가 말하는 것
이 연구는 2025년 10월부터 2026년 4월까지 기록된 235,000명의 대화형 Claude Code 세션 400,000개를 분류기로 평가한 것이다 s1. 대화 내용을 사람이 읽지는 않았다. Sonnet 4.6 기반 분류기가 세션마다 등급을 매겼고, 그 등급은 커밋, 코드 변경, 테스트 결과 같은 텔레메트리와 교차 검증되었다. 코드를 수정한 세션에서는 분류기와 텔레메트리가 90% 넘게 일치한다 s1. Claude Code는 터미널에서 동작하는 에이전트로, 평범한 말로 요청하면 파일을 읽고 코드를 작성하고 명령을 실행한다 s2.
모든 수치를 읽는 방식은 세 가지 정의에 달려 있다. 검증된 성공(verified success)은 테스트 통과나 사용자의 명시적 확인처럼 목표가 달성되었다는 확실한 증거를 분류기가 찾았다는 뜻이다. 부분 성공(partial success)은 목표에 적어도 일부 도달했다는 뜻이다. 숙련도는 직함이 아니다. 분류기는 세션 안에서 사용자가 어떻게 행동하는지를 초보자부터 전문가까지 5단계로 평가하며, 세 가지 신호를 쓴다. 지시의 정밀도, 사용자가 에이전트에게 검증하라고 요청하는 내용, 사용자가 에이전트를 바로잡는지 여부다 s1.
직군별 결과가 핵심이다. 코드를 만들어 내는 세션에서 소프트웨어 직군은 검증된 성공률 34%, 나머지는 29%이며, 5포인트 차이는 7개월 동안 두 집단이 모두 나아지는 가운데에도 안정적으로 유지되었다 s1. 부분 성공에서는 두 집단이 같은 수준으로, 89% 대 88%다 s1. 규모가 큰 상위 10개 직군은 모두 개발자와 7포인트 이내에 있고, 관리자 그룹이 맨 위에 있다 s1. 실제로 중요한 예측 변수에 대해 Anthropic이 붙인 이름은 도메인 전문성이다. 풀려는 문제를 깊이 아는 것이다.
역할 분담이 그 이유를 설명한다. 전형적인 세션에서 사람은 무엇을 만들지에 해당하는 기획 결정의 약 70%를 내리지만, 어떻게 작성할지에 해당하는 실행 결정은 20%만 내린다 s1. 제품이 정확히 무엇을 해야 하는지 아는 관리자가 중요한 절반을 쥐고 있는 셈이다. 에이전트의 용도에서도 같은 변화가 보인다. 7개월 동안 디버깅 세션 비중은 33%에서 19%로 줄었고, 소프트웨어 실행은 14%에서 21%로 늘었으며, 데이터 분석과 문서 작성은 거의 두 배가 되었고, 에이전트에게 맡기는 평균 작업의 추정 가치는 27% 올랐다 s1.
자율성이 커질수록 문장 하나의 무게도 커진다. 전형적인 세션에서 사용자와 에이전트가 주고받는 횟수는 약 4번에 불과하고, 프롬프트 하나가 평균 약 10개의 행동을 일으키며, 간혹 100개가 넘는 행동을 일으키기도 한다 s1. 말할 기회가 네 번뿐이라면 각 문장의 정밀도가 곧 당신의 기여분이 된다.
실용적인 수치는 숙련도 단계에 있다. 초보자는 도메인 지식이 담기지 않은 일반적인 지시를 쓰고, 프롬프트 하나가 에이전트 행동 약 5회와 약 600단어의 결과물을 만들며, 검증된 성공률은 15%에서 멈춘다 s1. 전문가는 맥락이 가득한 프롬프트를 쓰고, 같은 에이전트가 12개의 행동을 이어 붙여 지시 하나당 3,200단어를 만들며, 검증된 성공률은 28%에서 33% 사이다 s1. 같은 도구, 같은 구독으로 결과물은 약 다섯 배, 성공률은 두 배가 되고, 달라진 변수는 키보드 앞의 사람뿐이다. 이득의 거의 전부는 초보자와 중급자 사이에 있고, 아래 세 가지 습관이 바로 그 단계를 다룬다.
습관은 분류기의 세 가지 신호와 대응한다. 지시의 정밀도는 어디에서, 무엇으로 작업하고, 끝난 결과가 어떤 모습인지 말하는 것이다. 검증은 프롬프트를 확인 가능한 조건으로 끝내는 것이다. 테스트를 실행해라, 렌더링을 보여 달라, 페이지가 로드되는지 확인해라 같은 식이다. 연구에 따르면 판단된 성공과 검증된 성공을 가르는 것이 바로 이것이다 s1. 수정은 이렇다. 초보자는 결과를 수동적으로 받아들이고, 문제가 생기면 다른 사용자보다 네 배 더 자주 포기한다. 문제를 자기 말로 다시 설명하는 것이 세 번째 신호가 측정하는 바로 그것이다 s1. 세 가지 중 코드를 한 줄이라도 요구하는 것은 없다.
한계는 연구 자체에 명시되어 있다. 전문가조차 세션의 28%에서 33%만 검증에 성공하므로, 세션 세 개 중 둘은 목표가 달성되었다는 확실한 증거 없이 끝나고, 잘해야 부분 성공이며 그 비율은 90%를 넘는다 s1. 관리자 순위에는 측정 편향의 가능성이 있다. 검증된 성공은 사용자의 명시적 확인을 포함하는데, 작업을 받아들인다고 분명히 확인하는 것은 관리자의 습관이기 때문이다 s1. 또 표본은 평균보다 의욕이 높은 명령줄 사용자층인 Claude Code 사용자이므로, 다른 도구에서도 같은 수치가 나온다는 보장은 없다 s1. 초보자 팁에 관한 커뮤니티 스레드는 반대편에서 하는 유용한 점검이다. 사람들이 초보자에게 하는 조언은 세 신호와 맞아떨어진다. 맥락을 주고, 확인을 요청하고, 계속 방향을 잡아 주라는 것이다 s3.
판정: 연구가 뒷받침하는 것
| 주장 | 상태 | 근거 |
|---|---|---|
| 에이전트에서 동작하는 코드를 얻으려면 코딩을 알아야 한다 | 건너뛰기 | 검증 34% 대 29%, 부분 89% 대 88%, 관리자가 1위 s1 |
| 프롬프트에 자신만의 맥락을 넣으면 효과가 있다 | 유지 | 초보자와 전문가 사이에서 행동 5회 대 12회, 프롬프트당 600단어 대 3,200단어 s1 |
| 프롬프트를 증거 조건으로 끝내면 효과가 있다 | 유지 | 검증은 분류기의 세 신호 중 하나이며, 판단된 성공과 검증된 성공을 가른다 s1 |
| 실패 후 세션에 남아 있으면 효과가 있다 | 유지 | 초보자는 네 배 더 자주 포기하며, 수정이 세 번째 신호다 s1 |
| 전문가 수준에 오르면 에이전트가 믿을 만해진다 | 건너뛰기 | 전문가도 세션의 28~33%만 검증된다 s1 |
| 관리자가 엔지니어보다 이 일을 더 잘한다 | 주의하며 시도 | 편향 가능성: 검증된 성공은 사용자의 명시적 확인을 포함한다 s1 |
| 이 수치는 다른 AI 도구에도 적용된다 | 건너뛰기 | 표본이 Claude Code 사용자뿐이다 s1 |
월요일에 할 일
- 에이전트에 마지막으로 보낸 프롬프트를 세 블록으로 다시 써 본다. 어디에서 작업할지, 무엇으로 작업할지(기존 파일, 라우트, 데이터셋, 문서), 끝난 상태가 어떤 모습인지.
- 이번 주에는 모든 프롬프트 끝에 증거 조항을 붙인다. 테스트를 실행해라, 페이지를 열어라, 모든 링크가 열리는지 확인해라, diff를 보여 달라.
- 세션이 잘못되면 닫기 전에 수정 지시를 한 번 쓴다. 무슨 일이 있었는지, 무엇을 기대했는지, 어디를 봐야 하는지. 다음 턴에서 해결되는 비율을 센다.
- 프로젝트에 대해 당신만 아는 사실 세 가지(대상 독자, 제약, 바뀌면 안 되는 것)를 적어서 다음 세션 맨 위에 붙여 넣는다.
- 뉴스레터 초안이나 가격 문구 수정 같은 코드가 아닌 작업 하나를 같은 세 블록으로 에이전트에게 맡기고, 평소 방식과 결과를 비교한다.
- 다섯 세션 동안 검증, 부분, 실패를 기록한다. 연구의 초보자 15%, 전문가 28~33% 구간과 비교한다.
- 프롬프트의 어떤 블록이 답을 몰라서 비어 있다면, 세션을 시작한 뒤가 아니라 시작하기 전에 동료나 문서로 해결한다.
더 알아보기
- 수치를 인용하기 전에 방법론 섹션을 읽는다. 분류기는 Sonnet 4.6이고, 코드를 수정한 세션에서 텔레메트리와 90% 넘게 일치하는지 교차 검증되었다 s1.
- 단계별 프롬프트당 행동 수 차트는 초보자에서 전문가로 넘어가는 도약을 가장 분명히 보여 준다. 행동은 5회에서 12회로, 단어는 600에서 3,200으로 늘어난다 s1.
- 작업 구성 섹션은 7개월 동안 디버깅이 33%에서 19%로 줄고 소프트웨어 실행이 14%에서 21%로 늘었음을 보여 주며, 누가 에이전트는 버그 수정용일 뿐이라고 할 때 쓸 만한 근거다 s1.
- 기획 70% 대 실행 20%의 분담은 누가 에이전트를 운전해야 하는지 팀에서 논의할 때 가져갈 숫자다 s1.
- 관리자 결과를 슬라이드에 쓰기 전에, 검증된 성공과 사용자의 명시적 확인에 관한 편향 설명을 다시 읽는다 s1.
- 에이전트가 터미널에서 실제로 어떻게 동작하는지, 무엇을 읽고 쓰고 실행하는지는 제품 페이지에서 시작한다 s2.
- 초보자 팁 스레드는 초보자들이 구체적인 프롬프트 습관을 주고받는 곳이다. 세 신호를 염두에 두고 읽으면서 조언을 어느 신호에 해당하는지로 분류해 본다 s3.
출처
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. 읽어야 하는 이유: 이 자료집의 모든 수치가 여기서 나왔고, 방법론과 편향 설명이 헤드라인의 해석을 바꾼다.
- Claude Code, Anthropic. 읽어야 하는 이유: 연구가 측정한 에이전트이며, 터미널 세션에서 하는 일을 보여 준다.
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. 읽어야 하는 이유: 연구의 세 신호와 비교해 볼 수 있는 실무자의 조언.
FAQ
이 연구는 비개발자도 개발자만큼 잘한다고 말하나요?
꼭 그렇지는 않습니다. 개발자는 검증된 성공에서 34% 대 29%로 5포인트 앞서며, 그 차이는 7개월 동안 안정적이었습니다. 다만 연구는 그 차이가 작고, 직함보다 세션 안에서의 사용자 숙련도가 훨씬 많은 것을 예측한다고 말합니다.
검증된 성공이란 무엇인가요?
목표가 달성되었다는 확실한 증거입니다. 테스트 통과, 분류기가 텔레메트리로 확인할 수 있는 동작하는 결과, 또는 사용자의 명시적 확인이 해당합니다. 마지막 항목 때문에 관리자 결과에 편향 가능성이 있습니다.
코딩을 배우지 않고도 한 단계 올라갈 수 있나요?
네. 분류기는 지시의 정밀도, 에이전트에게 검증하라고 요청하는 내용, 에이전트를 바로잡는지 여부를 평가합니다. 셋 모두 코드가 아니라 당신의 문제와 기준을 설명하는 일입니다.
전문가도 상한선이 이렇게 낮은 이유는 무엇인가요?
연구는 증거가 있을 때만 세션을 검증된 것으로 칩니다. 전문가는 검증 28~33%에 도달하지만 부분 성공은 90%를 넘으므로, 대부분의 세션은 무언가를 내놓습니다. 부족한 것은 그것이 끝났다는 증거입니다.
AIDive