AIDive

Anthropic이 AI 세션 400,000개를 분석했다. 개발자가 졌다

AIDive · 게시

코딩 에이전트

AI 코딩, 관리자가 개발자를 이긴다

Anthropic은 분류기를 통해 400,000개의 Claude Code 세션을 하나하나 평가해, 코딩 에이전트로 실제로 성과를 내는 사람이 누구인지 알아냈습니다. 검증된 성공률이 가장 높은 집단은 소프트웨어 엔지니어가 아닙니다. 관리직입니다. 연구에서 규모가 가장 큰 10개 직군 모두 개발자와 7포인트 이내의 격차에 몰려 있습니다. 코드를 쓰지 않는 사람들이, 코딩을 직업으로 하는 사람들과 거의 같은 비율로 작동하는 코드를 내놓고 있다는 뜻입니다.

코딩을 못하니까 이런 도구는 내 것이 아니라고 생각해 왔다면, 이 연구는 정확히 그 반대를 말합니다. 코딩 실력은 더 이상 성공하는 사람과 실패하는 사람을 가르지 않으며, 연구는 무엇이 가르는지를 정확히 짚어냅니다.

Anthropic이 실제로 측정한 것

연구의 모든 숫자를 읽는 방식을 바꾸는 정의가 세 가지 있습니다. 먼저 표본입니다. 2025년 10월부터 2026년 4월 사이에 기록된, 235,000명의 인터랙티브 세션 400,000개입니다. Claude Code는 터미널에서 동작하는 Anthropic의 코딩 에이전트입니다. 원하는 것을 일상 언어로 적으면, 에이전트가 스스로 파일을 읽고, 코드를 쓰고, 명령을 실행합니다.

Anthropic의 누구도 그 대화를 직접 읽지 않았습니다. 자사 모델 위에 구축한 분류기가 모든 세션을 자동으로 평가했고, 그 평가는 텔레메트리, 즉 커밋, 코드 변경, 테스트 결과와 대조 검증되었습니다. 코드를 수정하는 세션에서 분류기와 텔레메트리는 90% 이상 일치합니다.

두 번째는 성공입니다. 연구는 두 종류의 성공을 추적하며, 그 차이가 이후의 모든 내용을 좌우합니다. 판정된 성공은 분류기가 목표에 도달했다고 판단한 경우입니다. 검증된 성공은 더 어렵습니다. 통과한 테스트, 커밋, 또는 사용자의 명시적 확인 같은 증거가 필요합니다. 검증된 성공이 아래 모든 숫자에 적용되는 높은 기준이며, 실제로 유용했던 많은 세션이 공식적인 증거 없이 끝나는 만큼 상당히 까다로운 기준입니다.

세 번째는 전문성 그 자체입니다. 분류기는 직함이나 이력서를 전혀 보지 않습니다. 세션 안에서의 행동을 읽고, 초보부터 전문가까지 5단계 척도로 평가하며, 신호는 딱 세 가지입니다. 지시가 얼마나 정확한지, 에이전트에게 무엇을 검증하라고 요청하는지, 그리고 서로를 교정하는지. 즉 레벨은 그 세션에서 다루는 문제를 얼마나 장악하고 있는지를 측정하므로, 같은 사람이 아침에는 자기 분야의 전문가였다가 밤에는 새로운 주제의 초보가 될 수 있습니다.

초보부터 전문가까지 5단계

초보는 한 문장으로 알아볼 수 있습니다. 도메인 지식이 전혀 담기지 않은 일반적인 지시입니다. 전문가는 맥락이 가득 담긴 프롬프트를 쓰고, 같은 에이전트가 훨씬 많은 자율 작업으로 응답합니다. 여기서 액션이란 파일 읽기, 함수 작성, 명령 실행처럼 에이전트의 구체적인 동작 하나를 말합니다.

지표 초보 전문가
프롬프트당 에이전트 액션 약 5개 약 12개
프롬프트당 산출물 분량 약 600단어 약 3,200단어
검증된 성공률 15% 28-33% (중급 이상)
세션이 꼬였을 때 포기율 19% 5-7% (초보 외 전체)
난관에 빠진 세션의 성공 전환율 4% 15%

같은 도구, 같은 구독으로 5배의 산출물이 나옵니다. 달라진 변수는 키보드 앞에 앉은 사람뿐입니다.

가장 중요한 대목은 이것입니다. 상승분의 거의 전부가 초보와 중급 사이에서 일어나고, 중급과 전문가의 격차는 크지 않습니다. 성공률을 두 배로 올리기 위해 전문가가 될 필요는 없습니다. 초보에서 벗어나기만 하면 됩니다.

가장 잔인한 격차는 세션이 잘못 흘러갈 때 드러납니다. 에이전트가 오류와 깨지는 테스트의 소용돌이에 빠지면 초보는 19%의 확률로 세션을 포기하지만, 나머지 전체는 5-7%에 그칩니다. 버티는 사람들 중에서도 초보는 그런 난관에 빠진 세션의 4%만을 검증된 성공으로 전환하는 반면, 전문가는 15%를 전환합니다. 문제를 충분히 이해하고 있어서 가라앉는 에이전트를 지켜보는 대신 방향을 바로잡을 수 있다는 이유 하나로, 거의 4배 많은 세션을 구해내는 것입니다. 레벨 간의 차이는 모든 것이 잘 굴러갈 때가 아니라, 첫 번째 삐걱거림에서 드러납니다.

코딩 실력이 더는 중요하지 않은 이유

Anthropic이 말하는 도메인 전문성이란, 풀려는 문제를 밑바닥까지 이해하는 것입니다. 코드를 생산하는 세션에서 직군 간 격차는 작고 안정적입니다.

집단 검증된 성공 부분 성공
소프트웨어 직군 34% 89%
그 외 모든 직군 29% 88%

5포인트 차이이며, 이 격차는 연구가 진행된 7개월 동안 두 집단이 모두 향상되는 와중에도 벌어지지도 좁혀지지도 않았습니다. 목표에 최소한 부분적으로 도달한 부분 성공에서는 두 집단이 사실상 동률입니다.

연구는 도메인 전문성이 어디에서 작동하는지도 보여줍니다. 일반적인 세션에서 인간은 계획 결정(무엇을 만들지)의 약 70%를 내리지만, 실행 결정(어떻게 작성할지)은 20%만 내립니다. 분담은 이미 정해져 있습니다. 당신이 '무엇'을 정하고, 에이전트가 '어떻게'를 처리합니다. 자기 제품이 무엇을 해야 하는지 정확히 아는 관리자는, 에이전트가 생산하는 코드를 한 줄도 쓰지 못하더라도 가장 중요한 지렛대를 쥐고 있는 셈입니다. 관리직이 순위 맨 위에 오른 이유가 바로 이것입니다.

관찰된 7개월간의 사용 양상도 무게 중심이 이동하고 있음을 확인해 줍니다.

작업 유형 연구 초기 연구 말기
디버깅 세션의 33% 19%
소프트웨어 실행 14% 21%
데이터 분석과 문서 작성 기준치 거의 2배

사람들은 더 이상 에이전트를 코드 수리에만 쓰지 않습니다. 자기 일을 굴리는 데 쓰고 있습니다. 같은 기간 에이전트에게 맡겨진 평균 작업의 추정 가치는 27% 증가했습니다.

자율성도 같은 방식으로 당신의 역할을 재정의합니다. 일반적인 세션에는 인간과 에이전트 사이의 교환이 약 4번뿐이고, 프롬프트 하나가 평균 10개 정도의 액션을 촉발합니다. 극단적인 경우 프롬프트 하나가 100개가 넘는 액션으로 이어지기도 합니다. 지시 하나에 에이전트가 한나절 분량의 작업을 혼자 해내는 것입니다. 당신이 기여하는 것은 세션당 몇 문장에 불과하고, 바로 그래서 그 문장들의 정확성이 그토록 무겁습니다. 네 번밖에 말하지 않는다면, 모든 문장이 중요합니다.

같은 작업, 초보의 프롬프트와 전문가의 프롬프트

누구나 이해할 수 있는 작업으로 그 차이를 재현했습니다. 작은 웹사이트에 문의 폼을 추가하는 일입니다.

초보 버전은 우리 중 절반이 여전히 입력하는 프롬프트입니다. 아홉 단어, 맥락 없음, 기준 없음. 에이전트는 사이트가 어디에 있는지, 폼이 무엇을 수집하는지, 메시지가 어디로 가는지 모르므로, 그 모든 결정을 대신 내리고, 당신은 마지막에야 그 선택들을 발견하게 됩니다. 우리의 실행에서 에이전트는 폼을 홈페이지에 배치했고, 아무도 요청하지 않은 전화번호 필드를 만들어냈으며, 제출 내용을 존재하지 않는 이메일 주소로 연결했습니다. 이 중 어느 것도 버그가 아닙니다. 에이전트는 요청의 빈틈을 추측으로 메웠고, 모든 추측은 틀릴 기회였습니다. 이것이 측정된 초보 패턴입니다. 적은 액션, 짧은 결과물, 그리고 대략 7분의 1 확률의 검증된 성공.

전문가 버전은 프롬프트에 코드 한 줄 없이 같은 작업을 처리합니다. 어디에 작업할지(소개 페이지), 무엇을 만들지(정확한 필드 세 개), 무엇으로 만들지(이미 존재하는 전송 라우트), 그리고 무엇보다 완료를 어떻게 증명할지(테스트를 실행하고 브라우저에서 폼을 보여줄 것)를 명시합니다. 이 정보 중 어느 하나도 코딩 실력을 요구하지 않습니다. 필요한 것은 자기 사이트, 자기 요구사항, 자기 기준을 아는 것, 즉 자신의 도메인입니다. 나머지는 에이전트가 이어받습니다. 페이지를 읽고, 폼을 추가하고, 라우트를 연결하고, 검증 로직을 작성하고, 테스트를 실행합니다. 이것이 연구가 말하는 12개 액션의 연쇄이며, 이를 촉발한 것은 작성자의 기술적 재능이 아니라 프롬프트의 정확성입니다.

전문가 프롬프트를 쓰는 데는 초보 버전보다 30초쯤 더 걸렸고, 그 30초가 에이전트가 추측할 기회를 전부 제거했습니다. 시연 전체가 한 문장에 담깁니다. 같은 도구도 요청에 도메인이 실리면 5배 더 생산적이 됩니다.

한 단계 올라가는 세 가지 습관

첫 번째 습관은 에이전트가 잘못 추측하기 전에, 당신만 아는 맥락을 먼저 주는 것입니다. 분류기는 이것을 지시 정확성이라고 부릅니다. 모든 요청은 어디에 작업할지, 무엇으로 할지, 완료된 상태가 어떤 모습인지를 말해야 합니다. 세 문장이면 충분하고, 코드만이 아니라 어떤 직무에도 통합니다. 타깃 청중, 제약 조건, 완료 조건을 담은 마케팅 프롬프트도 같은 세 블록을 채웁니다. 어느 블록 하나를 채울 수 없다면, 모호함이 에이전트가 아니라 당신 쪽에 있다는 신호이며, 세션을 시작하기 전에 그것부터 정리할 가치가 있습니다.

두 번째 습관은 끝에서 증거를 요구하는 것으로, 분류기의 두 번째 신호입니다. 프롬프트를 확인 가능한 완료 조건으로 끝내세요. 테스트를 실행해라, 결과를 보여줘라, 페이지가 뜨는지 확인해라. 증거를 요구하지 않으면 에이전트는 검증할 수 없는 작업물을 건네고, 연구는 바로 그것이 판정된 성공과 검증된 성공을 가르는 지점임을 보여줍니다. 그 증거는 당신을 보호하기도 합니다. 뒤에 있는 코드를 읽을 줄 몰라도 작업을 승인할 수 있게 해 주기 때문입니다.

세 번째 습관은 일이 틀어지기 시작할 때 자리를 지키는 것입니다. 에이전트가 돌려준 것을 다시 읽고, 틀렸으면 교정하고, 첫 실패에 세션을 닫지 마세요. 초보는 출력물을 수동적으로 받아들이고, 일이 막히는 순간 다른 모든 사람보다 약 4배 자주 포기합니다. 그런데 바로 그 지점에서 레벨이 값을 합니다. 문제를 자기 말로 다시 설명하고, 기대와 어긋나는 부분을 짚어주는 것이 곧 에이전트를 교정하는 일이며, 분류기의 세 번째 신호입니다. 좋은 교정의 형태는 이렇습니다. 무슨 일이 일어나고 있는지, 무엇을 기대했는지, 어디를 봐야 하는지. 여전히 코드 한 줄 없이, 격차에 대한 정직한 서술만 있으면 됩니다.

세 가지 습관은 포스트잇 한 장에 들어갑니다. 맥락을 주고, 증거를 요구하고, 자리를 지킨다. 어느 것도 코딩을 배울 필요가 없고, 셋이 합쳐져 15%와 30% 사이의 격차를 메웁니다.

이 연구가 말하지 않는 것

전문가조차 검증된 성공률은 28-33%에서 멈춥니다. 세 세션 중 둘은 목표 도달의 확실한 증거 없이 끝나며, 기껏해야 부분 성공에 그치는데, 부분 성공률은 90%를 넘기긴 합니다. 한 단계 올라가면 확률이 두 배가 되지만, 에이전트가 무결해지는 것은 아닙니다.

관리직의 순위에도 주의가 필요합니다. Anthropic은 측정 편향의 가능성을 언급합니다. 검증된 성공에는 사용자의 명시적 확인도 포함되는데, 작업이 검증되었다고 분명하게 확인해 주는 것은 관리자의 반사적 습관이기 때문입니다. 게다가 이 연구는 Claude Code 세션을 측정한 것이고, 터미널 도구의 사용자층은 이미 평균보다 동기가 높으므로, ChatGPT나 다른 도구에서도 같은 숫자가 나온다는 보장은 없습니다. 소수점이 아니라 전체적인 기울기를 기억하세요. 정확성은 보상받고, 증거는 보상받고, 그리고 아무도 확실성의 3분의 1을 넘지 못합니다.

당신의 레벨은 낙인이 아니다

코딩을 못해도 뛰어들어야 할까요? 연구는 집단별로 답합니다. 자기 업을 속속들이 안다면, 즉 자기 도메인, 자기 고객, 좋은 결과가 무엇인지 안다면, 답은 예입니다. 당신은 결정의 절반 중 중요한 쪽, 계획하는 절반을 정확히 가져오는 것입니다. 하지만 아직 이해하지 못하는 주제에 걸어 들어간다면, 에이전트는 그 공백을 채워주지 않습니다. 우리의 문의 폼이 엉뚱한 페이지에 놓였던 것처럼, 추측으로 메울 뿐입니다.

결론은 결정 하나에 담깁니다. 코드를 모른다는 사실을 핸디캡으로 취급하지 말고, 문제에 대한 지식을 진짜 자본으로 취급하기 시작하세요. 분류기는 당신이 누구인지가 아니라 세션 안에서 어떻게 일하는지를 평가하며, 그것은 바로 다음 세션부터 바뀔 수 있습니다. 요청에 당신의 맥락을 담아 쓰고, 요구하는 증거로 끝맺고, 일이 막히면 닫는 대신 다시 표현하세요. 코딩을 못해도 출발선의 확률은 모두와 같습니다. 이 연구가 400,000개의 세션으로 방금 증명했습니다.

출처

자주 묻는 질문

Anthropic의 Claude Code 세션 400,000개 연구는 무엇을 발견했나요?
분류기가 235,000명의 Claude Code 세션 400,000개(2025년 10월부터 2026년 4월까지)를 평가한 결과, 성공을 예측하는 것은 코딩 실력이 아니라 도메인 전문성이었습니다. 관리직의 검증된 성공률이 가장 높았고, 비소프트웨어 직군은 34%인 소프트웨어 직군에 대해 29%를 기록했습니다.
코딩을 몰라도 Claude Code를 쓸 수 있나요?
자기 도메인을 안다면 가능합니다. 일반적인 세션에서 인간은 계획 결정의 약 70%를 내리지만 실행 결정은 20%만 내리므로, 어떻게 작성할지보다 무엇을 만들지 아는 것이 더 중요합니다. 코드를 쓰지 않는 사람들도 전문 개발자와 거의 같은 비율로 작동하는 코드를 내놓습니다.
Anthropic 연구에서 검증된 성공이란 무엇인가요?
검증된 성공은 목표 도달의 증거를 요구합니다. 통과한 테스트, 커밋, 또는 사용자의 명시적 확인입니다. 분류기가 목표에 도달했다고 판단만 하면 되는 판정된 성공보다 엄격한 기준이며, 전문가조차 세션의 28-33%만 검증에 도달합니다.
Anthropic은 AI 사용자의 전문성 레벨을 어떻게 측정하나요?
분류기가 세 가지 행동 신호로 각 세션을 초보부터 전문가까지 5단계 척도로 평가합니다. 지시의 정확성, 사용자가 에이전트에게 검증을 요청하는 내용, 그리고 사용자와 에이전트가 서로를 교정하는지 여부입니다. 직함은 전혀 보지 않으므로, 같은 사람이 어떤 작업에서는 전문가로, 다른 작업에서는 초보로 평가될 수 있습니다.
AI 코딩 에이전트에서 초보와 전문가의 프롬프트를 가르는 것은 무엇인가요?
전문가의 프롬프트에는 도메인 맥락이 실립니다. 어디에 작업할지, 무엇을 만들지, 무엇으로 만들지, 그리고 테스트 실행 같은 확인 가능한 완료 조건입니다. 전문가 프롬프트 하나는 약 12개의 에이전트 액션과 3,200단어의 산출물을 촉발하는 반면, 일반적인 초보 프롬프트는 5개 액션과 600단어에 그치며, 검증된 성공률은 두 배 차이가 납니다.
AI 코딩 에이전트에서 개발자가 여전히 유리한가요?
약간은 그렇습니다. 코드를 생산하는 세션에서 소프트웨어 직군은 34%를 검증하는 반면 나머지는 29%로, 7개월 동안 안정적으로 유지된 5포인트 격차입니다. 부분 성공에서는 89% 대 88%로 두 집단이 동률입니다.

관련 영상