AIDive

Gói video

400,000 phiên Claude Code của Anthropic: số liệu, kết luận và checklist thứ Hai

9 phút đọc

TL;DR

  • Anthropic đã chấm điểm 400,000 phiên Claude Code của 235,000 người và thấy rằng các manager, chứ không phải kỹ sư phần mềm, có tỷ lệ thành công được xác minh cao nhất.
  • Biết code mang lại rất ít lợi thế: các nghề phần mềm đạt 34% thành công được xác minh ở các phiên tạo ra code, mọi nghề khác đạt 29%, và hai nhóm ngang nhau ở thành công một phần với 89% và 88%.
  • Thứ tạo ra khác biệt là trình độ của người dùng. Người mới nhận khoảng 5 hành động của agent và 600 từ cho mỗi prompt với tỷ lệ thành công được xác minh 15%; chuyên gia nhận 12 hành động và 3,200 từ với 28 đến 33%.
  • Ba thói quen mang lại gần như toàn bộ phần cải thiện: đưa bối cảnh của chính bạn vào prompt, kết thúc bằng một bằng chứng có thể kiểm chứng, và ở lại phiên khi nó hỏng thay vì đóng lại.
  • Trần hiệu quả thấp với mọi người: ngay cả chuyên gia cũng chỉ xác minh được tối đa một phần ba số phiên, và vị trí đứng đầu của manager có thể một phần là do sai lệch đo lường.

Các nguồn nói gì

Nghiên cứu này là một lượt phân loại trên 400,000 phiên Claude Code tương tác của 235,000 người, được ghi lại từ tháng 10 năm 2025 đến tháng 4 năm 2026 s1. Không ai đọc các cuộc hội thoại. Một bộ phân loại xây trên Sonnet 4.6 đã chấm từng phiên, và điểm của nó được đối chiếu với telemetry, tức là commit, thay đổi code và kết quả test; ở các phiên có sửa code, bộ phân loại và telemetry khớp nhau hơn 90% s1. Bản thân Claude Code là agent chạy trong terminal, đọc file, viết code và chạy lệnh từ một yêu cầu bằng ngôn ngữ thường s2.

Ba định nghĩa quyết định cách đọc mọi con số. Thành công được xác minh nghĩa là bộ phân loại tìm thấy bằng chứng cứng rằng mục tiêu đã đạt, gồm test pass hoặc xác nhận rõ ràng từ người dùng. Thành công một phần nghĩa là mục tiêu ít nhất đã đạt được một phần. Chuyên môn không phải chức danh: bộ phân loại chấm cách người dùng hành xử trong phiên, trên năm cấp từ người mới đến chuyên gia, dựa trên ba tín hiệu: độ chính xác của chỉ dẫn, những gì người dùng yêu cầu agent kiểm chứng, và việc người dùng có sửa lại agent hay không s1.

Kết quả theo nghề nghiệp là điểm nhấn chính. Ở các phiên tạo ra code, các nghề phần mềm đạt 34% thành công được xác minh và mọi người khác đạt 29%, chênh lệch năm điểm ổn định suốt bảy tháng trong khi cả hai nhóm đều cải thiện s1. Về thành công một phần, hai nhóm ngang nhau, 89% so với 88% s1. Mười nhóm nghề lớn nhất đều nằm trong khoảng bảy điểm so với lập trình viên, và nhóm quản lý đứng đầu s1. Anthropic gọi yếu tố dự báo thực sự quan trọng là chuyên môn lĩnh vực: hiểu sâu vấn đề bạn đang giải quyết.

Cách phân chia công việc giải thích lý do. Trong một phiên điển hình, con người đưa ra khoảng 70% quyết định lập kế hoạch, tức là xây cái gì, nhưng chỉ 20% quyết định thực thi, tức là viết như thế nào s1. Một manager biết chính xác sản phẩm phải làm gì đang nắm nửa quan trọng. Sự chuyển dịch tương tự thể hiện ở việc người ta dùng agent để làm gì: trong bảy tháng, tỷ lệ phiên debug giảm từ 33% xuống 19%, chạy phần mềm tăng từ 14% lên 21%, phân tích dữ liệu và viết tài liệu gần như tăng gấp đôi, trong khi giá trị ước tính của tác vụ trung bình giao cho agent tăng 27% s1.

Tính tự chủ khiến mỗi câu nặng ký hơn. Một phiên điển hình chỉ có khoảng bốn lượt trao đổi giữa người dùng và agent, mỗi prompt kích hoạt trung bình khoảng mười hành động, và đôi khi một prompt kích hoạt hơn một trăm hành động s1. Khi bạn chỉ nói bốn lần, độ chính xác của từng dòng gần như là toàn bộ đóng góp của bạn.

Các con số thực tế nằm ở bậc thang trình độ. Người mới viết chỉ dẫn chung chung, không có kiến thức lĩnh vực; mỗi prompt kích hoạt khoảng 5 hành động của agent và trả về khoảng 600 từ kết quả, và thành công được xác minh dừng ở 15% s1. Chuyên gia viết prompt đầy bối cảnh; cùng agent đó nối chuỗi 12 hành động và tạo ra 3,200 từ cho mỗi chỉ dẫn, và thành công được xác minh nằm giữa 28% và 33% s1. Đó là khoảng gấp năm lần khối lượng công việc và gấp đôi tỷ lệ thành công từ cùng một công cụ, cùng một gói đăng ký, với người ngồi trước bàn phím là biến số duy nhất. Gần như toàn bộ mức tăng nằm giữa người mới và trình độ trung cấp, đúng là bước mà ba thói quen bên dưới đề cập.

Các thói quen tương ứng với ba tín hiệu của bộ phân loại. Độ chính xác của chỉ dẫn: nói rõ hành động ở đâu, với cái gì, và kết quả hoàn chỉnh trông như thế nào. Kiểm chứng: kết thúc prompt bằng một điều kiện có thể kiểm tra, chạy test, cho tôi xem bản render, xác nhận trang tải được; nghiên cứu cho thấy đây là điều phân biệt thành công được đánh giá với thành công được xác minh s1. Sửa lỗi: người mới chấp nhận kết quả một cách thụ động và bỏ cuộc nhiều gấp bốn lần so với người dùng khác ngay khi có gì đó hỏng, trong khi việc diễn đạt lại vấn đề bằng lời của bạn chính là thứ tín hiệu thứ ba đo s1. Không thói quen nào trong ba cái đòi hỏi một dòng code.

Giới hạn được chính nghiên cứu nêu rõ. Ngay cả chuyên gia cũng chỉ xác minh 28% đến 33% số phiên, nghĩa là hai trên ba phiên kết thúc mà không có bằng chứng cứng rằng mục tiêu đã đạt, tốt nhất là thành công một phần, và con số này vượt 90% s1. Xếp hạng của manager có thể mang sai lệch đo lường: thành công được xác minh tính cả các xác nhận rõ ràng của người dùng, và việc xác nhận rõ ràng rằng công việc được chấp nhận là thói quen của manager s1. Và mẫu nghiên cứu là người dùng Claude Code, một nhóm dùng dòng lệnh vốn có động lực cao hơn mức trung bình, nên không có gì đảm bảo con số tương tự ở công cụ khác s1. Thread cộng đồng về mẹo cho người mới là phép kiểm tra hợp lý từ hướng ngược lại: lời khuyên mọi người dành cho người mới khớp với ba tín hiệu, đưa bối cảnh, yêu cầu kiểm tra, tiếp tục điều hướng s3.

Kết luận: nghiên cứu ủng hộ điều gì

Nhận định Trạng thái Cơ sở
Bạn cần biết code để có code chạy được từ agent Bỏ qua 34% so với 29% được xác minh, 89% so với 88% một phần, manager đứng đầu s1
Đưa bối cảnh của chính bạn vào prompt có hiệu quả Giữ 5 so với 12 hành động, 600 so với 3,200 từ mỗi prompt giữa người mới và chuyên gia s1
Kết thúc prompt bằng điều kiện chứng minh có hiệu quả Giữ Kiểm chứng là một trong ba tín hiệu của bộ phân loại; nó phân biệt thành công được đánh giá với thành công được xác minh s1
Ở lại phiên sau khi thất bại có hiệu quả Giữ Người mới bỏ cuộc nhiều gấp bốn lần; sửa lỗi là tín hiệu thứ ba s1
Đạt trình độ chuyên gia làm agent đáng tin cậy Bỏ qua Chuyên gia vẫn chỉ xác minh 28 đến 33% số phiên s1
Manager giỏi việc này hơn kỹ sư Thử, cẩn trọng Có thể có sai lệch: thành công được xác minh tính cả xác nhận rõ ràng của người dùng s1
Các con số này áp dụng được cho công cụ AI khác Bỏ qua Mẫu chỉ gồm người dùng Claude Code s1

Làm việc này vào thứ Hai

  • Lấy prompt cuối cùng bạn gửi cho agent và viết lại với ba khối: hành động ở đâu, với cái gì (file, route, dataset hoặc tài liệu hiện có), và hoàn thành trông như thế nào.
  • Thêm một mệnh đề chứng minh vào cuối mọi prompt trong tuần này: chạy test, mở trang, kiểm tra mọi link đều hoạt động, cho tôi xem diff.
  • Khi một phiên đi sai hướng, hãy viết một lời sửa trước khi đóng nó: chuyện gì đã xảy ra, bạn mong đợi gì, cần xem ở đâu. Đếm xem lượt kế tiếp sửa được bao nhiêu lần.
  • Viết ra ba điều về dự án mà chỉ bạn biết (đối tượng, ràng buộc, thứ không được thay đổi) và dán chúng lên đầu phiên tiếp theo.
  • Cho agent chạy một tác vụ không phải code, như bản nháp newsletter hoặc viết lại bảng giá, với cùng ba khối, rồi so sánh kết quả với cách làm thường ngày của bạn.
  • Ghi tally trong năm phiên: được xác minh, một phần, hoặc không có gì. So sánh với dải 15% của người mới và 28 đến 33% của chuyên gia trong nghiên cứu.
  • Nếu một khối trong prompt vẫn trống vì bạn không biết câu trả lời, hãy giải quyết nó với đồng nghiệp hoặc tài liệu trước khi chạy phiên, không phải sau.

Đọc thêm

  • Đọc phần phương pháp luận trước khi trích dẫn bất kỳ con số nào: bộ phân loại là Sonnet 4.6, được đối chiếu với telemetry với mức khớp hơn 90% ở các phiên sửa code s1.
  • Biểu đồ số hành động mỗi prompt theo trình độ là hình ảnh rõ nhất về bước nhảy từ người mới đến chuyên gia, từ 5 lên 12 hành động và từ 600 lên 3,200 từ s1.
  • Phần cơ cấu tác vụ cho thấy debug giảm từ 33% xuống 19% và chạy phần mềm tăng từ 14% lên 21% trong bảy tháng, một lập luận hữu ích khi ai đó nói agent chỉ để sửa bug s1.
  • Tỷ lệ 70% lập kế hoạch so với 20% thực thi là con số nên mang vào cuộc thảo luận trong team về việc ai nên lái agent s1.
  • Đọc lại ghi chú về sai lệch của thành công được xác minh và các xác nhận rõ ràng của người dùng trước khi dùng kết quả của manager trong một slide s1.
  • Để biết agent thực sự hoạt động thế nào trong terminal, nó đọc, viết và chạy gì, hãy bắt đầu với trang sản phẩm s2.
  • Thread mẹo cho người mới là nơi người mới trao đổi các thói quen prompt cụ thể; hãy đọc nó với ba tín hiệu trong đầu và phân loại lời khuyên theo tín hiệu nó phục vụ s3.

Nguồn

FAQ

Nghiên cứu có nói người không biết code giỏi ngang lập trình viên không?

Không hẳn. Lập trình viên giữ lợi thế năm điểm về thành công được xác minh, 34% so với 29%, và nó ổn định suốt bảy tháng. Nghiên cứu nói lợi thế này nhỏ và trình độ của người dùng trong phiên dự báo tốt hơn nhiều so với chức danh công việc.

Thế nào là thành công được xác minh?

Bằng chứng cứng rằng mục tiêu đã đạt: test pass, một kết quả chạy được mà bộ phân loại xác nhận được từ telemetry, hoặc xác nhận rõ ràng từ người dùng. Mục cuối chính là lý do kết quả của manager có thể mang sai lệch.

Tôi có thể lên một cấp mà không cần học code không?

Có. Bộ phân loại chấm độ chính xác của chỉ dẫn, những gì bạn yêu cầu agent kiểm chứng, và việc bạn có sửa lại nó hay không. Cả ba đều là mô tả vấn đề và tiêu chuẩn của bạn, không phải code.

Vì sao trần thấp như vậy, ngay cả với chuyên gia?

Nghiên cứu chỉ tính một phiên là được xác minh khi có bằng chứng. Chuyên gia đạt 28 đến 33% được xác minh, nhưng thành công một phần vượt 90%, nên phần lớn phiên đều giao được thứ gì đó; thứ còn thiếu là bằng chứng rằng nó đã hoàn tất.