AIDive

Anthropic phân tích 400,000 phiên AI: dân code thua

Bởi AIDive · Đăng ngày

Coding agent

Quản lý thắng developer khi code bằng AI

Anthropic dùng một bộ phân loại để chấm 400,000 phiên Claude Code, từng phiên một, nhằm tìm ra ai mới thực sự thành công với một coding agent. Nhóm có tỷ lệ thành công được xác minh cao nhất không phải là kỹ sư phần mềm. Đó là các nhà quản lý. Mười nhóm nghề lớn nhất trong nghiên cứu đều nằm trong khoảng bảy điểm so với developer, nghĩa là những người không viết code đang giao ra code chạy được với tỷ lệ gần bằng những người làm nghề này để kiếm sống.

Nếu bạn từng tự nhủ rằng những công cụ này không dành cho mình vì bạn không biết code, nghiên cứu này nói điều ngược lại hoàn toàn. Biết code không còn là thứ phân biệt người thành công với người thất bại, và nghiên cứu chỉ ra chính xác thứ gì mới là yếu tố quyết định.

Anthropic thực sự đo cái gì

Ba định nghĩa sẽ thay đổi cách bạn đọc mọi con số trong nghiên cứu. Thứ nhất là mẫu dữ liệu: 400,000 phiên tương tác từ 235,000 người, ghi nhận từ tháng 10 năm 2025 đến tháng 4 năm 2026. Claude Code là coding agent của Anthropic sống trong terminal: bạn viết điều mình muốn bằng ngôn ngữ thường, và nó tự đọc file, viết code, chạy lệnh.

Không ai ở Anthropic đọc các cuộc hội thoại đó bằng tay. Một bộ phân loại xây trên chính một model của họ chấm mọi phiên một cách tự động, và điểm chấm được đối chiếu với telemetry, tức là các commit, các thay đổi code và kết quả test. Trên những phiên có sửa code, bộ phân loại và telemetry khớp nhau hơn 90 phần trăm số lần.

Thứ hai là thành công. Nghiên cứu theo dõi hai loại, và sự khác biệt này chi phối mọi thứ phía sau. Một thành công được chấm nghĩa là bộ phân loại tin rằng mục tiêu đã đạt. Một thành công được xác minh khó hơn: nó cần bằng chứng, chẳng hạn test chạy đạt, một commit, hoặc người dùng xác nhận rõ ràng kết quả. Thành công được xác minh là chuẩn cao đứng sau mọi con số bên dưới, và đó là một chuẩn khắt khe, vì rất nhiều phiên hữu ích kết thúc mà không có bằng chứng chính thức.

Thứ ba là chính khái niệm chuyên môn. Bộ phân loại không bao giờ nhìn vào chức danh hay CV của bạn. Nó đọc hành vi của bạn bên trong phiên và chấm trên thang năm bậc từ novice đến expert, chỉ dựa trên ba tín hiệu: chỉ dẫn của bạn chính xác đến đâu, bạn yêu cầu agent kiểm chứng những gì, và hai bên có sửa lỗi cho nhau hay không. Bậc của bạn đo độ nắm vấn đề trong phiên đó, nên cùng một người có thể là expert với nghề của mình buổi sáng và là novice với một chủ đề mới ngay tối hôm đó.

Năm bậc, từ novice đến expert

Một novice nhận ra được trong một câu: chỉ dẫn chung chung, không gói theo chút kiến thức chuyên môn nào. Một expert viết những prompt nặng ngữ cảnh, và cùng một agent đáp lại bằng lượng công việc tự chủ lớn hơn hẳn. Một hành động ở đây là một bước cụ thể của agent, như đọc một file, viết một hàm, hay chạy một lệnh.

Chỉ số Novice Expert
Hành động của agent mỗi prompt ~5 ~12
Số từ công việc giao ra mỗi prompt ~600 ~3,200
Tỷ lệ thành công được xác minh 15% 28 đến 33% (từ trung cấp trở lên)
Tỷ lệ bỏ cuộc khi phiên trục trặc 19% 5 đến 7% (mọi nhóm không phải novice)
Phiên trục trặc chuyển thành thành công được xác minh 4% 15%

Đó là gấp năm lần lượng công việc giao ra, từ cùng một công cụ trên cùng một gói thuê bao. Biến số duy nhất thay đổi là người ngồi trước bàn phím.

Chi tiết quan trọng nhất: gần như toàn bộ mức tăng nằm giữa novice và trung cấp, còn khoảng cách giữa trung cấp và expert khá khiêm tốn. Bạn không cần trở thành expert để nhân đôi tỷ lệ thành công. Bạn chỉ cần ngừng là một novice.

Khoảng cách phũ phàng nhất lộ ra khi phiên làm việc gặp sự cố. Khi agent xoáy vào vòng lỗi và test hỏng, novice bỏ cuộc 19 phần trăm số lần, so với 5 đến 7 phần trăm ở mọi nhóm còn lại. Trong số những người bám trụ, novice chỉ chuyển được 4 phần trăm các phiên trục trặc đó thành thành công được xác minh, trong khi expert chuyển được 15 phần trăm. Tức là số phiên được cứu nhiều gần gấp bốn, thuần túy vì người đó hiểu vấn đề đủ sâu để bẻ lái agent thay vì ngồi nhìn nó chìm. Sự khác biệt giữa các bậc không hiện ra khi mọi thứ chạy trơn tru. Nó hiện ra ở trục trặc đầu tiên.

Vì sao biết code không còn quan trọng

Kiến thức chuyên môn, theo cách gọi của Anthropic, là hiểu vấn đề bạn đang giải, hiểu đến tận gốc. Trên các phiên tạo ra code, khoảng cách giữa các nhóm nghề nhỏ và ổn định:

Nhóm Thành công được xác minh Thành công một phần
Nghề phần mềm 34% 89%
Mọi nghề khác 29% 88%

Năm điểm chênh lệch, một khoảng cách không nới rộng cũng không thu hẹp suốt bảy tháng của nghiên cứu, trong khi cả hai nhóm đều tiến bộ. Về thành công một phần, tức mục tiêu đạt được ít nhất một phần, hai nhóm hòa nhau.

Nghiên cứu cũng chỉ ra kiến thức chuyên môn tác động ở đâu. Trong một phiên điển hình, con người đưa ra khoảng 70 phần trăm các quyết định lập kế hoạch (xây cái gì) nhưng chỉ 20 phần trăm các quyết định thực thi (viết thế nào). Sự phân chia đã sẵn đó: bạn quyết định cái gì, agent lo phần làm thế nào. Một quản lý biết chính xác sản phẩm của mình phải làm gì đang nắm đúng cần gạt quan trọng, dù không viết nổi một dòng trong những gì agent tạo ra. Đó là lý do các nhà quản lý đứng đầu bảng xếp hạng.

Cách sử dụng qua bảy tháng quan sát xác nhận trọng tâm đang dịch chuyển:

Loại task Đầu nghiên cứu Cuối nghiên cứu
Debug 33% số phiên 19%
Chạy phần mềm 14% 21%
Phân tích dữ liệu và viết tài liệu mốc ban đầu tăng gần gấp đôi

Mọi người không còn chỉ dùng agent để sửa code; họ dùng nó để vận hành công việc. Cùng kỳ, giá trị ước tính của task trung bình giao cho agent tăng 27 phần trăm.

Tính tự chủ định hình lại vai trò của bạn theo cùng cách. Một phiên điển hình chỉ có khoảng bốn lượt trao đổi giữa người và agent, và mỗi prompt kích hoạt trung bình khoảng mười hành động. Ở mức cực đoan, một prompt duy nhất đôi khi kéo theo hơn một trăm hành động: một chỉ dẫn, và agent làm việc một mình tương đương cả một buổi chiều. Những gì bạn đóng góp gói gọn trong vài câu mỗi phiên, và chính vì thế độ chính xác của chúng nặng ký đến vậy. Khi bạn chỉ lên tiếng bốn lần, từng câu đều đáng giá.

Cùng một task, prompt kiểu novice và kiểu expert

Chúng tôi tái hiện sự khác biệt trên một task ai cũng hiểu: thêm form liên hệ vào một website nhỏ.

Phiên bản novice là kiểu prompt mà một nửa chúng ta vẫn gõ: chín từ, không ngữ cảnh, không tiêu chí. Agent không biết site nằm ở đâu, form thu thập gì, tin nhắn gửi về đâu, nên nó tự đưa ra mọi quyết định đó thay bạn, và bạn chỉ phát hiện các lựa chọn của nó ở phút cuối. Trong lần chạy của chúng tôi, nó đặt form lên trang chủ, bịa ra một trường số điện thoại không ai yêu cầu, và nối phần gửi tin về một địa chỉ email không tồn tại. Không có gì trong đó là bug. Agent lấp các lỗ hổng trong yêu cầu bằng phỏng đoán, và mỗi phỏng đoán là một cơ hội để sai. Đó chính là mẫu hành vi novice được đo: ít hành động, kết quả ngắn, và khoảng một phần bảy cơ hội có được thành công được xác minh.

Phiên bản expert xử lý cùng task đó mà không có một dòng code nào trong prompt. Nó nói rõ chỗ cần làm (trang about), cần xây gì (ba trường cụ thể), xây bằng gì (route gửi tin đã có sẵn), và trên hết là cách chứng minh đã xong (chạy test và hiển thị form trong trình duyệt). Không mẩu thông tin nào trong đó đòi hỏi biết code. Nó đòi hỏi biết site của bạn, nhu cầu của bạn và chuẩn của bạn, tức là chuyên môn của bạn. Agent tiếp quản từ đó: đọc trang, thêm form, nối route, viết validation, chạy test. Đó chính là chuỗi 12 hành động của nghiên cứu, được kích hoạt bởi độ chính xác của prompt, không phải bởi tài năng kỹ thuật của người viết nó.

Viết prompt kiểu expert mất thêm khoảng ba mươi giây so với bản novice, và ba mươi giây đó xóa sạch mọi cơ hội để agent phải đoán. Cả màn trình diễn gói trong một câu: cùng một công cụ trở nên năng suất gấp năm khi yêu cầu mang theo chuyên môn.

Ba thói quen giúp bạn lên một bậc

Thói quen thứ nhất là đưa ra phần ngữ cảnh chỉ mình bạn biết, trước khi agent đoán sai nó. Bộ phân loại gọi đây là độ chính xác của chỉ dẫn. Mỗi yêu cầu nên nói rõ làm ở đâu, làm với gì, và thế nào là xong. Ba câu là đủ, và cách này áp dụng cho mọi nghề, không riêng gì code: một prompt marketing với đối tượng, các ràng buộc và vạch đích cũng tick đủ ba ô đó. Nếu bạn không điền nổi một trong các ô, đó là tín hiệu sự mơ hồ nằm ở phía bạn, không phải phía agent, và đáng để làm rõ trước khi mở phiên.

Thói quen thứ hai là đòi bằng chứng ở cuối, tín hiệu thứ hai của bộ phân loại. Kết thúc prompt bằng một điều kiện hoàn thành kiểm chứng được: chạy test, cho tôi xem kết quả, kiểm tra trang tải được. Một agent không bị đòi bằng chứng sẽ giao cho bạn công việc không thể kiểm chứng, và nghiên cứu cho thấy đó chính xác là thứ tách một thành công được chấm khỏi một thành công được xác minh. Bằng chứng đó cũng bảo vệ bạn, vì nó cho phép bạn nghiệm thu công việc mà không cần biết đọc phần code đằng sau.

Thói quen thứ ba là bám sát vòng lặp khi mọi thứ bắt đầu hỏng. Đọc lại những gì agent trả về, sửa nó khi nó sai, và đừng đóng phiên ở thất bại đầu tiên. Novice nhận output một cách thụ động và bỏ cuộc nhiều hơn khoảng bốn lần so với mọi người khác ngay khi có trục trặc, thế nhưng đây chính là chỗ đẳng cấp được trả công. Giải thích lại vấn đề bằng lời của bạn và chỉ ra chỗ không khớp với kỳ vọng chính là sửa lỗi cho agent, tín hiệu thứ ba của bộ phân loại. Hình dạng của một lần sửa tốt: chuyện gì đang xảy ra, đáng lẽ phải thế nào, cần nhìn vào đâu. Vẫn không một dòng code, chỉ là mô tả trung thực về khoảng cách.

Ba thói quen vừa vặn một tờ giấy nhớ: đưa ngữ cảnh của bạn, đòi bằng chứng, bám sát vòng lặp. Không thói quen nào đòi hỏi học code, và gộp lại chúng bao trọn khoảng cách giữa 15 và 30 phần trăm thành công.

Những gì nghiên cứu không nói

Ngay cả với expert, thành công được xác minh chỉ chạm trần từ 28 đến 33 phần trăm. Hai phần ba số phiên kết thúc mà không có bằng chứng chắc chắn rằng mục tiêu đã đạt, tốt nhất cũng chỉ là một thành công một phần, con số này thì vượt 90 phần trăm. Lên một bậc nhân đôi cơ hội của bạn; nó không làm agent trở nên không thể sai.

Thứ hạng của các nhà quản lý cũng cần một lời dè chừng riêng. Anthropic lưu ý khả năng có thiên lệch đo lường, vì thành công được xác minh cũng tính cả những xác nhận rõ ràng từ người dùng, mà xác nhận rành mạch rằng công việc đã được nghiệm thu lại là phản xạ nghề nghiệp của quản lý. Thêm nữa, nghiên cứu đo các phiên Claude Code, một công cụ terminal có lượng người dùng vốn đã nhiệt tình hơn mức trung bình, nên không gì bảo đảm các con số này giữ nguyên trong ChatGPT hay bất kỳ công cụ nào khác. Hãy giữ lấy chiều dốc chung, đừng bám vào số lẻ: độ chính xác được trả công, bằng chứng được trả công, và không ai vượt qua một phần ba độ chắc chắn.

Bậc của bạn không phải nhãn dán

Vậy có nên nhảy vào nếu bạn không biết code? Nghiên cứu trả lời theo nhóm. Nếu bạn thuộc nghề của mình đến tận chân tơ kẽ tóc (lĩnh vực của bạn, khách hàng của bạn, thế nào là một kết quả tốt), thì có, hãy làm. Bạn đang mang đến đúng nửa số quyết định quan trọng, nửa lập kế hoạch. Nhưng nếu bạn bước vào một chủ đề mình chưa hiểu, agent sẽ không lấp khoảng trống đó; nó sẽ nhồi vào đó các phỏng đoán, như chiếc form liên hệ rơi nhầm trang.

Bài học rút ra nằm gọn trong một quyết định: ngừng coi việc không biết code là khuyết tật, và bắt đầu coi hiểu biết về vấn đề là vốn liếng thật của bạn. Bộ phân loại không chấm bạn là ai; nó chấm cách bạn làm việc bên trong phiên, và điều đó có thể thay đổi ngay từ phiên kế tiếp. Hãy viết yêu cầu kèm ngữ cảnh của bạn, kết thúc bằng bằng chứng bạn đòi hỏi, và khi nó tắc, hãy diễn đạt lại thay vì đóng phiên. Nếu bạn không biết code, bạn khởi đầu với cơ hội ngang mọi người khác. Nghiên cứu vừa chứng minh điều đó trên 400,000 phiên.

Nguồn

Câu hỏi thường gặp

Nghiên cứu 400,000 phiên Claude Code của Anthropic phát hiện điều gì?
Một bộ phân loại đã chấm 400,000 phiên Claude Code từ 235,000 người (tháng 10 năm 2025 đến tháng 4 năm 2026) và phát hiện kiến thức chuyên môn, chứ không phải kỹ năng code, mới dự báo thành công. Các nhà quản lý có tỷ lệ thành công được xác minh cao nhất, và các nghề ngoài phần mềm đạt 29% so với 34% của nghề phần mềm.
Không biết code có dùng được Claude Code không?
Có, nếu bạn nắm vững lĩnh vực của mình. Con người đưa ra khoảng 70% quyết định lập kế hoạch nhưng chỉ 20% quyết định thực thi trong một phiên điển hình, nên biết cần xây gì quan trọng hơn biết viết thế nào. Người không biết code giao ra code chạy được với tỷ lệ gần bằng developer chuyên nghiệp.
Thành công được xác minh trong nghiên cứu của Anthropic là gì?
Một thành công được xác minh đòi hỏi bằng chứng rằng mục tiêu đã đạt: test chạy đạt, một commit, hoặc người dùng xác nhận rõ ràng. Nó khắt khe hơn thành công được chấm, khi bộ phân loại chỉ tin rằng mục tiêu đã hoàn thành. Ngay cả expert cũng chỉ xác minh được 28-33% số phiên.
Anthropic đo bậc chuyên môn của người dùng AI như thế nào?
Một bộ phân loại chấm mỗi phiên trên thang năm bậc từ novice đến expert dựa trên ba tín hiệu hành vi: độ chính xác của chỉ dẫn, những gì người dùng yêu cầu agent kiểm chứng, và việc người dùng với agent có sửa lỗi cho nhau hay không. Nó không nhìn vào chức danh, nên cùng một người có thể được chấm expert ở task này và novice ở task khác.
Điều gì phân biệt prompt của novice và của expert với coding agent?
Prompt của expert mang theo ngữ cảnh chuyên môn: làm ở đâu, xây gì, xây bằng gì, và một điều kiện hoàn thành kiểm chứng được như chạy test. Mỗi prompt kiểu expert kích hoạt khoảng 12 hành động của agent và 3,200 từ công việc, so với 5 hành động và 600 từ của prompt chung chung kiểu novice, với tỷ lệ thành công được xác minh gấp đôi.
Developer còn lợi thế với coding agent không?
Một lợi thế nhỏ: nghề phần mềm xác minh được 34% các phiên tạo code so với 29% của mọi người khác, khoảng cách năm điểm giữ ổn định suốt bảy tháng. Về thành công một phần hai nhóm hòa nhau ở 89% và 88%.

Video liên quan