主管在 AI 寫程式上贏過開發者
Anthropic 用分類器逐一評分了 400,000 場 Claude Code 工作階段,想找出誰真的能把 coding agent 用出成果。驗證成功率最高的族群不是軟體工程師,而是管理職。研究裡前十大職業類別的成績,全都落在開發者的七個百分點以內。也就是說,不寫程式的人交付可運作程式碼的頻率,幾乎跟以此為業的人一樣高。
如果你曾經告訴自己「我不會寫程式,這些工具不適合我」,這份研究說的正好相反。會不會寫程式已經不再區分成功和失敗的人,而研究精確指出了真正起作用的是什麼。
Anthropic 實際測量了什麼
三個定義會改變你解讀後面每個數字的方式。首先是樣本:400,000 場互動式工作階段,來自 235,000 位使用者,記錄期間為 2025 年 10 月到 2026 年 4 月。Claude Code 是 Anthropic 住在終端機裡的 coding agent:你用自然語言寫下你要什麼,它就自己讀你的檔案、寫程式碼、執行指令。
Anthropic 沒有人逐字閱讀這些對話。一個建立在他們自家模型上的分類器自動評分每一場工作階段,評分結果再和遙測資料比對,也就是 commit、程式碼變更和測試結果。在有修改程式碼的工作階段上,分類器和遙測資料的一致率超過 90%。
第二是成功。研究追蹤兩種成功,這個差別貫穿全文。判定成功是指分類器認為陳述的目標已達成。驗證成功更難:它需要證據,例如通過的測試、一個 commit,或使用者明確確認結果。驗證成功是後面每個數字採用的高標準,而且是個嚴格的標準,因為很多有用的工作階段結束時並沒有留下正式證據。
第三是專業程度本身。分類器從不看你的職稱或履歷。它讀的是你在工作階段裡的行為,用從新手到專家的五級量表評分,而且只依據三個訊號:你的指示有多精確、你要求 agent 驗證什麼,以及你們雙方是否互相糾正。你的等級衡量的是你對當下那個問題的掌握度,所以同一個人可以早上在自己的本行是專家,晚上碰到新主題就變回新手。
從新手到專家的五個等級
新手一句話就能認出來:通用的指示,完全沒有摻入領域知識。專家寫的 prompt 則載滿脈絡,同一個 agent 會回應多得多的自主工作。這裡的「動作」是指 agent 的一次具體行為,例如讀一個檔案、寫一個函式,或執行一個指令。
| 指標 | 新手 | 專家 |
|---|---|---|
| 每個 prompt 觸發的 agent 動作 | 約 5 個 | 約 12 個 |
| 每個 prompt 交付的工作字數 | 約 600 字 | 約 3,200 字 |
| 驗證成功率 | 15% | 28 到 33%(中階以上) |
| 工作階段出狀況時的放棄率 | 19% | 5 到 7%(所有非新手) |
| 出狀況的工作階段轉為驗證成功的比率 | 4% | 15% |
同一個工具、同一個訂閱方案,交付的工作量差五倍。唯一改變的變數是鍵盤前的那個人。
最關鍵的細節是:幾乎所有的進步都發生在新手和中階之間,中階和專家之間的差距反而不大。你不需要變成專家才能讓成功率翻倍,你需要的是別再當新手。
最殘酷的差距出現在工作階段出狀況的時候。當 agent 陷入錯誤和壞掉的測試裡打轉,新手有 19% 的機率放棄,其他人只有 5 到 7%。而在堅持下去的人裡面,新手只能把 4% 的問題工作階段轉成驗證成功,專家能救回 15%。救回的場次幾乎是四倍,純粹因為這個人對問題的理解足以重新引導 agent,而不是看著它沉下去。等級之間的差異不會在一切順利時顯現,它在第一個卡關的地方現形。
為什麼會不會寫程式已經不重要
用 Anthropic 的說法,領域專業就是徹底理解你要解決的問題。在有產出程式碼的工作階段上,職業之間的差距既小又穩定:
| 族群 | 驗證成功 | 部分成功 |
|---|---|---|
| 軟體職業 | 34% | 89% |
| 其他所有職業 | 29% | 88% |
五個百分點的差距,在研究的七個月裡既沒有擴大也沒有縮小,而兩個族群都在持續進步。在部分成功(目標至少部分達成)上,兩個族群打平。
研究也指出了領域專業發揮作用的位置。在典型的工作階段裡,人類做了大約 70% 的規劃決策(要做什麼),但只做了 20% 的執行決策(怎麼寫)。分工早就成形:你決定「做什麼」,agent 負責「怎麼做」。一個確切知道自家產品該做什麼的主管,握著的正是最重要的那根槓桿,即使他一行都寫不出 agent 產出的程式碼。這就是管理職站上排行榜頂端的原因。
七個月的使用資料證實重心正在移動:
| 任務類型 | 研究初期 | 研究末期 |
|---|---|---|
| 除錯 | 佔工作階段的 33% | 19% |
| 執行軟體 | 14% | 21% |
| 資料分析與文件撰寫 | 基準 | 幾乎翻倍 |
人們不再只是用 agent 修程式碼,而是用它來推動自己的工作。同一期間,交給 agent 的平均任務估計價值成長了 27%。
自主性用同樣的方式重新定義你的角色。一場典型的工作階段裡,人和 agent 只有大約四次交流,每個 prompt 平均觸發約十個動作。極端情況下,單一個 prompt 有時會引發超過一百個動作:一道指令,agent 就獨自工作了相當於一個下午。你貢獻的內容每場只有幾句話,這正是它們的精確度如此重要的原因。當你只說四次話,每一句都算數。
同一個任務,新手和專家各下一次 prompt
我們用一個所有人都懂的任務重演了這個差距:幫一個小網站加上聯絡表單。
先看新手版,也就是我們一半的人還在打的那種 prompt:九個字,沒有脈絡,沒有標準。agent 不知道網站在哪裡、表單要收集什麼、訊息要送去哪,所以它會替你做出每一個決定,而你要到最後才發現它的選擇。在我們的實測裡,它把表單放到了首頁、發明了一個沒人要的電話欄位,還把送出的訊息接到一個不存在的 email 地址。這些都不是 bug。agent 用猜測填補了請求裡的空洞,而每個猜測都是一次出錯的機會。這就是被測量到的新手模式:動作少、結果短,驗證成功的機率大約七分之一。
專家版處理同一個任務,prompt 裡沒有任何一行程式碼。它說了在哪裡動手(about 頁面)、要做什麼(三個精確的欄位)、用什麼做(已經存在的傳送路由),最重要的是怎麼證明完成了(跑測試、在瀏覽器裡展示表單)。這些資訊沒有一項需要會寫程式,它需要的是了解你的網站、你的需求和你的標準,也就是你的領域。接下來 agent 全部接手:讀頁面、加表單、接路由、寫驗證、跑測試。這就是研究裡 12 個動作的連鎖,由 prompt 的精確度觸發,而不是作者的技術才華。
寫專家版 prompt 只比新手版多花大約三十秒,而這三十秒消除了 agent 所有猜測的機會。整個示範一句話就能總結:當請求載著領域知識,同一個工具的生產力變成五倍。
讓你升一級的三個習慣
第一個習慣是在 agent 猜錯之前,給出只有你知道的脈絡。分類器稱之為指示精確度。每個請求都應該說清楚在哪裡動手、用什麼做,以及「完成」長什麼樣子。三句話就夠,而且適用於任何工作,不只是程式碼:一個寫明受眾、限制條件和完成標準的行銷 prompt,檢查的是同樣三個區塊。如果你有一個區塊填不出來,那就是訊號:模糊的是你這邊,不是 agent,值得在開工前先釐清。
第二個習慣是在結尾要求證據,這是分類器的第二個訊號。用可檢查的完成條件收尾你的 prompt:跑測試、把結果給我看、確認頁面能載入。你不要求證據的 agent,交給你的就是無法驗證的工作,而研究顯示,這正是判定成功和驗證成功的分界。這份證據也保護你,因為它讓你不需要看懂背後的程式碼,也能簽核這份工作。
第三個習慣是在事情開始出錯時留在迴圈裡。重讀 agent 回傳的內容,錯了就糾正,別在第一次失敗就關掉工作階段。新手被動接受輸出,一卡關就放棄的頻率大約是其他人的四倍,但這恰恰是等級發揮價值的地方。用自己的話重新解釋問題、指出哪裡和你的預期不符,這就是糾正 agent,也是分類器的第三個訊號。好的糾正長這樣:現在發生什麼、預期是什麼、該去哪裡看。仍然不需要一行程式碼,只需要誠實描述落差。
三個習慣一張便利貼就寫得下:給出你的脈絡、要求證據、留在迴圈裡。沒有一個需要學寫程式,而它們合起來涵蓋了 15% 到 30% 成功率之間的整段差距。
這份研究沒說的事
即使是專家,驗證成功率最高也只有 28 到 33%。三場工作階段裡有兩場結束時沒有目標達成的確切證據,頂多是部分成功,那個數字倒是爬到 90% 以上。升一級能讓你的勝率翻倍,但不會讓 agent 變得不會出錯。
管理職的排名也值得留意。Anthropic 指出可能存在測量偏差,因為驗證成功也計入使用者的明確確認,而清楚說出「這份工作驗證通過了」正是主管的反射動作。此外,這份研究測量的是 Claude Code 的工作階段,一個終端機工具,它的使用者本來就比平均更有動機,所以沒有任何保證同樣的數字在 ChatGPT 或其他工具上成立。記住整體的趨勢,別記小數點:精確有回報,證據有回報,而沒有人能超過三分之一的確定性。
你的等級不是標籤
不會寫程式,該不該跳進來?研究按族群給了答案。如果你對自己的本行瞭若指掌(你的領域、你的客戶、好結果長什麼樣),那就放手去做。你帶來的正是決策裡最重要的那一半,規劃的那一半。但如果你踏進的是一個你還不理解的主題,agent 不會替你填補那個空洞,它會用猜測塞滿它,就像我們的聯絡表單落在錯的頁面上。
結論濃縮成一個決定:別再把不會寫程式當成障礙,開始把你對問題的理解當成你真正的資本。分類器評的不是你是誰,而是你在工作階段裡怎麼工作,而這從你的下一場就能改變。把你的脈絡寫進請求裡,用你要求的證據收尾,卡住時重新表述而不是關掉。如果你不會寫程式,你的起跑點和所有人一樣。這份研究剛用 400,000 場工作階段證明了這件事。
AIDive