資料來源#
- Agentic coding and persistent returns to expertise
- AI and Job Postings: From Destruction to Creation?
- Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Google AI & Economy ATLAS: AI in Science (September 2026)
- Helping People Choose Careers in the Age of AI
- Training novices to think, or giving them LLMs? Evidence from an RCT
- Uncle Bob on Software Fundamentals in the Age of AI
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews
摘要#
Anthropic 經濟研究報告 Agentic coding and persistent returns to expertise(Hitzig、Massenkoff、Lyubich、Heller、McCrory,2026 年 6 月)的核心發現是:能放大 AI 編碼代理程式效益的是使用者的領域專業知識,而非編碼能力。在約 400,000 個 Claude Code 工作階段中,一個人越了解自己正在解決的問題,代理程式每次指令執行的工作就越多,工作階段成功的頻率越高,也越能從困境中恢復。相較之下,編碼背景幾乎無關緊要:在產生程式碼的工作階段中,各主要職業與軟體工程師的差距都不超過七個百分點。報告的一句話主旨——「編碼代理程式並未取代領域專業知識;工作者帶給代理程式的理解越多,代理程式就越能完成高品質工作」——是「你可以外包思考,卻無法外包理解」的實證確認。
證據說明。
empirical— 研究運用 保護隱私的 (Clio) 分析,檢視 2025 年 10 月至 2026 年 4 月間約 235,000 人的約 400,000 次互動式工作階段,並以分類器(Claude Sonnet 4.6)對照自動遙測資料進行驗證,且採用控制變數與信賴區間檢查迴歸結果。兩項限制使它稱不上乾淨的外部基準:第一,它是第一方研究——Anthropic 用自家遙測資料與分類器評估自家產品(無法由外部獨立重現);第二,它排除無頭模式(claude -p)、SDK 與第三方 IDE 的使用,這些占實際活動「相當大的比例」。結果是根據對話逐字稿推論的代理指標,而非實際觀察到的真實世界結果。
專業知識取決於任務,而非履歷#
專業知識評級(從新手到專家的五點量表)不等同於職稱或一般能力。「資深工程師第一次問 Rust 問題時,在 Rust 方面就是新手。從未用過 Python 的會計師,若能精確告訴 Claude 腳本必須遵守哪些對帳規則,並在月底結帳時抓出它漏掉的邊界案例,那他在這項任務上就是專家。」分類器會讀取三種訊號:
- 設定問題的精確度——使用者對工作指示得有多具體。
- 要求 Claude 驗證的內容——專家會明確說明哪些檢查才算「完成」。
- 誰糾正誰——是使用者糾正 Claude,還是 Claude 糾正使用者。
這正是可測量的理解殘餘:這些訊號是內在模型的表面證據,而該模型足以指揮、判斷並驗證工作。
放大效應:專家每次提示能驅動更多代理程式工作#
專業知識會影響每則人類提示所引發的自主工作量(行動鏈):
| 使用者專業程度 | 每次提示的動作數 | 每次提示的產出 |
|---|---|---|
| 新手 | ~5 | ~600 字 |
| 專家 | ~12 | ~3,200 字 |
動作數超過兩倍,產出是五倍。這個差距在每種工作模式與每個任務價值區間內都成立,也通過控制工作模式、任務價值、月份、職業與模型系列的迴歸分析:專業程度每升一級,動作增加 9%,產出增加 13%(每個相鄰級距的 p < 0.001)。專家並非只是運氣更好——他們給的每項指令,都能安全地讓代理程式多走一段。
成功梯度#
工作階段展現的專業知識越多,各種衡量方式下成功的機率就越高。成功有兩種定義:判定成功(分類器讀取逐字稿,判斷使用者是否達成目標)以及更嚴格的可驗證成功(判定成功,且至少有一項明確的外部訊號——相符的 commit/PR、測試通過,或使用者明確肯定)。
| 專業程度 | 可驗證成功 | 至少部分成功 |
|---|---|---|
| 新手 | 15% | 77% |
| 中階至專家 | 28–33% | 91–92% |
**曲線是凹形的:大部分增益發生在新手到中階;中階到專家的增益不大。**只要對領域有基本掌握,就能得到大部分好處;深入精通只會再增加一點。(這些是調整後的比例——比較工作模式、價值區間、月份、主題與職業類型相同的工作階段。)
關於恢復能力還有兩項推論,專業知識在這方面特別有價值:
- 從困境中恢復。在「遇到困境」的工作階段(出現經驗證的失敗訊號——錯誤、測試失敗、反覆嘗試、使用者挫折)中,可驗證成功率從新手的 4% 升至專家的 15%;部分成功率則從 60% 升至 80–81%。專業知識的價值之一,就是能引導陷入困境的代理程式重回正軌。(注意:專家較少遇到困境,因此他們遇到困境的工作階段本來就較難——困境工作階段的估計任務價值從新手到專家約增加一倍——所以部分恢復差距反映的是新手卡在例行問題上,專家則卡在真正困難的問題上。)
- **放棄。**若困境中的工作階段被判定失敗,而且沒有寫出任何程式碼,就視為放棄。**新手工作階段有 19% 以放棄告終,其他人則為 5–7%。**經驗最少的人一旦卡住就會放棄。
職業的影響小於專業知識#
故事的另一面,也是支持軟體普及化的最有力證據:編碼背景對編碼成功的影響正逐漸降低。職業是透過推論得出(分類器明確被要求不可把編碼行為本身當成編碼職業的證據——替合約條款檢查寫腳本的律師會歸為法律,而非軟體)。
- 軟體相關職業整體工作階段的可驗證成功率約為 30%;其他專業約為 26%。在產生程式碼的工作階段中,兩者分別是 34% 與 29%,部分成功率則為 89% 與 88%。
- 在產生程式碼的工作階段中,十大職業每一種與軟體工程師的可驗證成功率差距都在七個百分點以內;軟體與非軟體職業之間五個百分點的差距,七個月來既未擴大,也未縮小。
- **管理職業的可驗證成功率略高於軟體工程師。**報告的解讀是:管理技能(委派、明確說明、確認成果)可以轉用於指揮代理程式——「管理者或許因此更容易成功」。(測量上的保留:可驗證成功部分依賴逐字稿中的明確確認,而經理可能只是比較常說出自己是否得到想要的結果。)這是《哈佛商業評論》的問責批判的建設性對照——有界限的委派技能有幫助;把代理程式當成員工的組織架構框架則會適得其反。
這對勞動市場的意義#
報告將自身定位為知識工作轉型的初步觀察。兩種解讀表面上看似緊張,實則可以並存:
- **取代編碼技能。**過去需要編碼背景的實作型工作正被吸收;「編碼背景對成功寫程式正變得較不重要」。這就是地板抬高——「任何領域中熟悉該領域的人,如今或許都能完成以前做不到的技術工作。」
- **獎勵領域理解。**同時,能真正掌握問題的人獲得更大增益。「缺乏這種專業知識的人,從同一工具得到的助益會少得多。」這是人類比較優勢的殘餘在使用資料中的呈現:關鍵不是寫程式,而是知道該打造什麼,並且有能力驗證成果。
報告指出一項值得追蹤的指標:如果專業知識的回報開始隨時間下降,就代表模型開始提供使用者目前帶來的判斷力——也就是品味變成「另一項能力」。就目前資料而言,這項回報仍持續存在。
以職缺定價的專業溢價。Indeed Hiring Lab(Gallacher,2026 年 7 月)從招募端觀察到相同趨勢,而非從工作階段內部觀察。從 Claude Code 於 2025 年 2 月推出到 2026 年年中,美國軟體開發職缺增加約 15%,整體職缺則下滑 7%——但反彈集中在特定職缺:2025 年 5 月至 2026 年 5 月的增幅中,71% 來自資深職位,37% 來自職稱提及 AI 的職缺(兩者有所重疊)。Gallacher 的解讀正是本文主旨的雇主版本——「對能運用 AI 的資深專業人士,需求正在成長,但這不一定代表所有軟體職位都全面復甦。」有兩點使它只能算佐證訊號,而非證明。第一,這是Indeed 分析自家求職網站的部落格文章,因此樣本只反映單一平台的職缺流量;因果說法(代理式工具提高了對專業知識的需求)是根據時間上的巧合提出,並未被識別——完整證據說明請見企業 AI 支出強度與人數成長。第二,「資深職位」指的是職稱,而非本研究衡量的任務特定專業知識:本研究的分類器會把第一次詢問 Rust 問題的資深工程師評為新手,職缺廣告卻無法做到。以資深職稱職缺需求作為目前可得的專業溢價勞動市場代理指標,已是最接近的做法,但仍很粗略。
組成檢驗:專家在自己不熟悉的任務上使用 AI#
Google ATLAS(2026 年 7 月)提供一項跨實驗室觀察,乍看與本文結論矛盾,實則揭示了運作機制。其 Gemini 資料同時呈現兩個事實:
- 使用者偏向專家。某職業的薪資中位數每增加 1%,其 AI 使用強度就高出>2.5%(控制教育程度後為 1.86);以對話量加權的美國薪資中位數則從 $62,252 上升至 $82,919。
- 任務偏向非專家領域。按照 Autor–Thompson 詞語稀有度指標,將約 19,000 項 O*NET 任務分成四個專業程度區間後,AI 使用最集中於專業知識需求最低的非例行認知任務——Q1 為基準的 2.6 倍,Q2–Q4 則大致維持在 1.6–1.8 倍。
因此,最常見的工作互動模式,是高專業知識的工作者將 AI 用於工作中最不需要專業知識的部分。從外部觀察,這正是本文的主旨:人類保留判斷力,把不需要判斷的工作交出去,這也解釋了為何專業溢價持續存在,而非逐漸消失。Autor 與 Thompson 的模型指出影響方向——自動化某職業中不需專家技能的輔助任務,會提高剩餘人類專業知識的稀缺性(薪資上升、就業下降);自動化其專家任務則會侵蝕進入門檻並壓低薪資。ATLAS 的快照指向前者。
這些限制確實存在:ATLAS 只衡量消費者介面與免費 API(不包括企業使用,也未涵蓋大規模代理式編碼),只是為期兩週的快照,沒有時間維度;其專業程度衡量方式是詞彙代理指標——任務描述中詞語的稀有度——而非本研究採用的三訊號行為分類器。兩者測量的是不同對象上的「專業知識」:ATLAS 評估的是任務,Anthropic 評估的是使用者處理任務的方式。請見任務飽和:廣泛但淺層的 AI 擴散。
相同的專業溢價,從薪資資料而非工作階段觀察(Canaries,2026 年 8 月)#
本研究在七個月間約 40 萬次工作階段中衡量專業溢價。Brynjolfsson、Chandar 與 Chen(2026 年 8 月修訂)則利用 ADP 行政薪資資料,觀察截至 2026 年 6 月的四年間數百萬名美國勞工;研究對象有所不同,但方向一致。
- **互補效益落在資深工作者身上,替代效應則落在年輕工作者身上。**依年齡區間,將職業層級就業變化(2022 年 11 月至 2026 年 6 月)與 Anthropic Economic Index 中自動化/增能查詢分類所算出的標準化自動化、互補性及整體使用曝險一併迴歸:自動化係數在 22–25 歲為 −0.098,隨年齡增加單調縮小,50 歲以上為 −0.006;互補性係數在年輕族群約為 0,只有在 **41–49 歲(+0.024**)**與 **50 歲以上(+0.015*)**才轉為顯著正值(表 3,2025 年 3 月 AEI 發布版;並以
pdftotext -layout查核,且在後續發布版合併資料上重現)。 - **而且這種關聯特別體現在默會知識上。**將編碼/默會知識指數套用至同一組追蹤資料(編碼知識與默會知識曝險),高默會知識職業中的資深工作者,成長速度高於低默會知識職業中的資深工作者——控制大學學歷比例後,此梯度仍然存在;相較之下,年輕工作者的編碼知識梯度則消失。
為什麼這是佐證,而非確認。兩項研究衡量的是不同對象;差異正是本文先前針對 Indeed「資深職位」職稱提出的同一項提醒。Anthropic 的分類器依據行為衡量任務特定專業知識——第一次詢問 Rust 問題的資深工程師會被評為新手。Canaries 完全沒有使用者層級的專業知識測量:其代理指標是年齡區間 × 職業知識類型,代表年資與職業類別,而非對眼前問題的掌握程度。因此薪資資料顯示目前受益於互補效益的是資深工作者;它無法證明他們領薪所依據的,就是本研究衡量的行為特徵。它補上的,是資料期間與規模——四年、數百萬名工作者,相較於七個月、40 萬個工作階段——而且採用不由業者提供資料的工具,恰好補足本研究自身證據說明所指出的外部佐證缺口。
**它也提供另一個較慢的前瞻檢驗指標。**本文指出應追蹤的指標是專業知識回報;若回報下降,就表示模型開始提供使用者目前帶來的判斷力。薪資資料中的對應指標,是 41–49 歲與 50 歲以上族群的互補性係數逐漸趨近於零。目前兩者方向一致:回報持續存在。
測量了專家族群,卻未按專業程度切分(2026 年 9 月)#
值得記錄這項結果,視為對測量工具的負面結果,而非支持本文主旨的證據。Google/DeepMind 在 ATLAS 後續科學研究中推出的報告(科學工作中的 AI 採用,empirical 且涉及供應商利益衝突)調查了637 位在職科學家——356 位資深職位人士(PI、教授、實驗室主任、業界 R&D 經理)、234 位職涯中期人士、47 位職涯早期人士,研究經驗平均略低於 13 年——並報告將近四分之三的人淨節省時間,平均每週 6.9 小時,46.6% 每天使用 AI。
這群受試者非常專業,卻只自陳獲得可觀的時間效益;這幾乎無法說明專業知識的回報,原因有二。第一,這是自陳資料,且贊助方的利益方向明確;樣本來自經篩選的非機率面板,作者也指出,樣本偏向熱衷 AI 的受訪者,可能高估節省時間。第二,也是更值得注意的一點:調查納入所有職涯階段的受訪者,卻沒有按職涯階段公布任何切分結果——無論是採用率、節省時數,或節省時間中有多少被用來驗證輸出都沒有。本文要測量的梯度原本可以從該資料集分析,卻沒有進行。報告唯一公布的梯度是以任務而非人為單位:其約 360K 次科學互動在 ATLAS 領域專業知識分類器上的得分,比一般工作對話高 +26%;這仍是前述詞彙代理衡量方式,只是套用到整體族群,而非任務的四分位組。
新手一端的隨機試驗——及其適用條件(2026-08)#
本文從專家端測量梯度:理解能放大效益,而且曲線呈凹形,因此新手到中階能取得大部分增益。一項預先註冊的 2×2 RCT 補上了隨機分派下的新手端資料點,而非遙測資料——其增益比遙測資料顯示的還大。Training novices to think, or giving them LLMs? Evidence from an RCT(Bocconi × OpenAI,CEPR DP21882,empirical,n=1,053 名大學一年級學生)讓一半樣本在 45 分鐘的商品銷售案例中使用 ChatGPT Edu(GPT-4o),並由 20 位受訓碩士評分者中的三位,在不知道受試者所屬條件的情況下,依兩項明確列出的行銷標準給成果評 1–5 分。取得 LLM 後,專家評分提高 +0.862 分;對照組估計分數為 2.09(標準誤 0.079,p<0.01)——約為 1.0 個標準差——解答也更接近三位獨立訪談的領域專家(餘弦相似度分別增加 +0.026/+0.028/+0.044,全部 p<0.01)。經過雙重變數選擇 lasso 控制連貫性、點子數、豐富度與所有文字風格特徵後,仍有約 42% 的效應保留下來:模型改善的是實質內容,而非只有潤飾。完全不了解領域的新手,也能產出明顯更接近專家答案的成果。
最直接挑戰本文主旨的是另一組實驗條件。同一實驗也隨機教授一項認知技能——約 6 分鐘的因果推理遊戲——而且該訓練確實改善推理能力(機制辨識約提升 0.55 個標準差、反證邏輯約提升 0.85 個標準差、解答間的點子多樣性增加 +0.47 個標準差;即使能使用模型,這些效果也沒有被擠掉)。但它對評估分數毫無幫助;係數甚至是負值(−0.111,p<0.01)。在這項任務上,放大效益的不是人類理解力,而是模型。
調和兩者的關鍵是適用條件,兩篇研究都明確指出這一點。Anthropic 衡量的是開放式代理工作:問題必須先界定、檢查方式必須說明,模型也需要有人糾正;RCT 則刻意選擇一個「LLM 很可能受過充分訓練」的問題——一套已有文件記載的行銷架構、明確編碼的評分規準、單一 45 分鐘交付成果,以及一群沒有領域專業知識可以貢獻的人。這正是專業溢價應最小的情境,而結果也確實如此:LLM 提供了原本要靠專業知識提供的內容。合併解讀後,兩項研究界定的是主張的邊界,而非互相矛盾——專業知識的回報取決於任務如何界定,而不只取決於使用者;凹形曲線的新手端恰恰在問題規格清楚到模型已經知道答案時最陡。RCT 本身對這種情境的警告,正是本文應帶走的提醒:評分規準獎勵的是模型連貫、點子密集的貼合表現,而受訓人類的獨特性反而被扣分(解答間多樣性的係數為 −7.676,約每個標準差扣 −0.29 分)。
專業知識應該從何而來(Martin,2026-08)#
本文測量的是專業知識如何放大代理程式效益,以及增益如何集中在新手到中階;但它沒有回答,代理程式吸收戰術工作後,新手要如何提升至中階——也就是人才培育管道問題。Robert C. Martin 提出本文資料集中最具體的方案,也坦言這只是猜測:「我常被問到這個問題。我沒有完美答案,因為我真的不知道」(Uncle Bob on Software Fundamentals in the Age of AI,2026-08-19,practitioner-opinion)。
他的三階段路徑:
- 寫程式,大約一年。「這樣你才知道代理程式正在處理什麼。」他將自己過去的建議——花一個週末寫組合語言,理解抽象層之下的事物——擴展成一條階梯:二進位、組合語言、C、Python,接著才是代理程式工作。
- 被當成代理程式。「剛受訓完的年輕人應該被當成代理程式。帶著一群代理程式、採取策略性工作的主任工程師,應該把你視為代理程式,交付和代理程式相同類型的任務,也要求你使用代理程式必須使用的相同確定性工具。你應該維持這種狀態好幾個月,效率低得可怕,卻學到一大堆。」
- 然後執行代理程式。「走過這一整套磨練後,也許別人就能信任你,讓你執行自己的代理程式。」
讓這個方案不只是訓練軼事的,是他指出這套磨練教會的特定技能——而那並非程式碼品質。當有人問他在 2025 年 12 月如何判斷代理程式出了問題時,他區分了兩種訊號:「一開始我只看著程式碼,覺得寫得一團糟。那不是重點。重點是接下來我看到它們卡住。我看著代理程式掙扎,而我認得那種掙扎,因為自己也經歷過。」可轉移的資產,是辨識卡住狀態的模式;這種能力來自自己曾經卡住。他也直接指出失敗之處:「問題之一是新手進來時,認不出那種掙扎」(掙扎代表什麼,請見Agentic Technical Debt)。
這個提案有三個問題,其中兩項是 Matt Pocock 當場提出的:
- 經濟成本。「如果有人只在你的公司名冊上做戰術工作,公司肯定會想:我們既然有一群五個人的強化團隊,只花一小部分成本就能勝過他,為什麼還要雇這個人?」Martin 沒有答案。刻意讓人好幾個月效率低落,是必須由某人承擔的成本;本文的發現——增益集中在新手到中階——讓這項投資對工作者而言合理,卻不代表對任何特定雇主也合理。
- **回饋迴路一直都是問題所在。**Pocock 的另一個觀點是,過去策略判斷力要花好幾年培養,因為錯誤要九個月後才會浮現,而人們早就先跳槽了。他認為代理程式可能縮短回饋迴路;若此說成立,就表示專業知識可能形成得更快,而非更慢,也會削弱學徒制的必要性。
- **這和 Martin 自己的原則相反。**他在其他地方主張,不應把人類紀律強加在代理程式身上,因為那是人類認知的適應方式(強加價值觀,而非紀律);但在此,他把代理程式的工作條件加諸人類。他沒有處理兩者的不對稱。
他的備案是閱讀:Tom DeMarco、Ed Yourdon、《The Pragmatic Programmer》——「那些老書,沒人讀,因為它們很舊……你得篩掉一些過時內容,但那些教訓就是在那個時代學到的。」
延伸連結#
-
Robert C. Martin(Uncle Bob)——學徒制提案、預期能教會的技能,以及至今沒人回答的經濟問題
-
強加價值觀,而非紀律——他自己的提案反過來違背其原則之處
-
Task Time-Horizon Scaling——將本文衡量的專業溢價改以速度比率呈現,再交由模型處理:在內部 pull request 中,缺乏程式碼庫脈絡的承包商比維護者慢 5–18 倍;而根據 CS329A 第 8 講,模型效能與承包商所需時間相關。本文歸因於領域專業知識的溢價,正是 METR 時間跨度所缺少的同一數量
-
GDPval 基準測試——刻意抹去這項溢價的基準測試;自 2026-09-10 起,依據主要論文而非講座內容更新專家門檻。任務由實務工作者撰寫——至少具備 4 年職業經驗,平均 14 年,並透過履歷審查、視訊面談、背景查核、訓練與測驗,篩選升遷和管理經驗;申請者接受率不到 10%(wiki 先前根據投影片記載「10+ 年」)——每項任務都以專家實際產出的工作成果為基礎,並將他們所有默會脈絡寫進提示中。因此,模型是在專家優勢已移交的唯一面向上接受評分。若將提示長度縮至 42%,恢復其中的模糊性,GPT-5-high 的勝出或平手率就會從 47.7% 降至 44.3%;質性失敗更嚴重:模型甚至不知道該處理什麼
-
Agent Review Comment Resolution——同樣的專業溢價也出現在審查的接收端。在 341 個程式碼庫中,核心開發者(依各程式碼庫中撰寫與審查 PR 的總數排名前 20%)處理了 Copilot 代理程式審查意見的 78.1%,而各類意見的處理比例為 70–80%;核心開發者在解決方案方向、文件、命名與程式碼組織方面的占比最高,在功能缺陷方面最低(周邊開發者占 29.5%)。採納代理程式對設計的回饋需要專案知識;修正代理程式找到的缺陷則不需要。更值得注意的是鏡像結果:駁回代理程式的錯誤建議,是唯一偏向周邊開發者的行為(35 比 32 個案例);因此,專業溢價來自了解專案原先要達成什麼,而非抓出模型的錯誤
-
受控變異:AI 以降低離散度取勝——反例,而且有兩層意義。在隨機招募實驗中,131 位資深招募人員都預測錯自己專業領域任務的效果方向(36% 預期 AI 組的錄取率較低、48% 預期留任率較低、61% 預期面試品質較差;實際上 AI 組的錄取人數多 12%)。專業知識並未讓人預見自身工作的自動化。但論文本身對另一面仍保留本文主旨:面試自動化得很順利,評估——判斷的部分——仍由人類負責,並成為流程瓶頸,「使招募人員的專業知識轉向評估」
-
個人署名反彈——另一種結果的均等化特徵,與本文並不矛盾。分析 300M+ OpenAlex 作品發現,2022 年後轉向個人署名的幅度,在產量最低的作者中最大(終身作品數 1–5 篇的 Δβ 為 +1.16,6–20 篇則為 +0.21),只在資歷最深者中略為更大。這代表 AI 降低了開始產出任何成果的固定成本,與本文中每次提示產出增加的放大效應並存;兩者都沒有衡量低產量作者的個人論文品質
-
認知公地的悲劇——本文橫斷面無法觀察的人才再生問題:專業知識如今確實能放大代理程式效益,而 Lovett 主張,AI 最先取代的正是那些能培養專業知識的入門工作
-
Task Crossover——尚未調和的張力:本文顯示專業知識能放大代理程式效益,但 crossover 發現大量 AI 工作發生在使用者不熟悉的領域。兩者都依賴使用遙測資料,目前沒有證據指出使用者外借專業知識完成的工作品質如何
-
Implementation Abundance Inverts Product Work——「判斷力比廉價執行更耐久」在產品流程上的表現:實作成本下降後,篩選與品味成了昂貴的一步
-
任務飽和:廣泛但淺層的 AI 擴散——跨實驗室的組成檢驗:ATLAS 發現高薪工作者會過度將 AI 用於專業知識需求最低的認知任務,呈現本文的機制(卸下不熟悉的工作,保留判斷力);這項結果來自 Google 的使用資料,而非 Anthropic 的資料
-
角色平均化,而非角色消失——「專業領域不會消失」的實證基礎:即使角色逐漸平均化,領域專業知識仍然左右成敗
-
外包思考,不要外包理解——這是 Karpathy 主張的實證證明:成功取決於對問題的理解,而非輸入程式碼的能力;不可委派的殘餘,如今已能量化
-
印刷機式的軟體普及化——Cherny 說「最適合寫會計軟體的人是優秀會計師,因為編碼才是容易的部分」,這正是所有職業與軟體工程師差距都在 7 個百分點以內的發現;這是這項類比一直等待的硬資料
-
氛圍編碼與代理式工程——「地板抬高,天花板不動」:職業無關緊要代表地板抬高,專業知識依然左右成敗代表門檻仍在
-
研究品味是人類瓶頸——「若專業知識回報下降,代表模型正在提供判斷力」這項檢驗,是勞動資料版的「品味是持久的護城河,還是下一個鋸齒形能力落差?」
-
規劃與執行的勞動分工——放大效益的機制:專家明確界定工作後,Claude 每次提示可安全執行更長的行動鏈(5→12 個動作)
-
Agentic Coding Work-Composition Shift——同一研究的配套發現:七個月間工作內容如何轉變
-
AI 員工框架——管理者的優勢(委派技能可以轉用)是《哈佛商業評論》警告(員工框架會稀釋問責)的建設性對照;技能有用,組織架構象徵則有害
-
驗證成為新瓶頸——「要求 Claude 驗證的內容」是三項專業知識訊號之一;能明確說出檢查方式、並加以確認的人才是專家,這正是瓶頸角色
-
Engineer PM Convergence——在成功資料中看到領域與產品理解成為瓶頸技能
-
鋸齒形智慧(幽靈,而非動物)——專家能從代理程式不穩定的失敗中恢復;新手則選擇放棄——維持人在迴路中能帶來可量化的回報
-
Claude Code——整項研究測量的產品
-
METR——報告引用 METR 的時間跨度上限,視為這些使用情形所低於的能力前沿
-
Conversation-to-Delegation Shift——OpenAI 的 Codex 研究引用本報告(Hitzig 等人,2026),也從使用資料得出相同結論:工作愈來愈仰賴委派時,關鍵技能是領域理解加上監督,而非執行
-
AI 的組織互補條件——將 Hitzig 等人的主張改寫成經濟學語言:監督、驗證、協調與領域專業知識,是決定 AI 價值的關鍵互補條件
-
曝險分類:觀察到、理論上、回報的、預期的——AEI Cadences 調查以工作者自身說法確認這點:年資 15 年以上的工作者表示,AI 能完成的工作約少 10 個百分點,並指出判斷力、脈絡與人際工作是 AI 無法觸及的部分——默會專業知識是剩餘價值。該頁也記載了增能帶來薪資溢價的發現:依 Claude 查詢中增能與自動化的比例為 872 種職業排序後,第九個增能十分位的工作,比第九個自動化十分位的工作年薪高約 $7,000(Steele 與 Cruz,2026)。這是本文主旨的相關性版本,採用 2022 年薪資資料,且混合工作與個人用途——薪資會隨著難以交出去的工作而提升
-
自動化與樂觀程度的關聯——相反的梯度:資深工作者更懷疑 AI 的能力範圍,重度委派者卻最樂觀——專業知識與熱忱的方向相反
-
生成式 AI 對實驗性學習的影響——學習任務中的迴響:AI 對能力較強學生與增能型用途(AI 加深理解)的助益更大,呈現與本研究相同的「誰帶著/建立理解,誰就受益」模式;同一頁中的 Bocconi RCT,則提供本文新手端的界線與適用條件(當問題定義良好,而且模型已充分受訓時,專業溢價最小)
-
Conversation Artifacts——「人類仍參與高價值工作」(薪資愈高,對話輪數和 Claude 產出也都愈多),這是專業知識放大代理程式效益的增能解讀
-
AI Usage Cadences——非工作時間的 Claude 工作偏向高薪職業,這與 AI 最先進入高專業知識工作相符
-
Anthropic 經濟指數——本研究所屬的研究計畫;Cadences 是下一份報告
-
脈絡優勢,而非品味——**衡量工具。**若人類扮演的是可消除的資訊不對稱,而非運用某種能力,那麼觀察到專業溢價下降,就是資訊差距逐漸消除,並由使用資料追蹤;兩種說法對下降代表什麼有不同解讀
-
未知資訊是代理式工作的瓶頸——專業溢價背後的機制:Thariq Shihipar 觀察到「最優秀的代理式編碼者相對很少遇到未知資訊」——專家的心智地圖已貼近現實,而且他們會預設仍有未知資訊,不會認為地圖已完整
-
審查是控制點——審查端的相同主張:審查者的專業知識與處置方式,是決定編碼代理程式能幫助或傷害軟體的三項調節因素之首。專業知識在審查介面上與撰寫程式碼時一樣能放大效益並提供保護——CMU 理論說明了為何本研究觀察到的專業溢價應會持續
-
以市場價格衡量 AI 曝險(AI 溢價)——資產定價上的呼應:AI 溢價落在密集使用邊際(付費/核心與資深使用者、較長提示會反映 AI 風險;偶爾使用或新手使用則不會);市場隱含的技能分布獎勵互動、人際與溝通工作,懲罰分析與科學工作——這是市場版本的本文「理解愈深,愈能放大代理程式效益」,以及調查中「資深工作者指出,人際判斷力是 AI 無法觸及的殘餘」
-
AI-Native Organization——與這些資料對照的業界放大效益主張:Tan 自測約 400 倍(自行下修為 8 倍至 80 倍),相較於實測的 2 倍動作/5 倍產出溢價;他說「2 倍的人才和 100 倍的人才用的是完全相同的 Claude」,將差距歸因於組織運作,而非專業知識——這是一種互補條件說法,本研究並未檢驗
-
企業 AI 支出強度與人數成長——界定本文溢價範圍的兩種勞動需求測量工具,對人力組成的看法卻不同:Indeed 職缺反彈中有 71% 是資深職位(專業溢價反映在職缺定價上);Ramp 依支出連結的企業追蹤資料則發現,高強度採用者的入門級員工人數成長最快(+12.0%)。存量與流量、採用企業與單一求職網站——可以調和,但尚未調和
-
Owning Your Externalized Cognition——本文測量的溢價被提出為可攜式財產:若領域判斷力能放大代理程式,把它寫進技能檔案就能轉化為可轉移資產。本文的凹形曲線讓這項主張更複雜——增益集中在新手到中階,精通只增加些微效益,因此真正專家的知識庫,作為職涯資本的價值或許低於該學說所假設
-
AI 與市場力量——本文個人層級溢價在企業層級的對應現象,同樣帶有兩面性:OECD 發現,生產力與能力較高的企業「更容易釋放生成式 AI 的效益」;在生成式 AI 曝險五分位中,生產力、加價率與大學學歷員工占比都呈單調梯度(0.04 → 0.46)。本文發現專業知識能放大單一工作階段中的代理程式效益;該文則發現企業能力能在整體經濟中放大採用效益——兩者都提出相同疑慮:能力強者得益最多,差距因而擴大
-
Systems Thinking Over Specialization——將兩面結果套用到招募端:Elizabeth Stone 所說的「優秀工程人才稀缺」,對應持續存在的專業溢價;她認為「現在專家很快就能學會那些技能」,押注的正是本研究觀察到的凹形曲線(基本掌握容易培養,精通則不然)
-
編碼知識與默會知識曝險——在不同資料工具、人口規模上檢視本文主旨:四年的 ADP 薪資資料顯示,默會知識密集職業中的資深工作者成長更快;Anthropic Economic Index 使用分類中的互補性係數只在 41 歲以上區間為正。必須留意,薪資資料測量的是年資,而非本研究根據行為評估的任務特定專業知識
-
任務適配性的認知能力分析——本文所指出的互補條件,在另一種衡量工具中被刻意排除。Prunty 等人建立能力組合時,著重「與一般職場活動相關的核心認知歷程,而非區分不同工作者的專業技能」;其 410 位受訪者評估這些核心能力對自己工作的相對重要性。因此,在 400K 工作階段研究中最能放大代理程式效益的變數——領域專業知識——刻意不納入該工具。後果也呈現在他們的結果中:職場活動會聚焦於共同的認知核心,六種 AI 系統的適配性排名在 18 種活動間幾乎沒有改變;若測量工具拿掉了區分不同工作者的變數,這正是預期結果。他們對能力需求的分析也受到默會知識的測量問題影響:元認知與空間推理等能力很少被提及;作者推測,這是因為自動化歷程不易進入有意識的反思,而非因為它們貢獻不大
開放問題#
- 報告本身提出的前瞻檢驗:隨著模型改進,專業知識回報會持續、縮小,還是反轉?回報下降就代表模型正在吸收使用者目前提供的判斷力。
- 結果是依逐字稿推論而來(可驗證成功仰賴 git 活動與明確肯定)。管理者的優勢,以及整體成功梯度,有多少是實際結果,又有多少只是「誰會在逐字稿中說自己成功」?
- 研究排除無頭模式/SDK/IDE 使用(「相當大的一部分」)。在完全沒有使用者於工作階段中途引導的非互動式與管線式使用中,專業知識回報的模式是否仍成立?
- 「中階取得大部分效益」是穩定現象,還是目前模型能力的產物?也就是說,模型愈強,凹形曲線會進一步變平(所有人趨於一致),還是變陡(精通者再次拉開差距)?
衍生文章#
- 學會與 AI 協同工作:軟體工程師實戰指南——實戰指南提出的「領域深度 + 品味」技能主張,正是本研究直接測量的內容
- 現在培養廣度便宜了嗎?專家成長速度與大規模領域專家建構者——將本研究的凹形曲線、差距在 7 個百分點內的職業平等性,以及管理者優勢,解讀為工作表現廣度容易取得,但能否保留能力廣度仍未證實
資料來源#
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等人(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。本文引用 §2.2 的專家招募門檻(至少 4 年經驗、平均 14 年、篩選流程、接受率 <10%、每種職業至少 5 位專業人士),修正本文先前根據講座逐字稿記載的「10+ 年」數字;也引用 A.2.7 的脈絡不足實驗。完整分析與利益衝突說明見 GDPval 基準測試 - Agentic coding and persistent returns to expertise — Anthropic Economic Research,2026 年 6 月;§「The returns to expertise」、§「Occupation may matter less than expertise」、§「Looking ahead」
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Jabarian 與 Henkel,Voice AI in Firms(arXiv 2607.28222,2026-07-30;
empirical,預先註冊 RCT):§3 導言(招募人員的預測)、註 5 與 §8(招募人員專業知識轉向評估)、§7.1(評估階段成為新瓶頸)。解析警告與完整分析見受控變異:AI 以降低離散度取勝。 - AI and Job Postings: From Destruction to Creation? — Guillermo Gallacher,AI and Job Postings: From Destruction to Creation?(Indeed Hiring Lab,2026-07-08;
empirical行政職缺資料,但由資料所屬平台撰寫部落格文章)。引用重點清單及 §「A senior, AI-fluent rebound」——15%/7%/71%/37% 的數字,除了圖表說明外,正文也都有記載。國際比較的國家身分,以及兩張散佈圖的相關統計只出現在圖像中,本文知識庫未引用。完整證據說明與相互矛盾的入門職位結果,見企業 AI 支出強度與人數成長。 - Helping People Choose Careers in the Age of AI — Steele 與 Cruz,arXiv 2607.15506(2026-07-16),
empirical;§5.6 + 圖 17(依 Claude 使用增能/自動化十分位分組的平均薪資)。文中明確寫出第九十分位相差 $7,000;作者附有兩項注意事項(2022 年薪資資料,以及 2025 年 9 月 AEI 版本無法區分工作與個人用途)。來源解析注意事項記載於曝險分類:觀察到、理論上、回報的、預期的。 - Training novices to think, or giving them LLMs? Evidence from an RCT — Asirvatham 等人(12 位作者,Bocconi University × OpenAI),CEPR DP21882,2026 年 8 月,
empirical(預先註冊 2×2 RCT,n=1,053,13 個班級以班級為單位隨機分派)。本文引用 §4.2(認知/使用分數及專家相似度)和 §4.4(PDS-lasso 分解)。**利益衝突:**三位作者與 OpenAI 有聘雇或承包關係,ChatGPT Edu 就是實驗處置,相似度與點子指標由 OpenAI 模型運算——人類評分是唯一不在這個迴路中的結果,且其正向 LLM 效果最大。**解析警告:**資料取自 PDF,表 A.7–A.14 有一列未標示的標準誤位移(表 A.11 將 0.044*** Expert-Alumnus GPT 係數錯歸至 Causal 列;表 A.13 直接漏掉兩個係數);本文數字皆從pdftotext -layout還原。完整分析與因果訓練組結果見生成式 AI 對實驗性學習的影響。 - Uncle Bob on Software Fundamentals in the Age of AI — Robert C. Martin 與 Matt Pocock,2026-08-19(
practitioner-opinion;自動字幕逐字稿):寫程式/當代理程式/執行代理程式的人才管道、將辨識困境視為可轉移資產,以及 Pocock 對誰來承擔成本提出但未獲回答的質疑 - Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence — Brynjolfsson、Chandar 與 Chen,Canaries in the Coal Mine?,Stanford Digital Economy Lab,2026 年 8 月修訂版,140 頁(
empirical,ADP 薪資微觀資料截至 2026 年 6 月)。本文引用表 3 與 §2.5(依年齡區間分類的自動化/互補性係數),以及 §2.5 + 線上附錄 J(資深工作者的編碼/默會知識梯度)。本文將其作為人口規模的專業溢價佐證,同時明確指出其專業知識代理指標為年齡 × 職業,而非行為。完整分析見編碼知識與默會知識曝險。 - Google AI & Economy ATLAS: AI in Science (September 2026) — AI in Science: Early Insights(Google、Google DeepMind、MIT FutureTech,2026 年 9 月,42 頁;
empirical且涉及供應商利益衝突)。本文僅引用附錄 3(樣本組成與資深程度區間)、§5.2(自陳每週淨節省 6.9 小時、每日使用比例 46.6%),以及 §3.1(科學互動的領域專業知識分數 +26%)——用以說明研究測量了一個專家族群,卻沒有按專業程度切分。完整分析見科學工作中的 AI 採用。
Cited by 52
- Context Advantage, Not Taste×4
Deployment asymmetry (Ng is right). "We know a lot more about the users and the context the product…
- Printing Press Software Democratization×4
Returns To Expertise — the analogy, measured. Boris's "the best person to write accounting software…
- Agentic Coding Work-Composition Shift×3
Returns To Expertise — the companion finding from the same study: who succeeds, alongside this what…
- Anthropic Economic Index×3
Returns to expertise — domain understanding, not coding skill, amplifies the agent. See Returns To…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated×3
↓ with experience — workers with 15+ years put the share ~10pp lower than first-year workers. In…
- Is Breadth Cheap Now? Specialist Ramp Speed and Domain-Expert-as-Builder at Scale×3
Capability parity: measured. Non-software occupations reach verified success within 7pp of software…
- Market-Priced AI Exposure (the AI Premium)×3
Returns To Expertise — the premium loads on seasoned/paid/core users and long prompts, and the…
- Open Questions Backlog×3
Returns To Expertise ×2 (oldest 104d) — Outcomes are transcript-inferred (verified success leans on…
- Organizational Complements to AI×3
Returns To Expertise — the cited Hitzig et al. argument that supervision/verification/coordination…
- Planning / Execution Division of Labor×3
Returns To Expertise — expertise is what lets a user safely delegate planning and unlock the longer…
- Systems Thinking Over Specialization×3
She also concedes the hard part, which is Outsource Thinking Not Understanding verbatim: engineers…
- Vibe Coding vs. Agentic Engineering×3
On expertise as a liability. The page's implicit assumption — that the AI-native practitioner is…
- Agent Review Comment Resolution×2
This is Returns To Expertise on the receiving end of review: the ability to use an agent's design…
- Anthropic×2
Returns To Expertise — headline finding of Anthropic Economic Research's 400K-session Claude Code…
- Bridgewater Associates×2
The Returns To Expertise reading is direct: the deployment's leverage comes from expert users who…
- Codified vs Tacit Knowledge Exposure×2
The complement half is the more robust finding, and it is the less-quoted one. Experienced workers…
- GDPval Benchmark×2
Returns To Expertise — the same asymmetry from the human side; GDPval's baseline is a professional…
- Implementation Abundance Inverts Product Work×2
> Evidence note. practitioner-opinion — a frontier-lab product leader's account, not measurement.…
- Impose Values, Not Disciplines×2
The principle sits awkwardly against Martin's own apprenticeship proposal, which runs it in…
- Open Questions Dashboard×2
Printing Press Software Democratization: Is domain-expert-as-builder actually happening at scale in…
- Owning Your Externalized Cognition×2
The premium it proposes to make portable is real but differently shaped. Returns To Expertise…
- Research Taste as the Human Bottleneck×2
The two frames disagree about what would count as evidence. Returns To Expertise is the instrument…
- Review as the Control Point×2
Returns To Expertise — the review-side mirror: reviewer expertise + disposition is the first of the…
- Role Averaging, Not Role Elimination×2
Returns To Expertise — the empirical backbone of "specialties don't disappear": domain expertise…
- The Solo-Authorship Rebound×2
It complicates Returns To Expertise on a margin that page cannot see. Expertise amplifies an agent…
- Task Crossover×2
Returns To Expertise — the open tension: expertise amplifies the agent, yet crossover is people…
- Task Saturation: Broad but Shallow AI Diffusion×2
Returns To Expertise — the composition here (expert workers using AI on low-expertise tasks) is the…
- Task Time-Horizon Scaling×2
Returns To Expertise — the human side of the same contractor/maintainer gap: what the baseliner…
- Unknowns as the Agentic Bottleneck×2
Returns To Expertise — "the best agentic coders have relatively few unknowns" is a mechanism for…
- Does the Augmentation/Automation Split Govern Skill at Work?×2
Returns To Expertise → Agentic coding and persistent returns to expertise (empirical, first-party…
- Agentic Technical Debt
It is why he does not read the code. Asked how he knew the agents were making mistakes in December,…
- AI Adoption in Scientific Work
Returns To Expertise — the expert end of the population, with a self-reported time-saving magnitude…
- AI and Market Power
Returns To Expertise — the firm-level analogue of the individual-level premium: benefits "unlocked…
- AI Employee Framing
Returns To Expertise — the constructive flip side: Anthropic's 400K-session study finds managers…
- AI-Native Organization
Returns To Expertise — Tan's 400x self-report vs the measured 2× actions / 5× output expertise…
- AI Usage Cadences
Returns To Expertise — the off-hours high-wage skew is consistent with expertise-heavy work being…
- The Automation–Optimism Link
Returns To Expertise — the mirror-image gradient: more-experienced workers report lower exposure…
- Claude Code
Returns To Expertise / Planning Execution Division Of Labor / Agentic Coding Work Composition Shift…
- Cognitive Capability Profiling for Task Suitability
Returns To Expertise — the requirements side's blind spot, named from the other direction. The
- Controlled Variance: AI's Edge as Reduced Dispersion
Returns To Expertise — a rare case running against the expertise gradient: 131 experienced…
- Conversation Artifacts
Returns To Expertise — "the human stays involved in high-value work" is the augmentation reading of…
- Conversation-to-Delegation Shift
Returns To Expertise — the companion finding from the report this one cites (Hitzig et al. 2026):…
- Engineer PM Convergence
Returns To Expertise — "deciding what to build, given building is cheap" as the bottleneck skill,…
- Experimental Learning Impact of Generative AI
Returns To Expertise — the heterogeneity rhymes: gains skew to higher-ability students, and…
- Firm AI-Spend Intensity and Headcount Growth
Returns To Expertise — the labor-demand reading of the expertise premium: the Indeed rebound is 71%…
- Garry Tan
His stress-test-me number: in 2013, as a near-full-time engineer building YC's internal social…
- Jagged Intelligence (Ghosts, Not Animals)
Returns To Expertise — staying-in-the-loop pays measurable dividends: in Anthropic's 400K-session…
- AI Economics & Labor
Returns To Expertise — Anthropic's 400K-session study: domain expertise (not coding skill) is what…
- OpenAI
Workforce-economics research. Its June 2026 study The Shift to Agentic AI: Evidence from Codex uses…
- Outsource Your Thinking, Not Your Understanding
Returns To Expertise — the empirical proof of this thesis. Anthropic's 400K-session study finds…
- Robert C. Martin (Uncle Bob)
Juniors should be treated like agents. Write code for about a year, then be given the same tasks…
- The Tragedy of the Cognitive Commons
Returns To Expertise — the direct tension: expertise measurably amplifies an agent today, and this…
Related articles
- Organizational Complements to AI
The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- The Tragedy of the Cognitive Commons
Lovett (HRD Review, July 2026): professional expertise is a profession-level commons whose regeneration mechanism — ent…
