資料來源#
摘要#
Anthropic 對 40 萬個工作階段進行研究,得出的縱向發現是:短短七個月(2025 年 10 月 → 2026 年 4 月),人們使用 Claude Code 的方式,已明顯從救火轉向端到端代理式工作,而且工作價值也提高了。最明顯的變化是:花在修復損壞程式碼上的工作階段占比,從 33% 降至 19%(除錯占比幾乎減半)。取而代之的是程式碼周邊的工作增加——操作軟體從 14% 升至 21%,而寫作+資料分析約翻倍,從約 10% 升至約 20%。同時,平均工作階段的估計經濟價值上升約 25–27%。這是從使用情況角度觀察到的隨模型進步而縮減的 harness:模型能力提升後,使用者花較少時間收拾問題,轉而委派完整任務。
證據註記。
empirical,與代理式程式設計中的專業知識持續回報採用相同的一手資料限制(Anthropic 透過 Clio 與 Sonnet-4.6 分類器測量自家產品,並以遙測資料驗證;排除無頭、SDK 與 IDE 使用情況)。任務價值刻意採用相對性指標——詳見下文。
九種工作模式#
每個工作階段都會歸類至最能描述它的單一模式。這套分類法本身值得記錄:
- 直接處理程式碼(約 56%): 建置新程式碼(25%)、修復損壞程式碼(26%)、測試/協調(5%)
- 操作(17%): 部署、設定、執行管線、監控
- 規劃/探索(14%): 理解既有系統、規劃變更
- 分析/文字(13%): 分析資料、透過文件/簡報進行溝通
分類器與自動遙測結果一致——它標記為建立/修改程式碼的工作階段中,超過 90% 確實出現程式碼變更;這是判斷其餘逐字稿指標是否可信的驗證依據。
轉變的量化結果(2025 年 10 月 → 2026 年 4 月)#
| 工作模式 | 趨勢 | 變化 |
|---|---|---|
| 修復損壞程式碼 | ↓ | 33% → 19% |
| 操作軟體 | ↑ | 14% → 21% |
| 寫作+資料分析 | ↑ | 約 10% → 約 20% |
各類工作的價值也全面上升(以自由工作者市集作為代理指標):平均工作階段約增加 27%;建置增加 43%、操作增加 34%、修復增加 32%。報告強調,美元金額只是粗略估計,最好將其解讀為相對變化,而非實際價值。
報告的解讀是:投入反應式、槓桿效益較低的工作(除錯)的時間減少,投入主動式、槓桿效益較高且更自主的工作(操作系統、分析資料、撰寫文件)的時間則增加。報告明確指出,Claude Code 的使用情形可能是知識工作未來走向的預覽,反映代理程式如何融入非程式設計工作——寫作/分析工作的占比翻倍,正是這種擴展到程式碼以外工作的前沿訊號。
遙測資料,而非問卷——以及由此形成的對照#
和 Faros 一樣,這項研究透過系統訊號(此處是工作階段逐字稿+透過 Clio 取得的自動遙測資料)觀察行為,而非詢問開發者的感受。但這兩項遙測研究得出的結論感受截然不同,這種對照很有啟發性:
- 本研究: 工作階段價值上升約 27%、除錯減少、成功率上升——從個別互動工作階段層級看,是一幅樂觀圖景。
- Faros: 吞吐量上升,但品質下降(每位開發者的錯誤增加 54%、每個 PR 的事件增加 243%、審查時間增加至 5 倍)——從組織的 SDLC 層級看,是一幅悲觀圖景。
兩者並非直接矛盾;它們衡量的是不同單位與階段。Anthropic 衡量的是這個工作階段是否達成目標,以及價值有多高(以單一工作階段內的互動使用情況為代理指標,且有人類參與);Faros 衡量的是幾週後整個組織的管線下游發生了什麼(事件、審查佇列、重新開啟的工單)。一個在工作階段層級成立,另一個也可能同時在組織層級成立——「任務完成了,感覺很有價值」與「累積的下游成本正在上升」,正是遙測與問卷衡量所指出的主觀生產力與系統成果落差。證據強度也不同:本研究是 empirical 研究遙測;Faros 則是 vendor-claim 潛在客戶開發遙測。
關聯閱讀#
- Task Crossover——跨職業的對照:本頁追蹤單一工具與職業中工作階段用途的轉變;交叉轉移則追蹤八個職業族群之間的工作遷移
- 模型進步如何縮減 harness——除錯占比下滑與轉向端到端委派,從使用資料讀出 harness 正在縮減:模型進步後,每項任務所需的鷹架/救火工作減少
- 加速的鞭梢效應——並列的遙測結果:本頁在工作階段層級發現價值/成功率上升,另一篇則在組織層級發現品質下降;單位不同,但兩者可能都成立。第三個層次於 2026-08-12 出現,介於兩者之間:DX 的 2026 年第二季調查(
vendor-claim,500 多個組織)估計 AI 使用者每週節省 4–6 小時,但創新比例——投入新功能的時間占維護與管理負擔的比例——維持平穩。本頁衡量的是單一工作階段內,工作組成是否轉向槓桿效益較高的工作;該調查衡量的是單一組織的一季之中,工作組成是否轉變。兩者可以同時成立,而鞭梢效應機制正好解釋了這點:工作階段中省下的時間,在作品組合上游被審查佇列、更大的 PR 與事件負擔重新吸收。工作階段組成改善、組織作品組合持平、下游品質下降——三種儀器衡量的單位彼此毫不相交 - 遙測與問卷衡量——兩項研究都衡量行為,而非感受;本研究是與 Faros 的
vendor-claim遙測相對應的empirical研究,而工作階段與組織的區分正是主觀感受與系統成果的差異 - 代理式程式設計中的專業知識回報——同一研究的相關發現:探討誰能成功,以及本頁探討的哪些工作正在轉變
- AI 作為主要作者——更多端到端代理式使用(操作/分析/寫作),從使用情況一側呈現作者身分如何轉向代理程式
- Task Time-Horizon Scaling——能力上限的提升是上游成因:只有可靠任務時間跨度變長,使用方式才能從修復轉向操作/分析整個工作流程
- Claude Code——本頁追蹤使用組成的產品
- Conversation-to-Delegation Shift——OpenAI/Codex 跨族群遙測所呈現的同一個從詢問到執行的轉變;本頁是其 Anthropic/Claude Code 單一工具的對應案例——兩個實驗室、兩種工具,同一種轉變
- Post-Acceptance Edit Behavior——同一個問題(「人類實際上在做什麼?」)往下一層、往前一代模型,探討的是行內補全,而非代理程式工作階段。本頁將整個工作階段歸類為九種模式之一;DECODE 則測量單次接受的補全中每項個別修復所需時間——一半在 50 分鐘內完成,修復量在 15 分鐘後急遽下降。這些儀器彼此看不見:工作階段分類器無法解析接受補全後出現的 15 分鐘修復高峰,而編輯軌跡擷取器根本沒有工作階段的概念。值得將此結果與修復占比從 33% 降至 19% 一起考量;後者談的是工作階段的用途,而非保留一段補全後還需要多少修復
尚待解答的問題#
- 觀察期只有七個月,價值代理指標也很粗略/相對。價值增加的 27% 有多少反映真正的任務複雜度成長,又有多少來自分類器/市集配對的偏移?
- 研究排除無頭、SDK 與 IDE 使用情況——這些占「相當大的比例」,而且可能是自動化程度最高、最端到端的使用方式。若納入這些使用情況,工作組成的轉變會加快還是逆轉?
- 如果「修復」持續減少,這是因為模型較少出錯,還是因為損壞程式碼的工作正轉移到本研究看不到的非互動式管線?
資料來源#
- Agentic coding and persistent returns to expertise — §「人們用 Claude Code 做什麼」、§「工作」
Cited by 13
- Anthropic Economic Index×2
Agentic coding and persistent returns to expertise (June 2026) — the 400K-session…
- Conversation-to-Delegation Shift×2
The central thesis of OpenAI's The Shift to Agentic AI: Evidence from Codex (Johnston, Holtz,…
- Acceleration Whiplash
Agentic Coding Work Composition Shift — the juxtaposed telemetry: Anthropic's same-period study…
- AI as Primary Author
Agentic Coding Work Composition Shift — more end-to-end agentic use (operate/analyze/write) is the…
- Anthropic
2026-06-16 — Anthropic Economic Research published Agentic coding and persistent returns to…
- Claude Code
Returns To Expertise / Planning Execution Division Of Labor / Agentic Coding Work Composition Shift…
- AI Coding Practice
Agentic Coding Work Composition Shift — Anthropic's 400K-session telemetry, Oct 2025→Apr 2026: as…
- Open Questions Backlog
Agentic Coding Work Composition Shift ×3 (oldest 104d) — The window is seven months and the value…
- Post-Acceptance Edit Behavior
Agentic Coding Work Composition Shift — the usage-composition shift measured one layer down and one…
- Returns to Expertise in Agentic Coding
Agentic Coding Work Composition Shift — the companion finding from the same study: what the work is…
- Task Crossover
Agentic Coding Work Composition Shift — Anthropic's within-tool version: what a session is for…
- Task Time-Horizon Scaling
Agentic Coding Work Composition Shift — the rising reliable-task-length ceiling is the upstream…
- Telemetry vs. Survey Measurement
Agentic Coding Work Composition Shift — the empirical cousin: Anthropic's Clio-based 400K-session…
Related articles
- Planning / Execution Division of Labor
Anthropic's 400K-session telemetry: in a typical Claude Code session humans make ~70% of planning decisions (what to do…
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- Conversation-to-Delegation Shift
OpenAI's Codex usage study (June 2026): the move from conversational AI ('asking') to agentic AI ('delegated production…
- Engineer PM Convergence
Generalists across disciplines; product taste as bottleneck skill; Anthropic Claude Code team as case study; "just do t…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
