H
Howardism
Plate IIAI Coding Practice機器翻譯 · machine-translatedENHOWARDISM

代理式程式設計的工作組成轉變

Anthropic 對 40 萬個工作階段的遙測資料,2025 年 10 月至 2026 年 4 月:隨著模型進步,用來修復損壞程式碼的工作階段占比從 33% 降至 19%(除錯占比幾乎減半),而操作軟體(14%→21%)及寫作+資料分析(約 10%→約 20%)則增加;估計任務價值上升約 25–27%——使用方式正從救火轉向端到端代理式工作

Article metadata
Publication details
Published:June 17, 2026
Filed:Concept
Domain:AI Coding Practice
Tags:AI Coding WorkflowAgent EngineeringEngineering MetricsEmpiricalAnthropic
Reading:7 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

代理式程式設計工作組成轉變的插圖

資料來源#

摘要#

Anthropic 對 40 萬個工作階段進行研究,得出的縱向發現是:短短七個月(2025 年 10 月 → 2026 年 4 月),人們使用 Claude Code 的方式,已明顯從救火轉向端到端代理式工作,而且工作價值也提高了。最明顯的變化是:花在修復損壞程式碼上的工作階段占比,從 33% 降至 19%(除錯占比幾乎減半)。取而代之的是程式碼周邊的工作增加——操作軟體從 14% 升至 21%,而寫作+資料分析約翻倍,從約 10% 升至約 20%。同時,平均工作階段的估計經濟價值上升約 25–27%。這是從使用情況角度觀察到的隨模型進步而縮減的 harness:模型能力提升後,使用者花較少時間收拾問題,轉而委派完整任務。

證據註記。 empirical,與代理式程式設計中的專業知識持續回報採用相同的一手資料限制(Anthropic 透過 Clio 與 Sonnet-4.6 分類器測量自家產品,並以遙測資料驗證;排除無頭、SDK 與 IDE 使用情況)。任務價值刻意採用相對性指標——詳見下文。

九種工作模式#

每個工作階段都會歸類至最能描述它的單一模式。這套分類法本身值得記錄:

  • 直接處理程式碼(約 56%): 建置新程式碼(25%)、修復損壞程式碼(26%)、測試/協調(5%)
  • 操作(17%): 部署、設定、執行管線、監控
  • 規劃/探索(14%): 理解既有系統、規劃變更
  • 分析/文字(13%): 分析資料、透過文件/簡報進行溝通

分類器與自動遙測結果一致——它標記為建立/修改程式碼的工作階段中,超過 90% 確實出現程式碼變更;這是判斷其餘逐字稿指標是否可信的驗證依據。

轉變的量化結果(2025 年 10 月 → 2026 年 4 月)#

工作模式趨勢變化
修復損壞程式碼↓33% → 19%
操作軟體↑14% → 21%
寫作+資料分析↑約 10% → 約 20%

各類工作的價值也全面上升(以自由工作者市集作為代理指標):平均工作階段約增加 27%;建置增加 43%、操作增加 34%、修復增加 32%。報告強調,美元金額只是粗略估計,最好將其解讀為相對變化,而非實際價值。

報告的解讀是:投入反應式、槓桿效益較低的工作(除錯)的時間減少,投入主動式、槓桿效益較高且更自主的工作(操作系統、分析資料、撰寫文件)的時間則增加。報告明確指出,Claude Code 的使用情形可能是知識工作未來走向的預覽,反映代理程式如何融入非程式設計工作——寫作/分析工作的占比翻倍,正是這種擴展到程式碼以外工作的前沿訊號。

遙測資料,而非問卷——以及由此形成的對照#

和 Faros 一樣,這項研究透過系統訊號(此處是工作階段逐字稿+透過 Clio 取得的自動遙測資料)觀察行為,而非詢問開發者的感受。但這兩項遙測研究得出的結論感受截然不同,這種對照很有啟發性:

  • 本研究: 工作階段價值上升約 27%、除錯減少、成功率上升——從個別互動工作階段層級看,是一幅樂觀圖景。
  • Faros: 吞吐量上升,但品質下降(每位開發者的錯誤增加 54%、每個 PR 的事件增加 243%、審查時間增加至 5 倍)——從組織的 SDLC 層級看,是一幅悲觀圖景。

兩者並非直接矛盾;它們衡量的是不同單位與階段。Anthropic 衡量的是這個工作階段是否達成目標,以及價值有多高(以單一工作階段內的互動使用情況為代理指標,且有人類參與);Faros 衡量的是幾週後整個組織的管線下游發生了什麼(事件、審查佇列、重新開啟的工單)。一個在工作階段層級成立,另一個也可能同時在組織層級成立——「任務完成了,感覺很有價值」與「累積的下游成本正在上升」,正是遙測與問卷衡量所指出的主觀生產力與系統成果落差。證據強度也不同:本研究是 empirical 研究遙測;Faros 則是 vendor-claim 潛在客戶開發遙測。

關聯閱讀#

  • Task Crossover——跨職業的對照:本頁追蹤單一工具與職業中工作階段用途的轉變;交叉轉移則追蹤八個職業族群之間的工作遷移
  • 模型進步如何縮減 harness——除錯占比下滑與轉向端到端委派,從使用資料讀出 harness 正在縮減:模型進步後,每項任務所需的鷹架/救火工作減少
  • 加速的鞭梢效應——並列的遙測結果:本頁在工作階段層級發現價值/成功率上升,另一篇則在組織層級發現品質下降;單位不同,但兩者可能都成立。第三個層次於 2026-08-12 出現,介於兩者之間:DX 的 2026 年第二季調查(vendor-claim,500 多個組織)估計 AI 使用者每週節省 4–6 小時,但創新比例——投入新功能的時間占維護與管理負擔的比例——維持平穩。本頁衡量的是單一工作階段內,工作組成是否轉向槓桿效益較高的工作;該調查衡量的是單一組織的一季之中,工作組成是否轉變。兩者可以同時成立,而鞭梢效應機制正好解釋了這點:工作階段中省下的時間,在作品組合上游被審查佇列、更大的 PR 與事件負擔重新吸收。工作階段組成改善、組織作品組合持平、下游品質下降——三種儀器衡量的單位彼此毫不相交
  • 遙測與問卷衡量——兩項研究都衡量行為,而非感受;本研究是與 Faros 的 vendor-claim 遙測相對應的 empirical 研究,而工作階段與組織的區分正是主觀感受與系統成果的差異
  • 代理式程式設計中的專業知識回報——同一研究的相關發現:探討誰能成功,以及本頁探討的哪些工作正在轉變
  • AI 作為主要作者——更多端到端代理式使用(操作/分析/寫作),從使用情況一側呈現作者身分如何轉向代理程式
  • Task Time-Horizon Scaling——能力上限的提升是上游成因:只有可靠任務時間跨度變長,使用方式才能從修復轉向操作/分析整個工作流程
  • Claude Code——本頁追蹤使用組成的產品
  • Conversation-to-Delegation Shift——OpenAI/Codex 跨族群遙測所呈現的同一個從詢問到執行的轉變;本頁是其 Anthropic/Claude Code 單一工具的對應案例——兩個實驗室、兩種工具,同一種轉變
  • Post-Acceptance Edit Behavior——同一個問題(「人類實際上在做什麼?」)往下一層、往前一代模型,探討的是行內補全,而非代理程式工作階段。本頁將整個工作階段歸類為九種模式之一;DECODE 則測量單次接受的補全中每項個別修復所需時間——一半在 50 分鐘內完成,修復量在 15 分鐘後急遽下降。這些儀器彼此看不見:工作階段分類器無法解析接受補全後出現的 15 分鐘修復高峰,而編輯軌跡擷取器根本沒有工作階段的概念。值得將此結果與修復占比從 33% 降至 19% 一起考量;後者談的是工作階段的用途,而非保留一段補全後還需要多少修復

尚待解答的問題#

  • 觀察期只有七個月,價值代理指標也很粗略/相對。價值增加的 27% 有多少反映真正的任務複雜度成長,又有多少來自分類器/市集配對的偏移?
  • 研究排除無頭、SDK 與 IDE 使用情況——這些占「相當大的比例」,而且可能是自動化程度最高、最端到端的使用方式。若納入這些使用情況,工作組成的轉變會加快還是逆轉?
  • 如果「修復」持續減少,這是因為模型較少出錯,還是因為損壞程式碼的工作正轉移到本研究看不到的非互動式管線?

資料來源#

§ end
Cited by 13
  • Anthropic Economic Index×2

    Agentic coding and persistent returns to expertise (June 2026) — the 400K-session…

  • Conversation-to-Delegation Shift×2

    The central thesis of OpenAI's The Shift to Agentic AI: Evidence from Codex (Johnston, Holtz,…

  • Acceleration Whiplash

    Agentic Coding Work Composition Shift — the juxtaposed telemetry: Anthropic's same-period study…

  • AI as Primary Author

    Agentic Coding Work Composition Shift — more end-to-end agentic use (operate/analyze/write) is the…

  • Anthropic

    2026-06-16 — Anthropic Economic Research published Agentic coding and persistent returns to…

  • Claude Code

    Returns To Expertise / Planning Execution Division Of Labor / Agentic Coding Work Composition Shift…

  • AI Coding Practice

    Agentic Coding Work Composition Shift — Anthropic's 400K-session telemetry, Oct 2025→Apr 2026: as…

  • Open Questions Backlog

    Agentic Coding Work Composition Shift ×3 (oldest 104d) — The window is seven months and the value…

  • Post-Acceptance Edit Behavior

    Agentic Coding Work Composition Shift — the usage-composition shift measured one layer down and one…

  • Returns to Expertise in Agentic Coding

    Agentic Coding Work Composition Shift — the companion finding from the same study: what the work is…

  • Task Crossover

    Agentic Coding Work Composition Shift — Anthropic's within-tool version: what a session is for…

  • Task Time-Horizon Scaling

    Agentic Coding Work Composition Shift — the rising reliable-task-length ceiling is the upstream…

  • Telemetry vs. Survey Measurement

    Agentic Coding Work Composition Shift — the empirical cousin: Anthropic's Clio-based 400K-session…

Related articles