H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

程式碼產出帶來的研究人員效能提升

Thomas Kwa (METR) 將 Anthropic 報告的每位工程師每日程式碼產出 8×,換算為序列研究人員效能提升,並使用生產函數估算:Cobb-Douglas 得出 U = M^β = √8 ≈ 2.83;由於 8 ≈ e²,CES 在不同替代彈性下的結果都落在此數值的 ±3% 內;即使模型對低風險程式碼打折,結果仍是 [2.33, 2.66]。因此,光靠編碼代理程式,研究人員效能提升很可能超過 2×。這與 Anthropic 所說「整體 R&D 提升遠低於 2×」並不矛盾,因為 R&D 加速也取決於運算資源(Greenblatt:labor^0.55 × compute^0.45)。

Article metadata
Publication details
Published:July 16, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:Governance WorkforceAI RdRecursive Self ImprovementProductivityEconomic ModelingMetrAnthropic
Reading:10 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

程式碼產出帶來的研究人員效能提升插圖

資料來源#

摘要#

METR 的 Thomas Kwa(2026-07-08,practitioner-opinion)探討 Anthropic 報告的每位工程師每日合併程式碼量增加 8×(AI Accelerating AI Development)代表序列研究人員效能提升多少——也就是研究人員的總有效研究產出提高了幾倍。將單一數值 M = 8 代入標準生產函數後,Kwa 估計,光靠編碼代理程式,結果穩健地超過 2×(中心估計約為 2.5×),即使假設 AI 完全沒有加快非程式碼工作的速度也是如此。 這份分析值得注意之處,與其說是數值,不如說是其穩健性:無論編碼與非編碼工作是互補品還是替代品,估計值都幾乎不變,背後的原因是數學上的巧合——8 ≈ e²。

這份備忘錄明確標示為意見:「METR 其他人並不同意」,而且「數學由 Claude 檢查,但沒有第二位人類複核」。應將 2.3–2.9× 的範圍視為一位審慎建模者根據單一由業者報告的程式碼行數數據所做的估計,而非已確立的測量結果。

轉換為生產函數#

研究人員的產出取決於兩種投入——產生的程式碼(q_n)與非程式碼產出(q_o:思考、寫作、實驗、溝通)。生產函數會將投入數量映射為研究總價值;研究人員效能提升 U 是 AI 導入後與導入前的產出比。可觀察數值是 M = 8,即測得的程式碼產出倍數——不是每小時編碼速度提升 g_n;由於研究人員會在編碼成本降低時重新分配時間,因此後者無法觀察。β 是 AI 導入前用於編碼的時間占比,全篇固定為 0.5(「大致是我詢問的人認為合理的中位數」;Kwa 指出此數值存在相當大的不確定性,但為求簡化而固定不變)。

Cobb-Douglas:U = M^β#

最簡單的模型。悲觀地假設非程式碼工作完全沒有效能提升(q_o 不變),則提升幅度可簡化為 U = M^β = √8 ≈ 2.83。

CES 與 8 ≈ e² 的穩健性#

CES 透過加入編碼與非編碼產出之間的替代彈性 σ,推廣 Cobb-Douglas 模型(σ→0 = 嚴格互補品,如左鞋與右鞋;σ→∞ = 完全替代品,如奶油與人造奶油;σ=1 則回到 Cobb-Douglas)。觀察到 M = 8 幾乎就能在不受 σ 影響的情況下確定 U:

σ推定的編碼速度提升 g_nAI 導入後編碼占比U
0.523.317%2.75
1.08.050%2.83
2.04.883%2.91
3.04.295%3.07

直觀來說,8× 的產出會限制兩個自由參數(編碼速度提升與程式碼的邊際價值)。如果兩者都高,產出就會超過 8×;如果兩者都低,產出就會低於 8×。只有介於兩者之間的搭配才符合 8×:速度提升高、邊際價值低(σ<1,研究人員離開編碼工作,轉向其他瓶頸),或速度提升低、邊際價值高(σ>1,研究人員投入更多時間做編碼)。兩種情況都會讓 U 接近 2.83。

這個巧合是:ln U 對 σ 的一階敏感度與 [−ln M + (ln M)²/2] 成正比,而此值在 M = e² ≈ 7.39 時會歸零。M = 8 時,此值約為 0.08(接近零),所以當 σ ∈ [0.5, 2] 時,U 都維持在 2.83 的 ±3% 之內。 Kwa 的結論是:「因為 8 ≈ e²,估計值對 σ 有穩健性。」

M = 8 也為 σ ≥ 0.5 設下下限:當 σ = 0(Leontief/完全互補)時,產出最多只能增加 1/(1−β) = 2×,因此 8× 根本不可能;若 σ 很小,就必須假設不合理的編碼速度提升(σ = 0.3 時 g_n ≈ 114),以及不合理地低的 AI 導入後編碼時間占比(3.5%)。這排除了編碼與非編碼研究之間存在強互補性的可能——也就是說,非程式碼工作並非嚴格瓶頸,不會限制程式碼加速所能帶動的總產出。

程式碼異質性:較低的估計範圍#

若 AI 對低風險程式碼的加速效果特別大(而這類程式碼通常每行價值也較低),8× 的數字就包含了大量廉價程式碼行,價值提升幅度也會較低。將程式碼建模為低風險與高風險工作的內層 CES(高風險工作的對數提升幅度為低風險工作的 1/3),在合理的低風險工作占比範圍 α ∈ [0.3, 0.9] 中,得出 U ∈ [2.33, 2.66]——低於同質模型的估計,但仍超過 2×。此模型對 σ 的穩健性較低(α = 0.9 時為 ±11%,同質模型則為 ±3%)。

優先採用程式碼產出,而非程式碼提升幅度#

方法上的啟示:估算研究人員效能提升時,測得的程式碼產出倍數(M)勝過每小時的編碼速度提升(g_n)。產出已透過研究人員實際重新分配時間的方式,反映程式碼的邊際價值;原始的每小時速度提升則沒有,而且根據它估算的效能提升對 σ 並不穩健。(穩健性在 M ≈ e² 附近最高,但以產出來估算,始終比以提升幅度來估算更穩健。)剩下的弱點是:產出仍會受到「非理性」時間分配變動的干擾(下文將說明),所以它真正指向的指標應是經品質調整的程式碼產出。

可能使提升幅度低於 2× 的三種情況#

Kwa 列出五項保留條件,其中三項較為合理:

  • 冗長——AI 對相同功能寫出更多程式碼行。METR 在 2025 年初進行的提升 RCT 發現,在允許使用 AI 的議題中,開發人員寫出的 LoC 多出 1.22–2.57×(95% CI)。如果 Anthropic 的冗長係數約為 1.83×,真正的程式碼產出就是 8/1.83 ≈ 4.4×,異質模型得出 U ∈ [1.84, 2.08]——正好落在 2× 門檻附近。Kwa 認為冗長程度有其上限:每人 LoC 在近期幾季從 2.5× 增至 5.8×,再到 8.0×;其中大部分增幅發生在程式碼已經主要由 AI 撰寫之後,因此不可能主要是冗長造成的。
  • 幾乎沒什麼用的「凱迪拉克」程式碼——新增的低風險程式碼,人工根本不會寫,對研究價值也不大(例如專案 DAG 視覺化工具、代理程式執行作業的網頁 UI、重複進行的統計方法重做)。CES 已透過報酬遞減反映這點;只有在非理性因素或單純的數量超出 CES 預測時,才需要再額外打折。
  • 非理性的時間分配——研究人員增加編碼時間是因為這件事有趣,而非因為有價值。引用的支持證據是:METR 先前發現,開發人員覺得自己快了約 20%,實際上卻慢了約 20%。冗長大致是固定比例,這種偏差則可能隨著效能提升幅度增加而惡化。

與 Anthropic 所說的「遠低於 2×」如何並存#

Anthropic 的 Mythos Preview 系統卡指出,整體 R&D 加速「遠低於可持續、可歸因於 AI 的倍增……且主要集中於工程執行,而非研究判斷。」這與研究人員效能提升超過 2× 並不矛盾——兩者估計的是不同數量:

  • Kwa 估算的是序列研究人員效能提升(僅計勞動力)。
  • Anthropic 估算的是整體 R&D 加速,其中也取決於運算資源——而運算資源的成長不計入研究人員效能提升。

Ryan Greenblatt 的分解式為:R&D speedup ≈ (serial labor acceleration)^0.55 × (compute)^0.45。因此,研究人員效能提升 2.83×,只代表 R&D 加速約 1.77×;而 Anthropic 的 R&D 2× 門檻則需要研究人員效能提升約 3.52×——「這基本上要求超過 90% 的編碼自動化」,而且「可能在未來一年左右發生」。Kwa 認為,即使是這個「令人安心」的 1.77×,仍令人擔憂:運算資源每年增加三倍(單靠 0.45 次方,就能讓研究投入每年增加約 1.6×),而且隨著模型進步,勞動力效能也在提升;兩種 R&D 投入都呈指數成長,在半內生增長模型下,這會維持研究產出的指數成長。(另見 Intelligence Explosion Dynamics、Effective Compute Scaling。)

延伸閱讀#

  • AI Accelerating AI Development——提供這份分析所建模的投入:Anthropic 每位工程師每日約 8× 的程式碼數據(該頁指出此數字「幾乎可以確定高估了真實生產力增益」);本頁則將這個原始倍數轉換為研究價值估計
  • AI R&D Autonomy Evaluation (AECI)——Anthropic 宣布轉向「直接測量 AI R&D 加速與研究人員效能提升」,但尚未將其落實為實際方法;這是 METR 從外部使用公開 LoC 數據,嘗試完成同一目標的第三方分析
  • Intelligence Explosion Dynamics——Greenblatt 的 labor^0.55 × compute^0.45 分解式,以及「兩種投入都呈指數成長 → 產出持續指數成長」的主張,都是關於增長動態的論點;本頁則提供其中勞動力一側的係數
  • Effective Compute Scaling——R&D 加速換算中「運算資源每年增加三倍」這項假設,是研究人員效能提升所乘上的運算資源投入
  • Research Taste as the Human Bottleneck——本模型只分析程式碼/工程效能提升,並將研究判斷視為未建模的剩餘部分(g_o = 1,非程式碼工作沒有提升);Anthropic 所說「主要集中於工程執行,而非研究判斷」,指的就是相同的品味/執行區分;若非程式碼工作的效能提升大於 1,就代表研究品味開始不再是瓶頸
  • Recursive Self-Improvement——這項換算直接關係到 Anthropic 自訂的 R&D 2× 門檻何時會觸發(Kwa 估計研究人員效能提升約 3.5×,可能「在未來一年左右」達成),是 RSI 軌跡上一個近期的具體指標
  • Expenditure Horizon——METR 在 2026 年從相反方向、得出相反正負號,對同一目標數量進行的另一項分析。本頁透過生產函數,從業者報告的程式碼產出倍數反推研究人員效能提升;該文則在實際最佳化問題中直接測量代理程式產出,並以美元計價。Kwa 得出「序列研究人員效能提升超過 2×」時,直接測量的結果是:一次 10K 美元的執行中,自主代理程式的價值相當於 1–2 位人類的貢獻。兩者可以並存(混合式效能提升與自主替代),合起來從兩端界定了這個問題
  • METR——Kwa 的雇主;這份備忘錄也引用 METR 自己的提升 RCT,估算冗長程度範圍,以及主觀與實際速度提升之間的落差
  • Anthropic——本篇討論的對象;8× 數據與「遠低於 2×」的主張都來自 Anthropic

待解決的問題#

  • 整套推論都建立在 β = 0.5(AI 導入前的編碼時間占比)之上,並且是「為求簡化」而固定。Kwa 指出這個數值存在相當大的不確定性;若改變 β,並根據 Anthropic 實際的時間使用數據測量,2.3–2.9× 的範圍會擴大多少?
  • 冗長程度與每行程式碼的價值是關鍵未知數,而且兩者「至少部分可以透過 Anthropic 內部數據解決」。會有實驗室公布經品質調整(而非僅計算 LoC)的程式碼產出衡量結果嗎?
  • Greenblatt 的勞動力/運算資源 0.55/0.45 分配本身也是一項假設。真正的 R&D 生產函數真的對勞動力如此不敏感嗎?若是如此,勞動力效能提升的重要性是否遠低於 RSI 討論所假設的程度?

資料來源#

  • Because 8 ≈ e², Anthropic's researcher uplift is plausibly >2x——Thomas Kwa (METR),「Because 8 ≈ e², Anthropic's researcher uplift is plausibly >2x」(2026-07-08),practitioner-opinion:以 Cobb-Douglas/CES/異質程式碼生產函數模型,將 8× 程式碼產出換算為約 2.3–2.9× 序列研究人員效能提升;分析對 σ 的穩健性;探討冗長、「凱迪拉克」程式碼與非理性因素等保留條件;並透過 Greenblatt 的 labor^0.55 × compute^0.45 換算序列效能提升與 R&D 加速
§ end
Cited by 11
  • AI Accelerating AI Development×4

    They diverge because the work itself moved. Brown's mechanism is jaggedness plus substitution: the…

  • AI R&D Autonomy Evaluation (AECI)×3

    The shift to "direct measurement of AI R&D acceleration and researcher uplift" is announced but not…

  • Intelligence Explosion Dynamics×3

    Researcher Uplift From Code Output — supplies the labor-side coefficient for the growth question:…

  • METR×2

    METR also runs the research showing developer self-estimates of AI uplift are overstated — how does…

  • Open Questions Backlog×2

    Researcher Uplift From Code Output: Verbosity and value-per-line are the load-bearing unknowns, and…

  • Claude Opus 5.5

    Researcher Uplift From Code Output — the ~1.5X (30% chance of 2X) figure is a new, still-opaque…

  • Effective Compute Scaling

    Researcher Uplift From Code Output — the compute-side term in the labor-vs-compute R&D…

  • Expenditure Horizon

    Researcher Uplift From Code Output — METR's other 2026 attempt at the same target quantity from the…

  • Superintelligence Trajectory

    Researcher Uplift From Code Output — Thomas Kwa (METR) translates Anthropic's reported 8×…

  • Recursive Self-Improvement

    Researcher Uplift From Code Output — a near-term marker on this trajectory: METR's Kwa back-solves…

  • Research Taste as the Human Bottleneck

    Researcher Uplift From Code Output — the quantitative shadow of this split: Kwa's model prices…

Related articles
  • Task Time-Horizon Scaling

    METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…

  • AI R&D Autonomy Evaluation (AECI)

    How Anthropic measures whether a model can automate or dramatically accelerate AI research — the capability that drives…

  • AI Accelerating AI Development

    The empirical core of *When AI builds itself*: measured evidence AI already speeds AI R&D at Anthropic — >80% of merged…

  • Domestic Frontier Pacing

    AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…

  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…