資料來源#
摘要#
METR 的 Thomas Kwa(2026-07-08,practitioner-opinion)探討 Anthropic 回報的 每位工程師每日合併的程式碼增加 8 倍(AI Accelerating AI Development)對序列研究者提升幅度的意義——也就是研究者總有效研究產出的提升倍數。Kwa 將單一數字 M = 8 代入標準的生產函數後估計,即使假設非程式碼工作完全沒有 AI 加速,僅由程式碼代理帶來的提升幅度仍穩健地超過 2 倍(中心估計約 2.5 倍)。這項結果值得注意的地方與其數值相比,更在於其穩健性:無論程式碼與非程式碼工作是互補還是替代,估計值幾乎都不變,這要歸功於一項數學巧合——8 ≈ e²。
這篇筆記明確標示為意見:「METR 的其他人並不同意」,且「數學由 Claude 檢查過,但沒有第二位人類檢查」。應將 2.3–2.9 倍的區間視為一位謹慎的建模者,根據單一供應商回報的程式碼行數數字所做的估計,而非已確立的測量結果。
生產函數的轉換#
研究者的產出取決於兩項輸入——產生的程式碼(q_n)與產生的非程式碼(q_o:思考、寫作、實驗、溝通)。生產函數會將輸入數量映射為研究總價值;研究者提升幅度 U 是 AI 後/AI 前的產出比率。可觀測量是 M = 8,也就是測得的程式碼產出倍數——而不是每小時的程式碼加速倍數 g_n;後者無法觀測,因為程式碼變得更便宜時,研究者會重新分配時間。β 是 AI 前投入程式碼工作的時間比例,全程固定為 0.5(「大致是我詢問的人認為合理的中位數」;Kwa 指出存在相當大的不確定性,但為了簡化而固定)。
Cobb-Douglas:U = M^β#
最簡單的模型。悲觀地假設非程式碼提升幅度為零(q_o 不變),提升幅度便縮減為 U = M^β = √8 ≈ 2.83。
CES 與 8 ≈ e² 的穩健性#
CES 透過加入程式碼與非程式碼產出之間的替代彈性 σ,將 Cobb-Douglas 推廣開來(σ→0 = 嚴格互補,如左鞋與右鞋;σ→∞ = 完全替代,如奶油與人造奶油;σ=1 恢復 Cobb-Douglas)。觀察到 M = 8 幾乎不受 σ 影響地鎖定了 U:
| σ | 推導出的程式碼加速倍數 g_n | AI 後程式碼比例 | U |
|---|---|---|---|
| 0.5 | 23.3 | 17% | 2.75 |
| 1.0 | 8.0 | 50% | 2.83 |
| 2.0 | 4.8 | 83% | 2.91 |
| 3.0 | 4.2 | 95% | 3.07 |
直觀來說,8 倍的產出會限制兩個自由參數(程式碼加速倍數與程式碼的邊際價值)。如果兩者都很高,產出就會超過 8 倍;如果兩者都很低,產出就會低於 8 倍。只有中間的權衡——高加速倍數 + 低邊際價值(σ<1,研究者為了其他瓶頸而逃離程式碼工作),或低加速倍數 + 高邊際價值(σ>1,研究者會大量投入程式碼工作)——才與恰好 8 倍一致,而兩者都會讓 U 落在 2.83 附近。
這項巧合是:ln U 對 σ 的一階敏感度與 [−ln M + (ln M)²/2] 成正比,而該表達式在 M = e² ≈ 7.39 時消失。在 M = 8 時,其值約為 0.08(接近零),因此對於 σ ∈ [0.5, 2],**U 維持在 2.83 的 ±3% 以內。**Kwa 的結論是:「因為 8 ≈ e²,這項估計對 σ 具有穩健性。」
M = 8 也會為 σ ≥ 0.5 設定下限:當 σ = 0(Leontief/完全互補)時,產出最多只能增加 1/(1−β) = 2×,因此 8 倍在此模型下完全不可能;較小的 σ 會要求不合理的程式碼加速倍數(σ = 0.3 時 g_n ≈ 114)以及不合理的低 AI 後程式碼時間比例(3.5%)。這排除了程式碼與非程式碼研究之間的強互補性——也就是說,非程式碼工作並不是限制程式碼加速能將總產出推高多少的嚴格瓶頸。
程式碼異質性:較低的區間#
如果 AI 對低風險程式碼的加速幅度特別大(而這類程式碼通常每行的價值也較低),8 倍數字就會被便宜的程式碼行數墊高,價值提升幅度也會較低。將程式碼建模為低風險與高風險工作之間的內層 CES(高風險工作的對數提升幅度為前者的 1/3),在合理的低風險工作比例範圍 α ∈ [0.3, 0.9] 中,得到 U ∈ [2.33, 2.66]——低於同質模型的估計,但仍超過 2 倍。這個模型不像同質模型那麼不受 σ 影響(α = 0.9 時為 ±11%,同質模型則為 ±3%)。
優先採用程式碼產出,而非程式碼提升幅度#
方法論上的重點是:要估計研究者提升幅度,測得的程式碼產出倍數(M)優於每小時的程式碼加速倍數(g_n)。產出已透過研究者實際進行的時間重新分配,將程式碼的邊際價值納入價格;原始的每小時加速倍數則沒有,因此其提升幅度估計對 σ 並不穩健。(穩健性在 M ≈ e² 附近達到高峰,但產出始終比提升幅度更穩健。)剩餘的弱點是:產出仍會受到「非理性」時間分配變化的干擾(如下),因此它真正指向的指標是經過品質調整的程式碼產出。
它可能低於 2 倍的三種方式#
Kwa 列出了五項限制,其中三項較為合理:
- 冗長性——AI 為了相同功能寫出更多程式碼行。METR 自己在 2025 年初進行的提升幅度 RCT 發現,在允許使用 AI 的問題上,開發者寫出的 LoC 多了 1.22–2.57 倍(95% CI)。如果 Anthropic 的冗長性因素約為 1.83 倍,真正的程式碼產出就是
8/1.83 ≈ 4.4×,而異質模型會給出U ∈ [1.84, 2.08]——正好落在 2 倍門檻附近。Kwa 認為冗長性有上限:近期幾季每人 LoC 從 2.5 倍→5.8 倍→8.0 倍增加,而其中大部分上升發生在程式碼已經由 AI 撰寫多數之後,因此不可能主要是冗長性造成的。 - 幾乎沒有用的(「Cadillac」)程式碼——新的低風險程式碼,若由人工撰寫,原本根本不會被寫出來,對研究價值也很低(例如專案 DAG 視覺化工具、供代理執行使用的網頁 UI、重複進行統計方法論)。CES 已透過報酬遞減對此進行折扣;只有在非理性程度或純粹的程式碼數量超出 CES 預測時,才需要進一步折扣。
- 非理性的時間分配——研究者因為寫程式碼很有趣而增加寫程式碼的時間,而不是因為它有價值。支持這項說法的證據是:METR 先前發現,開發者感覺自己加快了約 20%,但實際上卻慢了約 20%。與冗長性(大致是固定因素)不同,這種偏差很可能會隨著提升幅度增加而惡化。
與 Anthropic 的「遠低於 2 倍」如何調和#
Anthropic 的 Mythos Preview 系統卡片表示,整體 R&D 加速「遠低於可持續、可歸因於 AI 的翻倍……而且集中於工程執行,而非研究判斷」。這與研究者提升幅度 >2 倍並不矛盾——兩者估計的是不同的量:
- Kwa 估計的是序列研究者提升幅度(僅勞動力)。
- Anthropic 估計的是整體 R&D 加速,而這也取決於算力——算力成長不計入研究者提升幅度。
Ryan Greenblatt 的分解是:R&D speedup ≈ (serial labor acceleration)^0.55 × (compute)^0.45。因此,2.83 倍的研究者提升幅度只代表約 1.77 倍的 R&D 加速;而 Anthropic 的 2 倍 R&D 門檻則需要約 3.52 倍的研究者提升幅度——「這基本上要求程式碼被自動化超過 90%」,而且「可能在未來一年左右發生」。Kwa 認為即使「令人安心」的 1.77 倍也令人警覺:當算力每年增加三倍(僅透過 0.45 指數,就能獨自帶來每年約 1.6 倍的研究輸入成長),而且隨著模型進步,勞動力提升幅度也持續上升時,兩種 R&D 輸入都會呈指數成長——而在半內生增長模型下,這會維持研究產出的指數增長。(參見 Intelligence Explosion Dynamics、Effective Compute Scaling。)
相關連結#
- AI Accelerating AI Development——提供這篇筆記建模的輸入:Anthropic 每位工程師每日約 8 倍的程式碼數字(該頁指出這「幾乎肯定高估了真正的生產力提升」);本頁則是將該原始倍數轉換為研究價值估計的經濟學翻譯
- AI R&D Autonomy Evaluation (AECI)——Anthropic 宣布轉向「直接測量 AI R&D 加速與研究者提升幅度」,但尚未將其操作化;這是第三方(METR)從外部、僅使用公開 LoC 數字,嘗試進行完全相同工作的成果
- Intelligence Explosion Dynamics——Greenblatt 的
labor^0.55 × compute^0.45分解,以及「兩種輸入皆呈指數成長 → 產出持續呈指數成長」的主張,都是增長動力學論證;這篇筆記提供了其中的勞動力側係數 - Effective Compute Scaling——R&D 加速調和中「算力每年增加三倍」一詞,是研究者提升幅度與之相乘的算力側輸入
- Research Taste as the Human Bottleneck——模型隔離了程式碼/工程提升幅度,並將研究判斷視為未建模的殘差(
g_o = 1,非程式碼提升幅度為零);Anthropic 所說的「集中於工程執行,而非研究判斷」正是同一種品味/執行分野,而非程式碼提升幅度 > 1 則代表品味開始下降 - Recursive Self-Improvement——這項調和直接關係到 Anthropic 自己的 2 倍 R&D 門檻何時達成(Kwa:研究者提升幅度約 3.5 倍,「未來一年左右」),是 RSI 軌跡上的一個具體近期指標
- METR——Kwa 的雇主;這篇筆記也依靠 METR 自己的提升幅度 RCT 來界定冗長性區間,以及主觀感受與實際加速之間的落差
- Anthropic——研究對象;8 倍數字與「遠低於 2 倍」的說法都來自 Anthropic
開放問題#
- 整條推導鏈都建立在β = 0.5(AI 前投入程式碼工作的時間比例)上,並且是「為了簡化」而固定的。Kwa 指出存在相當大的不確定性;一旦改變 β,並以 Anthropic 的實際時間使用資料進行測量,2.3–2.9 倍的區間會擴大多少?
- 冗長性與每行程式碼的價值是承重的未知數,而且兩者「至少部分可以透過 Anthropic 內部資料解決」。是否會有實驗室發布品質調整後(而不只是 LoC)的程式碼產出衡量方式?
- Greenblatt 的 0.55/0.45 勞動力/算力分配本身就是一項假設。真正的 R&D 生產函數是否真的對勞動力如此不敏感——如果是,勞動力提升幅度是否遠比 RSI 論述所假設的更不重要?
資料來源#
- Because 8 ≈ e², Anthropic's researcher uplift is plausibly >2x——Thomas Kwa (METR),"Because 8 ≈ e², Anthropic's researcher uplift is plausibly >2x"(2026-07-08),
practitioner-opinion:以 8 倍程式碼產出轉換為約 2.3–2.9 倍序列研究者提升幅度的 Cobb-Douglas/CES/異質程式碼生產函數模型;對 σ 的穩健性結果;冗長性/Cadillac 程式碼/非理性限制;透過 Greenblatt 的labor^0.55 × compute^0.45調和序列提升幅度與 R&D 加速
Cited by 10
- AI Accelerating AI Development×3
LOC, self-reports, and headroom-dependent multiples all overstate; what unbiased throughput metric…
- AI R&D Autonomy Evaluation (AECI)×2
The shift to "direct measurement of AI R&D acceleration and researcher uplift" is announced but not…
- METR×2
METR also runs the research showing developer self-estimates of AI uplift are overstated — how does…
- Open Questions Backlog×2
Researcher Uplift From Code Output: Verbosity and value-per-line are the load-bearing unknowns, and…
- Effective Compute Scaling
Researcher Uplift From Code Output — the compute-side term in the labor-vs-compute R&D…
- Expenditure Horizon
Researcher Uplift From Code Output — METR's other 2026 attempt at the same target quantity from the…
- Intelligence Explosion Dynamics
Researcher Uplift From Code Output — supplies the labor-side coefficient for the growth question:…
- Superintelligence Trajectory
Researcher Uplift From Code Output — Thomas Kwa (METR) translates Anthropic's reported 8×…
- Recursive Self-Improvement
Researcher Uplift From Code Output — a near-term marker on this trajectory: METR's Kwa back-solves…
- Research Taste as the Human Bottleneck
Researcher Uplift From Code Output — the quantitative shadow of this split: Kwa's model prices…
Related articles
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
- AI R&D Autonomy Evaluation (AECI)
How Anthropic measures whether a model can automate or dramatically accelerate AI research — the capability that drives…
- AI Accelerating AI Development
The empirical core of *When AI builds itself*: measured evidence AI already speeds AI R&D at Anthropic — >80% of merged…
- Recursive Self-Improvement
An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…
- Multi-Agent Collective Intelligence
DeepMind's fourth pathway to ASI: superintelligence as an emergent property of many coordinated AGI agents — group agen…
