H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

有效運算擴展

DeepMind 將運算成長描述為每年約 10× 的「有效運算」——由硬體改良(約 1.5×/年)、運算投資(約 2.5×/年)與演算法效率(約 3–6×/年)相乘而得——以及決定通往 ASI 的擴展路徑能持續多久的資料牆與經濟摩擦

Article metadata
Publication details
Published:June 15, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:Governance WorkforceScalingComputeForecastingData Wall
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

有效運算擴展的插圖

資料來源#

摘要#

《From AGI to ASI》報告以有效運算作為預測的基礎——這是一個將三項各自持續改善的因素相乘後得到的單一成長率。Epoch 估計其成長率為每年約 10×(每年一個數量級),作者稱這是保守的低端數字。這是唯一有歷史資料可用來配適預測模型的 通往 ASI 的路徑,因此屬於「一切照常」的擴展,也是報告中最容易量化掌握的指標。

三項相乘因素#

因素速度備註
硬體製造(摩爾定律及相關趨勢)~1.5×/yr每美元可取得的運算量,已持續六十年——最不具不確定性的因素
運算投資成長~2.5×/yr過去十年間硬體支出持續增加
演算法效率~3×/yr(Epoch:最高約 ~6×)達到固定效能門檻(例如 AlexNet-on-ImageNet)所需 FLOPs,以約為摩爾定律兩倍的速度下降;主要來自許多漸進式改良層層累積,而非罕見突破

硬體 × 投資 ≈ 每年 4× 的運算支出,用於最大型的訓練工作。再納入演算法效率(「彷彿硬體設備規模擴大」的效果),便得到每年約 10× 的有效運算(1.5 × 2.5 × 3 ≈ 11.25,向下取整)。若持續十年,今天的規模將增加 10,000×。各因素的不確定性會層層累積,因此實際速度可能大幅高於或低於估計值——而且可能正在加速。

關鍵未解問題:運算能否轉化為能力?#

運算成長容易預測;但它如何轉化為新能力,則無法預測。可能有三種情況:報酬遞減(進展緩慢)、成比例(指數成長),或在遞迴式改良之下呈超指數成長。報告的關鍵細節是:即使個別模型的進展停滯,持續增加的運算仍能透過執行更多個體、以更快速度、思考更久,來提升整體能力。因此,「只是」量化擴展也可能帶來看似質變的進步——例如 1,000 個 AGI 個體一年後增至 10,000 個,五年後增至 1 億個(或以 100× 速度執行 100 萬個體)。這是否構成 ASI,正是擴展爭論的核心(見苦澀的教訓:「更多運算 → 更多搜尋 → 更高智慧」;但要注意,天真的暴力搜尋在玩具領域之外會失效,進展來自更好的先驗/啟發式方法)。

資料牆#

第一個主要摩擦是:高品質資料即將耗盡,無法用來預訓練越來越大的模型;估計這問題會在本世紀 20 年代後期開始顯現(Villalobos et al. 2024)。模型規模的成長速度已超過新的人類文字資料產出速度。報告權衡了以下幾種對策:

  • 合成/自行生成的資料——天真反覆訓練有退化風險(Shumailov et al. 2024),但將測試時搜尋結果蒸餾回模型(AlphaZero-style),能產生「略超越前沿」的資料;若數十億使用者投入測試時運算,這可能成為真正的遞迴式改良引擎。
  • 模擬與互動資料(RL、多代理、多代理生成模型)——只要有良好的模擬器,便能隨運算量直接擴大;例如 DeepMind 的 Adaptive Agent。
  • 其他模態(影像/音訊/影片)能延長可用時間,但光靠人類產製,成長速度仍不夠快。

結論:很可能是摩擦,而非根本障礙——若 ASI 是由擴展所驅動,資料生成便有可能透過運算以相近速度擴大。

「將測試時搜尋結果蒸餾回模型」背後的具體機制,以及它實際的上限。STaR是這類對策的小型可行版本:生成推理鏈,保留廉價驗證器判定正確的部分,進行微調,再重複。對本文而言,它證明自行生成資料的限制不在運算量。這個循環幾次迭代後就會停滯;限制來自基礎模型的能力範圍——它無法造出模型原本做不到的推理步驟——以及驗證器是否可用。這也是為什麼相關研究幾乎都集中於數學與程式碼。因此,資料牆的這條逃生路徑確實存在,FLOPs 成本低,但受制於本文沒有預測的因素。

再看 2025 年底的一項數字:前沿訓練中有多少比例已是 RL。Aakanksha Chowdhery在CS329A第 6 堂課(2025-10-10 授課,practitioner-opinion,明確不是在描述任何實驗室公開的數字)估計,RL 與預訓練的比例從一年前約 99:1 變為可能的 95:5,而 Grok 4 公開聲稱 RL 佔 50%。她在同一句話中也評價這項做法:比例並*「沒有相應地提升多少」,因為「瓶頸在於獎勵不夠強,或獎勵裡有雜訊。」*本文應從中讀出的重點是:後訓練在邊際上受限的不是運算,而是獎勵;即使增加它在訓練中的佔比,也不一定能明顯轉化為成果。

經濟與資源摩擦#

如果進展主要仰賴擴展,關鍵問題便是:擴展好幾個數量級的經濟成本能否持續——而這又取決於 AI 帶來的經濟報酬,兩者形成循環關係。相鄰的限制還包括能源建設、土地/用水、稀土,以及環境足跡(軌道資料中心等特殊提案也有自身風險)。即使原始 FLOPs 充足,記憶體頻寬與互連瓶頸仍可能限制有效運用率。若進展改由演算法創新/自我改良/典範轉移帶動,所需的經濟投入便會較慢增加,此時這只構成邊際摩擦。

哪項限制最關鍵,又在哪裡(Musk,2026 年 7 月)#

Musk接受《經濟學人》訪問時,將前述能源摩擦收窄為一項關於地理位置的主張。值得記錄這項說法,因為報告將能源視為沒有區別的單一限制(prediction 層級——由具利害關係的一方提出,未經測量的主張;以下均為他的說法):

  • 在中國以外,瓶頸是電力,而非晶片。「AI 晶片的生產速度超過新增電力上線的速度」——他特別指出電力與冷卻才是瓶頸,因為「AI 晶片的電力需求非常非常高。」他另稱用水足跡的疑慮「微不足道,幾乎沒有」,這與前文土地/用水的描述相反。
  • 在中國境內,瓶頸是晶片,原因是美國出口管制——但中國「在光刻問題上比大多數人想的更接近解決方案」,而且中國實驗室在運算資源少得多的情況下已具競爭力(Kimi K3)。
  • **電力缺口是結構性的不對稱。**中國「目前的電力已多於美國、歐洲和印度的總和」,他估計中國的發電量會達到美國的約 4×。依他的分析,誰先解決自身瓶頸,誰就會領先:「如果他們有大量運算資源,很有可能成為領先者,而他們遲早會有大量運算資源。」
  • 軌道資料中心是明確提出的替代方案,他也精確說明其後果:「一旦我們透過在太空建置 AI 資料中心解決電力限制,中國以外的瓶頸就會再次變成晶片」——也就是說,依他的說法,本節提到的特殊方案只是讓限制轉換,而非消除。

對照上節,這項說法的價值在於指出限制的先後順序:報告將能源列為數項相鄰限制之一,Musk 則主張目前除了中國以外,所有地方的首要瓶頸都是能源。語料中沒有任何資料能測量或驗證這一點;而他在電力建設與軌道資料中心方案上都有直接商業利益。

延伸閱讀#

  • 以基準門檻進行治理:指標在義務得以依據之前必須證明什麼 — 說明為何擴展步調設計中的義務可實際執行,但能力指標不行:總運算量的占比可供稽核,且無須計算 FLOPs,正因有效運算每年成長約 10×;這也解釋了為何固定 FLOP 門檻會像基準門檻一樣迅速失效

  • AGI-to-ASI Pathways — 擴展是路徑 1;本文是其量化引擎,並探討兩項主要摩擦(資料牆、經濟因素)

  • Intelligence Explosion Dynamics — 運算成長是遞迴循環加速的基礎;報酬是成比例還是呈雙曲線,將決定所處的成長模式

  • Task Time-Horizon Scaling — METR 的時間範圍趨勢線,是運算曲線在能力面向的互補觀點(Whitfill et al. 在運算預測下建模時間範圍成長)

  • The Bitter Lesson — 「擴展是否足夠?」是以預測問題形式呈現的苦澀教訓;搜尋需要良好先驗,而不只是更多 FLOPs

  • Multi-Agent Collective Intelligence — 「模型停滯,但增加個體數量」的論點,將擴展導向集體能力

  • Large-Scale Test-Time Compute — 同一運算預算問題的另一面,也是語料中唯一明確說明兩者取捨之處:Snell et al.(透過 CS329A 第 2 堂課)發現,在簡單與中等難度問題上,增加推論 token 優於增加預訓練;在最難的問題上則較差。成本計算上的不對稱在於,預訓練只需付費一次,推論則每次查詢都要付費

  • Rationale Bootstrapping (STaR) — 資料牆提出的逃生路徑,已有實作與測量:自行生成且經驗證的推理資料確實有效,但幾輪後就會停滯,限制因素是基礎模型與驗證器,而非運算

  • Fundamental Limits of ASI — 說明能力預測為何必須以實證為先:理論只能得出空泛的否定結論

  • Advantages of Digital Intelligence — 這些正是會隨運算擴展的 AI 特性,因此有效運算越多,人類與 AI 之間的差距就越大

  • Universal AI (AIXI) — AIXI 的近似方法保證會隨運算量提升,但暴力搜尋若要帶來線性智慧增長,就需要極高的增長速度——這是「擴展是否足夠?」的理論後盾

  • Inference Efficiency as Capability — 從推論角度看演算法效率因素:KV-cache、量化與推測解碼的改良,會提高服務階段每美元的有效運算量,而不只是在訓練階段

  • Cross-Lab Pre-Release Review — 說明前述運算地理分布為何是治理上的事實:若中國以外受電力瓶頸限制、中國境內受晶片瓶頸限制,兩者都只是暫時的;只由美國組成的審查團體,能治理的前沿發布占比將逐漸縮小

  • Researcher Uplift from Code Output — 勞動與運算的 R&D 分解中,屬於運算一側的因素:Kwa 指出,運算每年增加三倍,透過運算約 0.45 的指數,研究投入便已每年增長約 1.6×,不受任何勞動提升影響,因此兩種投入都會層層累積

  • Balance-of-Power Superintelligence — Zuckerberg 的 RSI 段落,是本文演算法效率因素中的失控增長(每 gigawatt 增長 100x);他提出的補救方法則是擴大分母:由實驗室與雲端業者共同建置足夠運算資源,讓大部分資源仍用於人類選定的目標

  • The Data Wall and the Validation Commons Are One Supply Constraint — 以語料中實際測量的部分重新估算資料牆,並發現它與勞動供給問題其實相同:自行生成資料的 FLOPs 成本低,但受限於驗證器是否存在、驗證器速度及生成器多樣性;因此這項摩擦不會轉化為運算問題,而會轉為驗證摩擦,真正受限的供應是經驗證的判斷,而非 token

  • Domestic Frontier Pacing — 將本文的數量用作監管上的分母。該提案中的每個比例(至少 70% 用於外部推論、至少 25% 用於透明安全措施、5% 用於能力 R&D,或完整暫停時將 100% 用於推論)都是公司總運算量的占比,因此步調規則能限制能力投資的速度,無須指定 FLOP 數量,而該數字會因每年約 10 倍的成長在一年內過時。本文也提供今日估計的分配作為比較——約 50% 用於推論、2% 用於安全、48% 用於能力 R&D;三者皆是提案者的估計值

待解決的問題#

  • 更多運算何時能可靠地帶來更多智慧——只對某些問題類別成立,還是普遍成立?量化與質化擴展能否互相取捨?
  • 資料生成(合成、模擬、互動)能否真正跟上模型規模成長,還是資料牆會先成為瓶頸?The Data Wall and the Validation Commons Are One Supply Constraint於 2026-08-17 部分回答了這個問題,也改變了問題的衡量單位。在可驗證領域內,資料生成跟得上;在領域之外則無法跟上,因為語料中所有自行生成資料成果的關鍵限制都不是運算:STaR 幾輪後便停滯;Multiagent Finetuning 將機制稱為多樣性崩潰(單一模型生成的內容會「即使在高溫度下也趨於一致」);溫度約 1.2 的上限,以及「抽樣增加 10×,但多樣性未增加,成果就不會改善」這項界限,都指出推論時存在同一限制;而 Absolute Zero 只有在直譯器能取代人類提問者時,才免除人類出題者。再加上 CS329A 第 9 堂課提出的驗證器延遲面向——耗時數日的晶片模擬器是完美的驗證器,卻無法用來評估數千個 RL 步驟——供應量因此受驗證器是否存在、速度與生成器多樣性限制,這些都不是 FLOPs。於是 token 牆在抵達之前就已轉移,而非成為瓶頸或消失。問題仍未定論,原因在於證據:上文屬於 prediction(DeepMind 認為這只是「摩擦,而非根本障礙」);反方論據則是從投影片讀出的 practitioner-opinion,來自論文未收錄於 raw/ 的課程;而語料中沒有任何 empirical 前沿規模資料能證明資料供應的情況。要解決這個問題,需要各代模型公布合成資料與人類資料的占比,並與有效運算量對照;在前沿規模上將嵌入差異度與準確率一併繪圖;以及提供自提課程的 pass@K。
  • 擴展何時(如果會的話)在經濟上變得不可行?硬體/軟體效率趨勢又會如何改變這個時間點?

資料來源#

  • From AGI to ASI — 第 2 節(有效運算成長因素)、第 5.1 節(擴展路徑)、第 5.5 節(資料牆、經濟因素)、表 4
  • CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL — Stanford CS329A 第 6 堂課(Aakanksha Chowdhery,2025-10-10 授課,2026-08-03 發布,practitioner-opinion,自動字幕逐字稿):本文引用此資料,只用來說明 STaR 停滯是資料牆逃生路徑經測量後的上限,以及結尾問答中對 RL 占訓練運算比例的估計和 Grok 4 的比較。兩者都是講者回憶,沒有來源佐證,且是對 2025 年底情況的回述
§ end
Cited by 24
Related articles
  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…

  • Intelligence Explosion Dynamics

    The growth-curve question behind recursive self-improvement: whether AI-accelerating-AI produces exponential, super-exp…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Compute-Controlled Benchmarking

    Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…

  • The Abstraction Barrier

    Lerchner's hypothesis that AI trained on human concepts may be unable to discover genuinely novel conceptual primitives…