資料來源#
摘要#
《From AGI to ASI》報告以有效運算作為預測的基礎——這是一個將三項各自持續改善的因素相乘後得到的單一成長率。Epoch 估計其成長率為每年約 10×(每年一個數量級),作者稱這是保守的低端數字。這是唯一有歷史資料可用來配適預測模型的 通往 ASI 的路徑,因此屬於「一切照常」的擴展,也是報告中最容易量化掌握的指標。
三項相乘因素#
| 因素 | 速度 | 備註 |
|---|---|---|
| 硬體製造(摩爾定律及相關趨勢) | ~1.5×/yr | 每美元可取得的運算量,已持續六十年——最不具不確定性的因素 |
| 運算投資成長 | ~2.5×/yr | 過去十年間硬體支出持續增加 |
| 演算法效率 | ~3×/yr(Epoch:最高約 ~6×) | 達到固定效能門檻(例如 AlexNet-on-ImageNet)所需 FLOPs,以約為摩爾定律兩倍的速度下降;主要來自許多漸進式改良層層累積,而非罕見突破 |
硬體 × 投資 ≈ 每年 4× 的運算支出,用於最大型的訓練工作。再納入演算法效率(「彷彿硬體設備規模擴大」的效果),便得到每年約 10× 的有效運算(1.5 × 2.5 × 3 ≈ 11.25,向下取整)。若持續十年,今天的規模將增加 10,000×。各因素的不確定性會層層累積,因此實際速度可能大幅高於或低於估計值——而且可能正在加速。
關鍵未解問題:運算能否轉化為能力?#
運算成長容易預測;但它如何轉化為新能力,則無法預測。可能有三種情況:報酬遞減(進展緩慢)、成比例(指數成長),或在遞迴式改良之下呈超指數成長。報告的關鍵細節是:即使個別模型的進展停滯,持續增加的運算仍能透過執行更多個體、以更快速度、思考更久,來提升整體能力。因此,「只是」量化擴展也可能帶來看似質變的進步——例如 1,000 個 AGI 個體一年後增至 10,000 個,五年後增至 1 億個(或以 100× 速度執行 100 萬個體)。這是否構成 ASI,正是擴展爭論的核心(見苦澀的教訓:「更多運算 → 更多搜尋 → 更高智慧」;但要注意,天真的暴力搜尋在玩具領域之外會失效,進展來自更好的先驗/啟發式方法)。
資料牆#
第一個主要摩擦是:高品質資料即將耗盡,無法用來預訓練越來越大的模型;估計這問題會在本世紀 20 年代後期開始顯現(Villalobos et al. 2024)。模型規模的成長速度已超過新的人類文字資料產出速度。報告權衡了以下幾種對策:
- 合成/自行生成的資料——天真反覆訓練有退化風險(Shumailov et al. 2024),但將測試時搜尋結果蒸餾回模型(AlphaZero-style),能產生「略超越前沿」的資料;若數十億使用者投入測試時運算,這可能成為真正的遞迴式改良引擎。
- 模擬與互動資料(RL、多代理、多代理生成模型)——只要有良好的模擬器,便能隨運算量直接擴大;例如 DeepMind 的 Adaptive Agent。
- 其他模態(影像/音訊/影片)能延長可用時間,但光靠人類產製,成長速度仍不夠快。
結論:很可能是摩擦,而非根本障礙——若 ASI 是由擴展所驅動,資料生成便有可能透過運算以相近速度擴大。
「將測試時搜尋結果蒸餾回模型」背後的具體機制,以及它實際的上限。STaR是這類對策的小型可行版本:生成推理鏈,保留廉價驗證器判定正確的部分,進行微調,再重複。對本文而言,它證明自行生成資料的限制不在運算量。這個循環幾次迭代後就會停滯;限制來自基礎模型的能力範圍——它無法造出模型原本做不到的推理步驟——以及驗證器是否可用。這也是為什麼相關研究幾乎都集中於數學與程式碼。因此,資料牆的這條逃生路徑確實存在,FLOPs 成本低,但受制於本文沒有預測的因素。
再看 2025 年底的一項數字:前沿訓練中有多少比例已是 RL。Aakanksha Chowdhery在CS329A第 6 堂課(2025-10-10 授課,practitioner-opinion,明確不是在描述任何實驗室公開的數字)估計,RL 與預訓練的比例從一年前約 99:1 變為可能的 95:5,而 Grok 4 公開聲稱 RL 佔 50%。她在同一句話中也評價這項做法:比例並*「沒有相應地提升多少」,因為「瓶頸在於獎勵不夠強,或獎勵裡有雜訊。」*本文應從中讀出的重點是:後訓練在邊際上受限的不是運算,而是獎勵;即使增加它在訓練中的佔比,也不一定能明顯轉化為成果。
經濟與資源摩擦#
如果進展主要仰賴擴展,關鍵問題便是:擴展好幾個數量級的經濟成本能否持續——而這又取決於 AI 帶來的經濟報酬,兩者形成循環關係。相鄰的限制還包括能源建設、土地/用水、稀土,以及環境足跡(軌道資料中心等特殊提案也有自身風險)。即使原始 FLOPs 充足,記憶體頻寬與互連瓶頸仍可能限制有效運用率。若進展改由演算法創新/自我改良/典範轉移帶動,所需的經濟投入便會較慢增加,此時這只構成邊際摩擦。
哪項限制最關鍵,又在哪裡(Musk,2026 年 7 月)#
Musk接受《經濟學人》訪問時,將前述能源摩擦收窄為一項關於地理位置的主張。值得記錄這項說法,因為報告將能源視為沒有區別的單一限制(prediction 層級——由具利害關係的一方提出,未經測量的主張;以下均為他的說法):
- 在中國以外,瓶頸是電力,而非晶片。「AI 晶片的生產速度超過新增電力上線的速度」——他特別指出電力與冷卻才是瓶頸,因為「AI 晶片的電力需求非常非常高。」他另稱用水足跡的疑慮「微不足道,幾乎沒有」,這與前文土地/用水的描述相反。
- 在中國境內,瓶頸是晶片,原因是美國出口管制——但中國「在光刻問題上比大多數人想的更接近解決方案」,而且中國實驗室在運算資源少得多的情況下已具競爭力(Kimi K3)。
- **電力缺口是結構性的不對稱。**中國「目前的電力已多於美國、歐洲和印度的總和」,他估計中國的發電量會達到美國的約 4×。依他的分析,誰先解決自身瓶頸,誰就會領先:「如果他們有大量運算資源,很有可能成為領先者,而他們遲早會有大量運算資源。」
- 軌道資料中心是明確提出的替代方案,他也精確說明其後果:「一旦我們透過在太空建置 AI 資料中心解決電力限制,中國以外的瓶頸就會再次變成晶片」——也就是說,依他的說法,本節提到的特殊方案只是讓限制轉換,而非消除。
對照上節,這項說法的價值在於指出限制的先後順序:報告將能源列為數項相鄰限制之一,Musk 則主張目前除了中國以外,所有地方的首要瓶頸都是能源。語料中沒有任何資料能測量或驗證這一點;而他在電力建設與軌道資料中心方案上都有直接商業利益。
延伸閱讀#
-
以基準門檻進行治理:指標在義務得以依據之前必須證明什麼 — 說明為何擴展步調設計中的義務可實際執行,但能力指標不行:總運算量的占比可供稽核,且無須計算 FLOPs,正因有效運算每年成長約 10×;這也解釋了為何固定 FLOP 門檻會像基準門檻一樣迅速失效
-
AGI-to-ASI Pathways — 擴展是路徑 1;本文是其量化引擎,並探討兩項主要摩擦(資料牆、經濟因素)
-
Intelligence Explosion Dynamics — 運算成長是遞迴循環加速的基礎;報酬是成比例還是呈雙曲線,將決定所處的成長模式
-
Task Time-Horizon Scaling — METR 的時間範圍趨勢線,是運算曲線在能力面向的互補觀點(Whitfill et al. 在運算預測下建模時間範圍成長)
-
The Bitter Lesson — 「擴展是否足夠?」是以預測問題形式呈現的苦澀教訓;搜尋需要良好先驗,而不只是更多 FLOPs
-
Multi-Agent Collective Intelligence — 「模型停滯,但增加個體數量」的論點,將擴展導向集體能力
-
Large-Scale Test-Time Compute — 同一運算預算問題的另一面,也是語料中唯一明確說明兩者取捨之處:Snell et al.(透過 CS329A 第 2 堂課)發現,在簡單與中等難度問題上,增加推論 token 優於增加預訓練;在最難的問題上則較差。成本計算上的不對稱在於,預訓練只需付費一次,推論則每次查詢都要付費
-
Rationale Bootstrapping (STaR) — 資料牆提出的逃生路徑,已有實作與測量:自行生成且經驗證的推理資料確實有效,但幾輪後就會停滯,限制因素是基礎模型與驗證器,而非運算
-
Fundamental Limits of ASI — 說明能力預測為何必須以實證為先:理論只能得出空泛的否定結論
-
Advantages of Digital Intelligence — 這些正是會隨運算擴展的 AI 特性,因此有效運算越多,人類與 AI 之間的差距就越大
-
Universal AI (AIXI) — AIXI 的近似方法保證會隨運算量提升,但暴力搜尋若要帶來線性智慧增長,就需要極高的增長速度——這是「擴展是否足夠?」的理論後盾
-
Inference Efficiency as Capability — 從推論角度看演算法效率因素:KV-cache、量化與推測解碼的改良,會提高服務階段每美元的有效運算量,而不只是在訓練階段
-
Cross-Lab Pre-Release Review — 說明前述運算地理分布為何是治理上的事實:若中國以外受電力瓶頸限制、中國境內受晶片瓶頸限制,兩者都只是暫時的;只由美國組成的審查團體,能治理的前沿發布占比將逐漸縮小
-
Researcher Uplift from Code Output — 勞動與運算的 R&D 分解中,屬於運算一側的因素:Kwa 指出,運算每年增加三倍,透過運算約 0.45 的指數,研究投入便已每年增長約 1.6×,不受任何勞動提升影響,因此兩種投入都會層層累積
-
Balance-of-Power Superintelligence — Zuckerberg 的 RSI 段落,是本文演算法效率因素中的失控增長(每 gigawatt 增長 100x);他提出的補救方法則是擴大分母:由實驗室與雲端業者共同建置足夠運算資源,讓大部分資源仍用於人類選定的目標
-
The Data Wall and the Validation Commons Are One Supply Constraint — 以語料中實際測量的部分重新估算資料牆,並發現它與勞動供給問題其實相同:自行生成資料的 FLOPs 成本低,但受限於驗證器是否存在、驗證器速度及生成器多樣性;因此這項摩擦不會轉化為運算問題,而會轉為驗證摩擦,真正受限的供應是經驗證的判斷,而非 token
-
Domestic Frontier Pacing — 將本文的數量用作監管上的分母。該提案中的每個比例(至少 70% 用於外部推論、至少 25% 用於透明安全措施、5% 用於能力 R&D,或完整暫停時將 100% 用於推論)都是公司總運算量的占比,因此步調規則能限制能力投資的速度,無須指定 FLOP 數量,而該數字會因每年約 10 倍的成長在一年內過時。本文也提供今日估計的分配作為比較——約 50% 用於推論、2% 用於安全、48% 用於能力 R&D;三者皆是提案者的估計值
待解決的問題#
- 更多運算何時能可靠地帶來更多智慧——只對某些問題類別成立,還是普遍成立?量化與質化擴展能否互相取捨?
- 資料生成(合成、模擬、互動)能否真正跟上模型規模成長,還是資料牆會先成為瓶頸?The Data Wall and the Validation Commons Are One Supply Constraint於 2026-08-17 部分回答了這個問題,也改變了問題的衡量單位。在可驗證領域內,資料生成跟得上;在領域之外則無法跟上,因為語料中所有自行生成資料成果的關鍵限制都不是運算:STaR 幾輪後便停滯;Multiagent Finetuning 將機制稱為多樣性崩潰(單一模型生成的內容會「即使在高溫度下也趨於一致」);溫度約 1.2 的上限,以及「抽樣增加 10×,但多樣性未增加,成果就不會改善」這項界限,都指出推論時存在同一限制;而 Absolute Zero 只有在直譯器能取代人類提問者時,才免除人類出題者。再加上 CS329A 第 9 堂課提出的驗證器延遲面向——耗時數日的晶片模擬器是完美的驗證器,卻無法用來評估數千個 RL 步驟——供應量因此受驗證器是否存在、速度與生成器多樣性限制,這些都不是 FLOPs。於是 token 牆在抵達之前就已轉移,而非成為瓶頸或消失。問題仍未定論,原因在於證據:上文屬於
prediction(DeepMind 認為這只是「摩擦,而非根本障礙」);反方論據則是從投影片讀出的practitioner-opinion,來自論文未收錄於raw/的課程;而語料中沒有任何empirical前沿規模資料能證明資料供應的情況。要解決這個問題,需要各代模型公布合成資料與人類資料的占比,並與有效運算量對照;在前沿規模上將嵌入差異度與準確率一併繪圖;以及提供自提課程的 pass@K。 - 擴展何時(如果會的話)在經濟上變得不可行?硬體/軟體效率趨勢又會如何改變這個時間點?
資料來源#
- From AGI to ASI — 第 2 節(有效運算成長因素)、第 5.1 節(擴展路徑)、第 5.5 節(資料牆、經濟因素)、表 4
- CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL — Stanford CS329A 第 6 堂課(Aakanksha Chowdhery,2025-10-10 授課,2026-08-03 發布,
practitioner-opinion,自動字幕逐字稿):本文引用此資料,只用來說明 STaR 停滯是資料牆逃生路徑經測量後的上限,以及結尾問答中對 RL 占訓練運算比例的估計和 Grok 4 的比較。兩者都是講者回憶,沒有來源佐證,且是對 2025 年底情況的回述
Cited by 24
- The Data Wall and the Validation Commons Are One Supply Constraint×4
Effective Compute Scaling carries DeepMind's verdict: running out of high-quality pretraining text…
- AGI-to-ASI Pathways×3
Effective Compute Scaling — pathway 1's quantitative engine and its data-wall/economic frictions
- Open Questions Backlog×3
Effective Compute Scaling (106d) — When does more compute reliably yield more intelligence — only…
- Aakanksha Chowdhery×2
The RL share of a training run, with a vendor claim graded against it. Asked what fraction of…
- Balance-of-Power Superintelligence×2
The numeric illustration — a self-improving system optimizing its own efficiency could "squeeze…
- Fundamental Limits of ASI×2
Effective Compute Scaling — why forecasting is empirical-first: theory gives only vacuous negatives
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It×2
Concept articles: Domestic Frontier Pacing and Frontier Ai Standards Body (the two proposals and…
- Intelligence Explosion Dynamics×2
Effective Compute Scaling — exponential compute growth is the substrate a recursive loop bends…
- Multi-Agent Collective Intelligence×2
Effective Compute Scaling — "individual model plateaus but run more instances" routes scaling into…
- Researcher Uplift from Code Output×2
Effective Compute Scaling — the "compute tripling yearly" term in the R&D-speedup reconciliation is…
- RSI Growth Curves: Which Friction Binds First?×2
from agi to asi — Google DeepMind (Genewein, Hutter, Legg et al., arXiv 2606.12683): three growth…
- Universal AI (AIXI)×2
This is the hub for the theory-of-superintelligence cluster: the formal anchor that Agi To Asi…
- Advantages of Digital Intelligence
Effective Compute Scaling — these advantages are precisely the ones that "scale with compute," so…
- Cross-Lab Pre-Release Review
Asked whether governments need to be involved, Musk volunteers that the group "probably should…
- Domestic Frontier Pacing
Effective Compute Scaling — the denominator every fraction here is taken of, and the reason the…
- Elon Musk
The compute geography — Effective Compute Scaling: power and cooling bind outside China, chips bind…
- Inference Efficiency as Capability
Effective Compute Scaling — efficiency gains enter the "effective compute" numerator the same way…
- Kimi (Moonshot AI)
He treats K3's efficiency as the headline, not its score. Chinese labs are "doing as well as they…
- Large-Scale Test-Time Compute
This is the vault's clearest late-2025 statement of the pre-training-versus-inference tradeoff, and…
- Superintelligence Trajectory
Effective Compute Scaling — DeepMind's framing of compute growth as ~10×/year of 'effective…
- Open Questions Dashboard
Effective Compute Scaling: Can data generation (synthetic, simulated, interactive) actually keep…
- Rationale Bootstrapping (STaR)
Effective Compute Scaling — the data-wall reading: this is the concrete mechanism behind…
- Task Time-Horizon Scaling
Effective Compute Scaling — the compute-side curve this capability-side trendline complements;…
- The Bitter Lesson
Effective Compute Scaling — "is scaling enough?" is the bitter lesson posed as a forecasting…
Related articles
- Recursive Self-Improvement
An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…
- Intelligence Explosion Dynamics
The growth-curve question behind recursive self-improvement: whether AI-accelerating-AI produces exponential, super-exp…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- The Abstraction Barrier
Lerchner's hypothesis that AI trained on human concepts may be unable to discover genuinely novel conceptual primitives…
