H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

人工超級智慧(ASI)

DeepMind 對 ASI 的非正式描述:在幾乎所有領域都超越大型、協調良好的人類專家群體;不同於其下方的人類水準 AGI,以及其上方不可計算的 Universal AI 極限;三者都是 Legg–Hutter 智慧連續體上的位置

Article metadata
Publication details
Published:June 15, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:LLM ArchitectureTheorySuperintelligenceCapability Trajectory
Reading:14 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

人工超級智慧(ASI)插圖

資料來源#

摘要#

DeepMind 的《From AGI to ASI》報告(Genewein、Hutter、Legg 等人,2026 年 6 月)刻意採用粗略、定性的描述,而非明確界定,並以平滑的 Legg–Hutter 智慧連續體為基礎:

  • AGI — 人類水準的人工通用智慧:在大多數認知任務上的表現大致相當於個人人類中位數(Morris et al. 2024 所稱的「Competent AGI」)。第一個 AGI 在許多任務上就已超越人類,但通用性還不足。
  • ASI — 人工通用超級智慧:在幾乎所有人類關注的任務與領域都超越人類。報告將門檻設得很高:在幾乎所有任務上,ASI 都超越大型、協調良好的人類專家群體(約數萬名專家共同工作約 10 年)所能達到的水準。狹義的超人系統(AlphaFold、AlphaGo)明確不算在內——ASI 必須具備通用性。
  • Universal AI(UAI) — 不可計算的理論極限(AIXI);ASI 從下方逼近它。

本頁是這個主題群的中心頁面:定義上的錨點,其他討論路徑、阻礙、限制與動態的頁面都圍繞著它。

為何採用粗略定義,而非門檻#

由於 Legg–Hutter 分數是一個連續體,報告不需要精確的 AGI/ASI 分界,只需要兩者之間有一段很大的差距,以便討論實現路徑與影響。作者補充了幾點說明:

  • 相對於人類的水準會隨時間改變(說明 IV):人類有更好的工具或教育,就會更有能力,因此「人類水準」會漂移。若推到極端,人類可以先打造 ASI,然後「在任何任務上達到 ASI 水準」——這顯然違背原意。因此 AGI 以當今的人類中位數為準。
  • 能力輪廓參差不齊(說明 III):分數隨運算量平滑變化,但具體系統相對於人類水準的能力表現則高低不一——AI 的進步並不均勻(Jagged Intelligence (Ghosts, Not Animals))。
  • 單一 ASI 可能是數百萬個平行運作的實例組成的集體;為避免糾結個體與集體的區分,門檻訂為超越大型專家群體(見 Multi-Agent Collective Intelligence)。

實務工作者的定義,以及降低門檻的誘因(Ng,2026 年 8 月)#

Andrew Ng 面向一般大眾提出的工作定義(Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think,Silicon Valley Girl,2026-08-28,practitioner-opinion)比報告以人類中位數為準的說法更嚴格:「能執行人類任何智力任務的 AI。」 他舉的兩個例子,設定的是學習效率門檻,而不是表現門檻——人腦*「可能花五年時間研讀並完成博士論文……那麼 AI 能不能寫博士論文?」;以及「人類可以透過……數十分鐘的練習,學會開卡車穿越茂密雨林。那 AI 何時能做到?」* 這就是報告視為可描述的限制之一的資料效率軸,而 Ng 將它設為 AGI 本身的門檻;就這個標準而言,他對時間表的說法是:「AI 還有一長串做不到的事,在我看來要再過幾十年。我希望只要幾十年。」(prediction 等級;除了列舉這些項目,沒有提供數字背後的論據。)

他補充了說明 IV 未談到的一點:目標改變不只是因為人類能力有所漂移,也有經濟因素。「OpenAI 有經濟誘因想早點宣告達到 AGI」——他指出,相關的 Microsoft 協議後來已重新協商——「所以……如果你提出其他定義……看你把門檻降得多低,就可能說自己早就達到 AGI……甚至 30 年前就達到了。」 他回應的低門檻說法,是主持人轉述 Jensen Huang 所稱的 AGI 已經到來。報告採用粗略定義的策略,在一方面不受此影響——AGI 與 ASI 之間有一段很大的差距的連續體,不在乎 AGI 標籤放在哪裡;但另一方面也暴露於此,因為所有後續關於 AGI 到 ASI 路徑的主張,都取決於說話者選擇了哪一道門檻。Ng 的意思是,有些人選擇門檻時背後牽涉合約利益。

既非全知,也非全能#

一個核心的修正觀點是:智慧大幅超越人類,不代表全能。ASI 受硬性的物理、複雜度理論與邏輯限制約束——其中一些限制可透過 AIXI 框架精確描述(例如最高資料效率)。它不保證能治癒老化、建造戴森球、用奈米機器人重塑物質、上傳大腦,或恢復工業化前的氣候。完整清單請見 Fundamental Limits of ASI,並留意這些硬性限制之上,實務 ASI 的能力仍可能有很大的餘裕。

數位 ASI 為何如此陌生#

AI 最獨特的一點是:我們知道它完整的演算法描述(也就是它的程式碼)。 這代表它不受限於特定基質,可以無損複製原始碼與記憶狀態,還能任意加速、暫停或複製——這些數位智慧的優勢會隨著運算量增加而擴大人類與 AI 的差距。因此,人類智慧的直覺常不適用於進階 AI,而 ASI 的「社會」可能與人類大異其趣(例如類似 Borg 的同質化超級集體、市場般的專家生態系,或 Hutter 所說、受運算量限制的虛擬世界)。

進步會恰好停在人類水準嗎?#

報告的核心判斷(信心偏低)是:AI 進步恰好停在人類水準,不太可能。即使單一模型的進步停滯,集體能力仍可透過執行許多 AGI 實例而持續提升(Multi-Agent Collective Intelligence)。若要讓進步停在人類水準,幾項阻礙必須同時成為硬性瓶頸。更可能的情況是:AI 在 AGI 之前就停滯,或是從 AGI 相對平順地進展到(弱)ASI——除非遞迴自我改進讓轉變迅速發生,而這種可能「無法排除」。

如何辨識它:第一種測量工具,以及它的讀數極限#

本頁最早提出的未解問題,是我們是否能辨認出ASI。報告指出,這個領域目前只有狹義的超人類基準測試(如西洋棋),而能揭示答案的任務必須具備抽象性與開放性。對真實未來事件作出校準良好的判斷,是本文資料中最接近這種測量工具的例子,也是這個知識庫第一批已解決的預測資料落腳之處。

ForecastBench(Forecasting Research Institute,2026-07-16,empirical)以相同問題評分 AI 參賽者與頂尖人類預測者,並以現實世界的結果驗證:包括從即時時間序列自動生成的資料集問題(ACLED、DBnomics、FRED、Yahoo! Finance、Wikipedia),以及取自 Manifold、Metaculus、Polymarket 和 RAND 的市場問題。我們應該提出的主張要比標題狹義:目前有數個參賽者在統計上無法與 ForecastBench 主辦方 FRI 自行執行的基準測試中的超級預測者中位數區分。在 7 月 16 日的競賽排行榜上,超級預測者中位數仍以總分 69.2(N=577)排名第 1,Cassi AI 得分 68.9(N=584),xAI 的兩筆 Grok 4.20 紀錄則各為 68.1(N=735)。在市場問題上——FRI 認為這是更好的類人判斷力測試,因為問題取決於新穎、一次性的事件,而不是 LLM 已擅長的基準率查詢——Cassi 的 77.7(N=92)是第一個高於超級預測者中位數 75.9(N=56)的 AI 分數。

這種測量工具為何最適合用來回答辨識問題,而狹義基準測試做不到:

  • 問題寫下來時,答案尚不存在。 預測提交後,真實結果才會由現實世界產生,因此在結構上不可能發生資料污染,而問題來源也會透過即時市場與時間序列自動更新。無須淘汰題目或提高難度(Measuring Beyond Accuracy Saturation所談的淘汰並替換問題並非必要)。
  • 任務開放且無法形式化(「Messi 會在 2026 年世界盃的進球數超過 Ronaldo 嗎」、「2026 年 7 月會是有紀錄以來最熱的 7 月嗎」)——整合相互矛盾的證據並給出機率,大致符合報告所說揭示能力的任務應有的抽象特質。
  • 參照群體是目前所知最強的人類基準,而非 AGI 定義所採用的人類中位數。

**這也是本文資料中最清楚的例子,說明以人類為參照的測量工具,在到達其參照群體水準時就停止讀數。**ForecastBench 的兩個顯著性欄位是「Supers > Forecaster?」和「Forecaster > Public?」——沒有「Forecaster > Supers?」欄位。排行榜的設計是要回報超級預測者勝過模型,以及模型勝過大眾;**它不會判定模型是否超越人類參照群體。**因此,Cassi 在市場問題上的領先只是點估計排序,信賴區間高度重疊([74.0, 82.9] 與 [72.7, 80.2]),並非顯著性主張。而且基準值是固定的:FRI 上一次徵集超級預測者預測是在 2024 年,所以此後每次比較都是以統計外推值為準;作者承認這種外推「會隨時間變得較不可靠」,而市場題部分的樣本數只有 N=56。Brier 類型的分數是絕對值,確實能持續測量超越人類的表現;但移除基準值後,就無法得知剩餘的提升空間反映的是技巧,還是問題本身無法消除的不確定性——而人類錨點原本默默提供了這項資訊。FRI 結尾的但書(「這些發現不代表 ForecastBench 已飽和……AI 系統可能超越人類超級預測者的準確度」)對分數而言是恰當的,但沒有切中比較的關鍵。

**依照本頁自己的標準,以上都不是 ASI 訊號,而這正是重點。**此處的 ASI 指在幾乎所有領域超越大型、協調良好的人類專家群體。超級預測者中位數是某一項認知技能的強大人類群體表現,所以與之相當,談的是 AGI 一側的比較;而這項測量工具剛好在 ASI 問題開始之處到達量程極限。因此,辨識問題並非缺乏開放且不會飽和的基準測試,而是現有測試都是相對於人類基準來定義;若要讓這個基準持續作為量尺,就必須重新徵集人類預測(FRI 預定於 2026 年秋季新一輪徵集超級預測者預測,並更新資料集問題與分位數問題)。

**請看清來源自身的認識論立場,因為標題與統計資料提出的是不同主張。**貼文標題寫著「AI 模型可能已達到同等水準」;內文說「在統計上無法區分」;註腳 1 則提供以「準確度等同超級預測者」為虛無假設的單尾 bootstrap p 值——Cassi 為 0.41,xAI 為 0.16 和 0.15,Google DeepMind 為 0.14。p 值 0.41 代表未能拒絕虛無假設,不代表證明兩者相等;而且排序與論點相反:新增列為同等水準的參賽者之中,較低的 p 值——也就是有較多證據反對準確度相等——反而屬於這些參賽者。排行榜自己的欄位也說明了這一點。貼文點名的唯一一列「green tree」是 Google DeepMind,其「Supers > Forecaster?」欄位標為 「Likely」——這是 FRI 自己判定超級預測者可能比它更準確;然而內文卻把 Google DeepMind 列入與超級預測者水準無法區分的模型。最後能成立的說法是:一條有支架輔助的流程,在現有樣本數下無法與 2024 年超級預測者中位數區分,另有數個參賽者的排名接近它。

關聯頁面#

待解決的問題#

  • 我們甚至能辨認出ASI 嗎?目前缺乏通用超人表現的基準測試(只有西洋棋這類狹義測試),而任務必須夠抽象、夠開放,才能揭示其能力。已有部分答案(2026-08-12)——測量工具存在,問題在於量程:ForecastBench具備抽象性與開放性,依其設計可避免資料污染(答案晚於問題產生),並以目前最強的人類基準為錨點;AI 參賽者如今已達到這個基準。它做不到的是讀出超越基準的表現——排行榜有「Supers > Forecaster?」和「Forecaster > Public?」兩個顯著性欄位,卻沒有反向比較;人類基準來自 2024 年的徵集,並向後外推;而一旦沒有參照群體告訴我們,剩餘提升空間有多少是無法消除的雜訊,絕對 Brier 分數便失去原有意義。因此,辨識問題不在於缺乏合適的任務類型,而在於以人類為參照的測量工具,其辨別範圍止於參照群體本身。這個問題仍未解決,因為本頁定義的 ASI 門檻是幾乎所有領域的人類專家群體,而 ForecastBench 測量的是單一技能、對照單一人類群體表現。
  • 能力表現參差不齊是基本理論性質,還是與人類表現比較所造成的假象?(報告中的開放問題 6d。)
  • 實務 ASI 會在什麼位置相對於硬性限制停滯——還有多少餘裕?

資料來源#

  • From AGI to ASI — 第 3 節(「Characterizing Artificial Superintelligence」);AGI/ASI/UAI 的非正式定義與說明 I–V
  • AI models have likely reached parity with superforecasters on ForecastBench — Forecasting Research Institute(Substack,2026-07-16,empirical,約 813 字):競賽與初步排行榜、市場問題結果(Cassi 77.7 / N=92 對上超級預測者中位數 75.9 / N=56)、註腳 1 的 bootstrap 單尾 p 值(0.41 / 0.16 / 0.15 / 0.14),以及四項但書——2024 年基準徵集、隨機化結果判定、信賴區間重疊「更符合與超級預測者相當,而非勝過他們」,以及明確否認基準測試已飽和。貼文中的三張排行榜都是 PNG 截圖,沒有文字標記;已在原始檔轉錄,並依照圖片雙重檢視規則放大重新讀取,將每個數值對應到欄位標題。「Supers > Forecaster?」的解讀,以及沒有反向欄位這一點,都來自這次檢視,而非貼文內文。FRI 同時負責營運 ForecastBench,並提供其比較所用的超級預測者基準;來源筆記記錄了利益衝突的形態
  • Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think — Andrew Ng 接受 Marina Mogilko 訪問,Silicon Valley Girl(2026-08-28,practitioner-opinion):任何智力任務的定義、博士論文與雨林卡車的例子、「幾十年」的時間表(prediction),以及 OpenAI–Microsoft 宣告 AGI 的誘因論點。自動字幕逐字稿中「open Microsoft had an agreement」是 OpenAI 與 Microsoft 的語音辨識錯誤;原始資料未更正,本頁按原意解讀
§ end
Cited by 19
Related articles
  • The Abstraction Barrier

    Lerchner's hypothesis that AI trained on human concepts may be unable to discover genuinely novel conceptual primitives…

  • Effective Compute Scaling

    DeepMind's framing of compute growth as ~10×/year of 'effective compute' — the product of hardware improvement (~1.5×/y…

  • AGI-to-ASI Pathways

    DeepMind's four non-exclusive, parallel technological routes from human-level AGI to superintelligence — scaling, algor…

  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…

  • Multi-Agent Collective Intelligence

    DeepMind's fourth pathway to ASI: superintelligence as an emergent property of many coordinated AGI agents — group agen…