資料來源#
摘要#
Demis Hassabis 的文章 A Framework for Frontier AI and the Dawning of a New Age(A Framework for Frontier AI and the Dawning of a New Age,他的 Substack,2026-07-14,practitioner-opinion——一項未經測量的政策提案,作者是將受其約束的實驗室執行長。除非另有標示,本頁內容皆為 Hassabis 的提案。
他主張由美國率先行動,憑藉其「經濟與技術地位」,成立「一個由聯邦監督的公私合營,或自我監管組織模式的全新標準機構,類似金融業監管局(FINRA)」。該機構制定評估協定,與聯邦機關及美國國家實驗室合作進行國安測試,界定哪些模型納入範圍,並於發布前審查模型——起初採自願制,之後成為在美國市場部署的條件。
這是本維基收錄的三項發布前監督提案中最早提出的一項,而非最新:Hassabis 2026-07-14 → Musk 2026-07-29 → Zuckerberg 2026-08-10。Musk 在《經濟學人》訪談中表示,他「在他發表文章前,和他談了幾個小時」,因此前兩項並非對設計空間各自獨立的探索——兩者源自同一場談話,而 Musk 的版本沒有秘書處。
其證據層級(practitioner-opinion)高於兩個對手的 prediction 層級,但這種差距是分類上的,而非證據上的:這是制度設計,不是預測,三者都未經任何測量驗證。
設計參數#
這篇文章對機制的描述格外具體,因此以下將參數保留為參數,而非濃縮成散文。每個儲存格皆為 Hassabis 的原話或緊貼原意的轉述。
| 參數 | 規格 |
|---|---|
| 制度形式 | 由聯邦監督的公私合營/自我監管組織,「很像 FINRA」 |
| 誰先行動 | 美國單方面率先行動,作為日後國際標準的範本 |
| 董事會 | 包含「獨立的頂尖技術專家與開源代表」 |
| 資金 | 「大筆資金很可能主要來自產業界」,用以延攬世界級技術人才並取得大規模測試運算資源 |
| 測試夥伴 | 由適當的聯邦機關及美國國家實驗室負責與國安相關的領域 |
| 納入範圍的觸發條件 | 模型若通過「由機構自行決定、並定期更新的基準集合門檻」,即屬「Frontier 級」 |
| 範圍邊界 | 依能力界定:無論「其原產國為何,也無論模型開放或封閉」都適用;非 Frontier 的新創與學術模型豁免 |
| 提交期限 | 「發布前最多 30 天」自願分享 |
| 風險類別 | 網路安全、生物威脅、「其他高風險領域」 |
| 代理式測試 | 嘗試繞過安全防護措施、欺騙跡象;以及最佳實務——影像浮水印與「可供人類閱讀、用以理解模型推理的輸出 token」 |
| 實驗室端最佳實務 | 發布模型卡、落實內部網路安全、審查關鍵人員、投入安全與防護研究資源 |
| 基準更新頻率 | 「定期更新,或許一開始每季一次,並淘汰過時或已飽和的基準,以新基準取代」 |
| 基準來源 | 起初「諮詢 Frontier 實驗室」後制定;最終由機構建立自行執行的留出測試能力,以「避免過度擬合」 |
| 第三方 | 機構將與美國政府合作,「促進第三方稽核員生態系」 |
| 發布後 | 實驗室「也會與標準機構合作,處理發布後的重大漏洞」 |
| 強制制觸發條件 | 「評估協定證明有效且穩健後」,通過評估便成為在美國市場部署的條件 |
| 升級上限 | 制度「可以逐步升級」,「包括在必要時協調 Frontier 實驗室放緩開發」 |
| 誘因 | Frontier 實驗室的認定「將帶來相當高的聲望」,任何符合基準標準的組織都可取得 |
其中兩項在本語料庫中是新的。發布後義務是三項提案中唯一延伸至發布決策之後的安排。開放或封閉皆納入的範圍條款,則是第一項將開放權重發布納入發布前審查制度的提案——下文將說明為何固定時窗在這種情況下最有害。
三項沒有行動者的行動#
文章三度提出某項行動,卻省略行動者;這些省略攸關制度核心,並非枝節:
- 誰宣布協定「有效且穩健」? 這項判定會把自願提交轉變為取得市場准入的法律條件。文章說正式化「可能很快就會跟進」,卻從未指出由誰簽署。
- 誰啟動升級機制? 協調 Frontier 實驗室放緩,是此設計中權力最強的一環,卻只出現在附屬子句——「如果認為有必要」,但沒有說明由誰判斷。
- 如何執行? 文章沒有提出任何機制,說明如何決定協調放緩,或如何使其具有約束力。現實中的 FINRA 之所以有實際約束力,是因為有 SEC 監督與法定執法;文章借用了 FINRA 的形式,卻省略其執法鏈。
這與Zuckerberg 的 RSI 運算資源分配規則形式相同——一項治理規則沒有訂出門檻、觀察者或具約束力的機制——只是出發點來自相反的治理哲學。
已確認的缺漏:無人裁決#
文章從未處理裁決機制。 沒說當實驗室對機構評估自家模型的結果提出異議時,誰有最終權限;沒有交代申訴程序;也沒有說明實驗室之間的爭議如何解決——例如一家實驗室指控競爭對手的模型不安全,或高報對手的風險。內容擷取者在 A Framework for Frontier AI and the Dawning of a New Age 中以明確的 > [!note] 編輯註記記錄了這項缺漏,並標示為原文中已確認不存在,而非原始擷取內容遺漏:整篇文章都沒有談到這個主題。這是內容擷取者的觀察,不是 Hassabis 的說法。
這也回答了 Cross-Lab Pre-Release Review 自 2026-08-05 起提出的問題(「將其裁決設計與此提案相比」),而答案是對稱的:兩項提案都沒有裁決機制。 Musk 的提案在「競爭者要求延後」與「政府接獲通知」之間沒有任何步驟;Hassabis 的提案在「機構未讓模型通過」與「模型不得在美國市場部署」之間也沒有任何步驟。Zuckerberg 的提案不需要裁決機制,只因為它從未要求任何人做出決定。二十七天內,三項來自三家實驗室的提案,語料庫裡完全沒有爭端解決機制——這是對設計空間的發現,而非對任何一位作者的個別評價。
第四項提案,以及首次部分突破#
AI Futures Project 於 2026-08-05 提出的放緩提案(practitioner-opinion)是語料庫在此設計空間中的第四項,也是第一項包含任何爭端處理機制的提案——因此,上述模式如今是四項中的三項,而非普遍情況,這項例外也值得注意。
它具體規定了其他三項都沒有的內容:一條具名裁決者、決策標準與證據規則的申訴途徑(安全研究人員可向第三方稽核員申訴,要求對已發布的安全研究進一步刪節;「指示稽核員確保任何能力進展都能發布」;稽核員可完整查閱真實工作負載紀錄);一項處理評估者意見分歧的彙總規則(對第三方風險估計採加權平均,「各公司使用相同權重」,這是明確的反偏袒限制);以及一項稽核員本身的認證機制類比(「或許由政府認證,類似大學認證機構或船舶分類機構的核准方式」)。
它仍未說明的,正是其他三項也都略過的內容。設計中的每一項申訴,都是由受監管方的研究人員針對自身保密措施提出,從來不是針對裁決:公司沒有途徑對被指控違反分配規則或遭受風險評估提出異議。沒有人負責設定評估者的權重;沒有人被指派在四種選項間決定是否升級,也沒有人負責將安全底線從 5% 提高到 25%;至於權限,文章直接略而不談——「本文假設由美國政府執行放緩措施。」
作者身分本身就是發現。 沒有裁決設計的三項提案,作者都是將受裁決的實驗室執行長;唯一有任何此類設計的提案,作者則是既不會被裁決的預測與倡議組織。樣本數 n=4,且只有一位作者來自非實驗室,證據力有限,但這是語料庫目前的第一項證據,而且指向下方開放問題提出的第三種解釋,而非前兩種。四項提案共同呈現的更明確不變模式,比「完全沒有裁決」更狹義:本語料庫沒有任何提案讓受監管方有途徑對不利於自己的調查結果提出異議。
這也讓 Frontier Pause Verification 留下的問題(「誰裁定觸發與解除?」)有了新進展:如今已有一個以提案形式出現、可能承接此職責的候選機構,但它重現了缺口,沒有填補缺口。
範圍以基準門檻界定#
最關鍵的結構性選擇,是以機構設定的基準門檻定義「Frontier 級」。其他一切——誰必須提交、誰可豁免、誰能取得 Frontier 實驗室的聲望,最終誰能在美國銷售——都取決於基準分數。
這也承襲了維基評估領域所記錄的所有效度問題。Measuring Beyond Accuracy Saturation 是直接的衝突點,而且影響正反兩面:
- 反對此提案。 Hassabis 主張淘汰已飽和的基準並加以替換——Nadgir、Kapoor、……Narayanan(
empirical)認為,這種淘汰再替換的慣性「除了對相對準確率進行最佳化的模型開發者之外,對任何人而言都根本不夠」。標準機構顯然不是對相對準確率進行最佳化的模型開發者,而是劃定法律範圍的監管機關,因此這項批評在此處比原本的脈絡更有力。他們提出的替代方案——沿著可靠性、效率、鷹架貢獻與人類效益等面向重新設計已飽和的基準——正是決定模型是否危險的機構會需要的做法,但文章並未考慮。 - 支持此提案。 留出測試的構想(「獨立於實驗室之外,以避免過度擬合」)是同一篇論文會認可的建構效度做法,也直接針對基準特定適應這項威脅:基準一旦成為開發目標,優異表現便部分反映了適應能力,而非模型能力。對美國市場上的每家 Frontier 實驗室而言,把範圍界定基準變成唯一的開發目標,會把這種壓力推到極致,而 Hassabis 是少數點出這點的提案者之一。
以監管標準來看,每季更新一次算快;以能力發展標準來看則算慢——Measuring Beyond Accuracy Saturation 記錄 CORE-Bench 約在十五個月內飽和,Task Time-Horizon Scaling 則記錄了背後的倍增趨勢。提案沒有說明:若模型在基準遭到淘汰後的下一季才跨過範圍門檻,應如何處理。
30 天時窗,以及它固定下來的評估#
「發布前最多 30 天」自願提交,約為 Musk 提議的一至兩週的兩倍,卻基於同樣理由,面臨相同反對意見。Open-Weight Elicitation Irreversibility 主張,危險能力會隨引出能力的運算預算提升,因此固定審查時窗會把安全評估鎖定在單一預算上——這與開放權重發布有相同的結構性失敗,只是由開發者而非日曆決定時窗。
此處問題更尖銳,因為範圍條款明確涵蓋開放權重模型(「無論模型開放或封閉」)。對權重將公開的模型來說,發布前 30 天的審查不是眾多評估之一,而是唯一一次、永久有效的安全評估;評估時採用機構設定的預算,面對的卻是之後無上限且無從觀測的能力引出預算。這是語料庫第一項將開放權重納入審查制度的提案,而固定時窗設計在此情況下最站不住腳。
產業資助與稽核員生態系#
資金「主要來自產業界」忠於 FINRA 的類比——FINRA 由會員出資——同時也重現了本語料庫反覆出現的利益衝突,只是層級更高。METR 的事件評估由受評對象委託並支付費用;維基已標示此問題。標準機構把這種安排擴大了:受評對象資助評估者、以「諮詢」方式撰寫第一代基準,也會成為機構所促進的「第三方稽核員生態系」中的客戶。董事會由獨立技術專家與開源代表組成,是提案所述的制衡力量,但沒有說明席次分配、任命程序或免職程序。
相關連結#
- Cross-Lab Pre-Release Review——最接近的競爭提案,晚了十五天,且是在與本提案作者交談後形成:同樣以專業能力為前提,也有相同的發布前時窗,但審查者是競爭實驗室,而非常設機構。合併閱讀兩項提案,本提案可視為 Musk 的構想加上他的 MPAA 類比無法涵蓋的三項要素——常設秘書處、公布的標準,以及有資金支持的測試能力——並且少了他那項優勢:競爭者有商業誘因仔細審查。兩項提案都沒有指定裁決者
- Government Checkpoint Sharing——同一設計空間的另一個極端:Zuckerberg 的機制將介入時間提前到訓練中途,並完全取消判定,讓監督不造成任何發布延遲;本提案則以判定為核心,最終將其設為美國市場的准入門檻
- Frontier Pause Verification——此處的升級上限(「協調 Frontier 實驗室放緩開發」)就是該頁所談的多邊停止機制,如今被提議成為國家標準機構的一項權限:沒有可偵測性基礎設施、沒有驗證制度、沒有指定觸發者,也沒有執法機制。這是語料庫中唯一設想由單一機構協調跨實驗室放緩的地方
- Responsible Scaling Policy Evaluations——本提案在功能上要取代的既有制度:同樣在相同風險領域(網路安全、生物)進行部署前能力判定,只是將判定工作從開發者移交給有自訂基準與運算資源的外部機構。RSP 的介入模式(跨越門檻後部署防護措施)在此沒有對應設計;該機構只會讓模型通過或不通過,也沒有顯示會開立緩解措施
- Measuring Beyond Accuracy Saturation——範圍界定背後的基準機制,也是本頁最尖銳的矛盾:提案主張淘汰並替換已飽和基準,但該來源認為這對監管者所屬的非開發者群體而言,恰恰不夠;提案另一方面又提出留出測試,而這正是該來源提出的建構效度補救方式
- Open-Weight Elicitation Irreversibility——30 天時窗將安全評估固定在單一能力引出預算,而開放或封閉皆納入的範圍條款,讓本提案成為第一項可能使時窗成為唯一一次評估、且模型無法召回的提案
- Balance-of-Power Superintelligence——與此設計互不相容的哲學:發布前審查門檻,預設開發者能控制發布,且有機構獲授權禁止其進入美國市場
- Chain-of-Thought Monitorability——提案會把可理解性變成監管要求:「生成可供人類閱讀、用以理解模型推理的輸出 token」列在代理式測試的最佳實務清單中,是機構會檢查的項目。語料庫的證據顯示,即使完全沒有針對 CoT 的獎勵,此特性仍會在一般最佳化壓力下消退,因此不適合寫入合規檢查清單
- Agentic Misalignment (AM)——代理式測試(「嘗試繞過安全防護措施或出現欺騙跡象」)必須在時窗內引出的失敗類型
- Artificial Superintelligence (ASI)——文章開頭提出的發展軌跡:AGI「可能距今只有幾年」,如同「電力或火的發現」,估計其影響「或許是工業革命的 10 倍,速度則快 10 倍」
- Google DeepMind——Hassabis 領導的實驗室,也是範圍條款會納入審查的開放權重實驗室
- METR——本語料庫中既有的「第三方稽核員生態系」案例,該機構可能納入此機構推廣的生態系,也承受相同的「受評對象出資」衝突,只是發生在委託規模
- Elon Musk——這場對談的另一方;在文章發布前,Hassabis 曾與他討論 Musk 自己的提案
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It——以評估證據檢驗範圍界定問題,並指出本設計在兩種情況中更難處理,因為它沒有可執行的備援方案:放緩政策的義務以運算資源占比與訓練日期為準,而此處每項義務都取決於分數。該文補上了本文章缺少的義務層級:基準門檻可承載揭露/提交的觸發條件;若獨立性問題獲得解決,也可承載啟動案件的條件;但不能承載自動生效的市場條件。因此,本提案建立的自願階段,正是其設計真正可靠的階段
- Domestic Frontier Pacing——此設計空間中的第四項提案,也用來檢驗本頁的核心發現。它是第一項包含任何爭端處理機制的提案(刪節申訴途徑具名裁決者與決策標準;風險評估者採相同權重彙總),也是唯一由不會受裁決的作者提出的提案,但仍未提供公司對調查結果提出異議的途徑。它也反轉了範圍界定問題:不是由監管者撰寫基準集合,而是採用公布的第三方指標(ECI)加上私人基準;不是把發布設為門檻,而是持續限制運算資源占比
- Embedded Evaluation——預定「第三方稽核員生態系」中的一員,描述在取得內部存取權後會如何行動。該機構的設計從未說明稽核員能取得哪些存取權限
開放問題#
- 監管範圍是否能以基準門檻來界定? 下游的一切——誰必須提交、誰可豁免,最終誰能在美國銷售——都取決於分數,但這個領域裡,維基記錄的飽和、污染與建構效度失效都是常見問題。基準必須證明什麼,法律義務才能以它為依據?部分解答(2026-08-17),見 Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It:「證明」這一半已有定論——七項性質(參照固定性;能涵蓋觸發區域的辨別範圍;可辯護的分數→義務映射;對兩個方向的操弄具抵抗力;公布完整性稽核;在宣告預算、鷹架與評估者身分下具備第二方可重現性;與受測方保持獨立)。目前有兩項性質已展示但尚未整合(可重現性——UK AISI 的最低資訊性預算,加上 Kimi K3 逐項基準的鷹架固定方式;完整性稽核——AISI 在 475 次執行 × 5 個模型中測得 7.8–14.1% 的作弊率,但沒有任何框架要求分數必須附上這類稽核)。另有兩項在 Frontier 前沿無法達成:辨別範圍,因為以人類為參照的測量工具恰好在觸發條件可能所在的位置失去辨識能力,而治理案例已經發生(Responsible Scaling Policy Evaluations 已從判定中移除飽和的 AI R&D 排除測試組);以及雙向操弄抵抗力,因為留出與私人測試集只能防止分數灌水。至於「是否能」這一半,結論是有一個義務階梯:分數現在可以承載揭露/提交觸發條件;若獨立性問題獲得解決,也可承載啟動案件的條件;但不能承載自動生效的市場條件——也就是說,本提案在其打算離開的自願階段中是可靠的。仍未解答,因此只能算部分回答:語料庫中尚未建立或測試過這種分級範圍制度,所以肯定的部分仍是設計論證,而非證據;重新設計評估工具——文章從未考慮的補救方法——目前只在可重現性方面獲得驗證,尚未用於範圍制度涵蓋的網路安全、生物與 AI R&D 領域。
- 這個領域是否有任何已公布提案指定裁決者? 二十七天內來自三家實驗室的三項提案都沒有指定裁決者。這究竟是疏忽、刻意交由現行行政法處理,還是由將受裁決的當事人撰寫提案所造成的結構特徵,尚未以更廣泛的治理文獻檢驗。部分解答(2026-08-12),且證據支持第三種解釋:Domestic Frontier Pacing 是第四項提案,也是唯一由非實驗室作者撰寫、且含有任何爭端處理機制的提案——其中包括具名裁決者與明確標準的刪節申訴途徑,以及風險評估者採相同權重彙總的規則。n=4 且只有一位非實驗室作者,因此證據僅指出方向,尚無定論;剩下的不變模式也比原始問題更明確:語料庫中沒有任何提案讓受監管方有途徑對不利於自己的調查結果提出異議。
- 自願階段是否終有結束的一天? 轉為強制制的條件是協定「證明有效且穩健」,但沒有指定決策者,也沒有訂出判準。觸發條件:美國立法或行政機關採取行動,指定某項 Frontier 評估協定為市場准入條件。
資料來源#
- A Framework for Frontier AI and the Dawning of a New Age — Demis Hassabis,A Framework for Frontier AI and the Dawning of a New Age,demishassabis.substack.com,2026-07-14,約 1,500 字(
practitioner-opinion)。參數表取自〈A Framework for a Frontier AI Standards Body〉一節;原始資料保留了文章自身描述機制的用語,而非摘要。日期已透過頁面上的 JSON-LD(datePublished 2026-07-14T09:10:20+00:00)與article:modified_time中繼標籤核實;原文沒有註腳。關於裁決機制缺漏,是內容擷取者明確提出的編輯註記,並標示為原文中已確認不存在,而非 Hassabis 本人的主張 - How to pace the US frontier — AI Futures Project(Lifland、Halstead、Dean、Larsen、Kodama),2026-08-05(
practitioner-opinion):此處僅將其作為發布前監督比較中的第四項提案;刪節申訴途徑與稽核員指示來自〈Minimum transparent-safety-compute allocation〉一節,加權平均彙總來自〈How to do the risk assessments?〉一節,認證機構類比來自〈Broader classification of pacing proposals〉一節,並參照其中明確提出的權限假設。完整分析見 Domestic Frontier Pacing
Cited by 20
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It×11
From Frontier Ai Standards Body — "Can a regulatory perimeter be defined by benchmark thresholds at…
- Cross-Lab Pre-Release Review×6
The ordering the correction changes. July 14 is fifteen days before this interview, not after it —…
- Domestic Frontier Pacing×4
The interesting part is who wrote it. The three proposals with no adjudication design are by CEOs…
- Frontier Pause Verification×4
Frontier Ai Standards Body — a coordinated cross-lab slowdown proposed as an escalation setting on…
- Competitor-Indexed Safety Triggers: What the Revision Record Settles About Pause Postures, Acceleration Regret and Benchmark Perimeters×3
Frontier Ai Standards Body: Can a regulatory perimeter be defined by benchmark thresholds at all?…
- Embedded Evaluation×3
Terms. The post names no access rung per focus area, no publication rights, no redaction authority,…
- Safety Commitments That Cannot Bind the Actor Who States Them×3
Frontier Ai Standards Body — the corpus's only DeepMind-side short-timeline claim (Hassabis), and a…
- Government Checkpoint Sharing×2
Frontier Ai Standards Body — the maximal opposite in the same table: a standing body whose review…
- Measuring Beyond Accuracy Saturation×2
Why this matters past evals. Frontier Ai Standards Body and Domestic Frontier Pacing both propose…
- METR×2
Frontier Ai Standards Body — the institutional form the proposal reserves for organizations like…
- Open Questions Backlog×2
Frontier Ai Standards Body: Does any published proposal in this space specify an adjudicator?
- Balance-of-Power Superintelligence
Frontier Ai Standards Body — the governance design this philosophy is least compatible with,…
- Chain-of-Thought Monitorability
Frontier Ai Standards Body — legibility proposed as a compliance requirement. Hassabis's July 2026…
- Elon Musk
Frontier Ai Standards Body — the provenance of his own governance proposal: he says he "talked to…
- Google DeepMind
Frontier Ai Standards Body — the lab's governance posture, and the fifth in this page's list of…
- Superintelligence Trajectory
Frontier Ai Standards Body — Hassabis's July 2026 proposal for a US-led, FINRA-modelled…
- Open-Weight Elicitation Irreversibility
Frontier Ai Standards Body — the first proposal to pull open weights inside a pre-release review…
- Responsible Scaling Policy Evaluations
Frontier Ai Standards Body — the same determination moved outside the developer: Hassabis proposes…
- Shane Legg
The report assumes alignment is "solved to a sufficient degree" to focus on trajectories — how does…
- Task Time-Horizon Scaling
Frontier Ai Standards Body — the doubling curve as a regulatory cadence problem: Hassabis proposes…
Related articles
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
- Domestic Frontier Pacing
AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…
- Cross-Lab Pre-Release Review
Musk's proposal that frontier labs get 1–2 weeks of competitor API access to test each other's models before release, w…
- Frontier Pause Verification
The arms-control problem of a credible, verifiable slowdown or pause of frontier AI: detectability is harder than for o…
- Open-Weight Elicitation Irreversibility
A wiki-drawn synthesis of Brown and Gemma 4: if dangerous capability scales with inference budget, then an open-weight…
