H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

跨實驗室發布前審查

Musk 提議,讓前沿實驗室在發布前取得彼此模型的 API 存取權一至兩週,以進行測試;若實驗室拒絕處理已標示的危險,政府才介入——由競爭對手擔任具技術能力且誠實的中間人,採用 MPAA 自評模式;Mythos 網路風險事件則是非正式先例

Article metadata
Publication details
Published:August 5, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceAI PolicyCoordinationFrontier Labs
Reading:17 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

跨實驗室發布前審查插圖

資料來源#

摘要#

在 2026 年 7 月接受《經濟學人》訪問時,Musk提出了最具體的治理機制(prediction 層級——尚未經衡量的提案,以下內容皆是他的主張,並非已確立的事實):在前沿實驗室發布一個「比現有任何事物都聰明得多」的模型之前,讓其競爭對手取得一至兩週的 API 存取權,以進行測試並建議延後發布。政府不是第一道防線,而是升級處理層級——只有在實驗室已被告知模型有危險,卻拒絕採取行動時才介入。

這在 wiki 的治理地圖中構成第三種立場,與既有的兩極都不同。Frontier Pause Verification是協調暫停的國與國之間機制;RSP-style gating是單一實驗室自行踩煞車;Zuckerberg的答案則是分散能力,而非設置閘門。Musk 的方案則是實驗室彼此之間、發布之前的審查:由競爭對手帶著自身利害關係參與同儕審查。

機制原貌#

分為三個層級,逐步升高:

  1. 定期通話。「領先的 AI 公司……至少應該碰個面,或每隔幾週找時間通話」,討論安全與保安議題。Musk 稱這是「我們能做、簡單又快速的事,而且可以隨時間逐步擴大」——他提出「每週或每兩週一次」。
  2. **發布前由競爭對手測試。**在前沿模型發布前提供一至兩週的早期存取權,刻意將範圍限縮:「不是把 AI 交給對方,只是透過 API 或類似方式測試……」。產出是暫緩發布的建議,而非否決權。
  3. 遭拒絕時由政府介入。「如果有幾家領先的 AI 公司表示新模型非常危險,就應該通知政府……而且若生產該模型的公司沒有採取措施處理危險,他們就應該提醒政府採取行動。」他明確指出,美國與中國政府是僅有具備行動權力的兩方。

他對時程的說法斬釘截鐵,而且異常急迫:當被告知普遍看法認為六個月內必須有所成果時,他回答「六個月很久」,並指出公告的頻率「有時一天好幾次」。

為何找競爭對手,而非監管機構#

理由有兩項,一項關於能力,一項關於誘因。

能力。「政府裡不具備深厚技術知識、也沒有在推進 AI 前沿的人,要判斷某項東西該不該發布,確實很困難。」這是事前監管常見的專業知識不對稱異議,也正是讓暫停驗證困難的同一項異議——差別在於,Musk 以轉移判斷權的方式處理,而非建立儀表機制。

誘因。關鍵的獨特之處在於:競爭是執行機制,而非障礙。競爭對手「有動機讓其他人保持誠信」,而且「絕不會羞於指出競爭對手的模型應該延後發布」。一般的擔憂是競爭會引發逐底競爭;Musk 的主張則是,對於「這個模型是否危險」這個狹義問題,競爭誘因會促使揭露。

未檢視的另一面是相反情況:同樣的誘因也會造成帶有動機的過度通報——競爭對手持有兩週 API 存取權,而且有商業利益延遲對手上市。Musk 完全沒談誤報問題,而這項提案在「競爭對手說要延後」與「通知政府」之間,沒有任何裁決程序。

MPAA 類比及其不足之處#

Musk 提出的先例是美國電影協會:「這是個決定電影分級的業界組織……看來運作得相當好。」這項類比忽略了三件事:

  • MPAA 對已完成、完全可觀察的作品進行內容分級。前沿模型發布前審查則必須引出一項潛在能力,而開發者自己可能都還沒找到它——這是誘發預算問題,而且只有一至兩週時間。
  • MPAA 分級是建議性標籤,不是延後發布。此提案的實際效力是建議暫停,這對競爭對手董事會而言是大得多的要求。
  • MPAA 有常設秘書處及公開標準。Musk 的版本兩者皆無;它只有一通電話和一把 API 金鑰。(2026-08-12:Hassabis 的提案早十五天發布,並在發布前與 Musk 討論,恰好補上了這一點——一個以 FINRA 為模型的機構,擁有自己的基準、資金與測試運算資源。兩項提案的差異與其說在企圖心,不如說在制度建置程度。)

他提出的先例:Mythos 事件#

Musk 用來佐證的核心,是這件事已經以非正式方式發生過一次。當被追問政府是否真的會把發布權交給模型開發者時,他回答,在 Mythos 案例中,「不是政府裡有人發現 Mythos 有可怕的網路安全風險,而是 Amazon。Amazon 指出這一點,並且致電白宮」——之後美國政府以出口管制的威脅限制模型發布。他形容結果「就是剛剛實際發生的事」:非政府方發現風險,政府提供施力工具。

**請將此視為尚未查證的單一來源主張。**這是對近期事件的事實性主張,來源只有 Musk 在訪談中的說法,wiki 沒有獨立紀錄——Mythos Model和Responsible Scaling Policy Evaluations記載 Anthropic 自行說明 Mythos 閘控的版本,卻完全沒提外部方發現風險或出口管制介入。之所以記錄在此,是因為若此事屬實,這是目前唯一已發生、符合本頁機制的案例,而且可以查證。

範圍:中國實驗室也包括在內#

被問到政府是否需要參與時,Musk 主動表示,這個團體「大概也應該納入正在做前沿 AI 模型的中國公司」,並稱其中幾家「非常優秀」,特別點名Kimi K3(Kimi (Moonshot AI))。這與他的運算分析一致(參見Effective Compute Scaling):如果電力限制在中國以外構成約束,而晶片限制在中國境內構成約束,兩種限制都是暫時的;只限美國參與的俱樂部所治理的前沿模型發布比例便會愈來愈低。

信任疑慮及他的回答#

訪談者最有力的質疑是:這五個人彼此既不喜歡也不信任,還會公開互相羞辱——那麼要如何讓他們彼此存取模型?Musk 沒有否認這個前提;他詳盡地予以確認,陳述自己對 Sam Altman 的不滿(非營利組織「由全世界所有」變成「一家價值 8,000 億美元、閉源的營利公司」),並表示 Anthropic 的創辦人離開 OpenAI,是因為「他們不信任 Sam Altman。不然 Anthropic 就不會存在」(參見OpenAI)。他的回答是,要求小到足以克服彼此敵意——「我們只是在說一週……不是要把 AI 交出去」——而且「如果非得談,我們就談。我是說,為了全世界的好處,先把個人恩怨放一邊。」

他也表示,曾與Demis Hassabis(Google DeepMind)花「幾個小時」討論相關提案,之後 Hassabis 發表了公私部門與監管機構合作的文章,Musk 稱那是個良好的起點。於 2026 年 7 月下旬(2026-08-12 更新,依據 A Framework for Frontier AI and the Dawning of a New Age:文章頁面標示日期為 2026-07-14,並已對照文章的 JSON-LD 查證。)

這項修正改變了先後順序。7 月 14 日比這次訪談早十五天——因此,Hassabis 的標準制定機構提案在 Musk 回答這些問題時已經公開,也是 wiki 三項發布前監督提案中最早的一項,而非最晚:Hassabis(07-14)→ Musk(07-29)→ Zuckerberg(08-10)。這帶來兩項後果。第一,Musk 本人表示兩人曾在任何一方公開前深入討論,所以本頁的提案並非與 Hassabis 的提案並列、各自獨立探索設計空間;應視為同一場對話的兩種產出,而非相互印證的證據。第二,下面對秘書處的異議方向顛倒了:Musk 所說自己曾向他提出「這項」提案的那位人士,早已提出本提案所欠缺的常設機構及公開標準。

首次觀察到的實驗室間接觸:談的是功勞,而非危險(2026 年 9 月)#

本頁的機制從未實際運作;唯一引用的先例(Mythos/Amazon 升級處理)仍是下方標示的單一來源主張,尚待查證。本資料集首次記錄兩家前沿實驗室因能力成果而自願聯繫,發生於 2026-09-08,而提案設計中的每個變數都不同。

OpenAI 的 Navier–Stokes 公告(The Navier–Stokes AI Claim、On the Navier–Stokes Millennium Prize Problem、vendor-claim)指出,完成自己的成果後,OpenAI 主動聯絡 Levent Alpöge(Anthropic)與 Tristan Buckmaster(NYU)——他們認為兩人也得到了相同結果——「提出同步發布結果,並在聯合公告中肯定對方的優先貢獻」,並表示可以讓他們「查看所有使用過的提示,之後也能看到證明」。

這件事對上方提案能說明什麼,又不能說明什麼:

  • 這次接觸發生於事後,而非發布前,目的在於確認優先貢獻,而非危險。這件事沒有測試實驗室是否會向彼此展示模型;提供的是提示與論文,而且是在工作完成後。
  • **這在一定程度上克服了信任疑慮。**Musk 訪談中最有力的質疑,是這些人彼此既不喜歡也不信任。但在此案例中,兩家競爭實驗室協調發布公告,其中一家在幾天內承認另一方的優先貢獻——這證明敵意並非窄範圍、低成本交流的絕對障礙,而這恰好就是 Musk 主張的範圍。
  • 而且它重現了本頁的核心缺漏。同一事件引發一場爭議——競爭對手使用的產品是否影響了結果——而後由OpenAI 調查 OpenAI,並在自己的公告中發布調查結果。整份紀錄中沒有裁決者、沒有申訴途徑,也沒有獨立第三方;下方的已解決問題發現,這是三項由實驗室提出的提案共有的缺口。本資料集中首次實際發生的實驗室間接觸,與這些設計有著同樣的漏洞。

相關連結#

  • Evaluation Horizon Versus Release Cadence——一項獨立於誘發預算論證之外的第二個理由,說明一至兩週的窗口設計不當:它比受審查模型的一次執行時間還短,而且每次發布後,相對時間都更短

  • The Navier–Stokes AI Claim——本資料集中首次觀察到的實驗室間能力成果接觸:發生於事後而非發布前,談的是功勞而非危險,而且由被質疑的一方負責調查

  • Structured Safety Case (Claim Decomposition)——此提案可補上的缺口:RSP v3.2 賦予 Anthropic 的 Long-Term Benefit Trust 要求 Risk Report 接受外部審查並核准審查者的權力;截至 2026 年 8 月的報告,這項權力從未行使

  • Frontier Pause Verification——多邊暫停機制這一極;本提案對該頁長期存在的「誰來裁定觸發條件?」問題,提供了部分且具體的回答,但力度弱得多:它產生的是延後一次發布的建議,不是經查證的暫停,而且因開發者自願提供存取權,不需要偵測基礎設施

  • Responsible Scaling Policy Evaluations——單一實驗室的內部煞車;跨實驗室審查是將相同評估移到開發者之外,這正是 RSP 框架本身無法提供的獨立性

  • Balance-of-Power Superintelligence——Zuckerberg 對相同治理問題提出的分散式答案,於同一天發布;在 Zuckerberg 倡議的世界裡,模型權重從第一天起便公開,因此發布前審查模型的提案無法實行

  • Open-Weight Elicitation Irreversibility——說明一至兩週審查窗口是弱點的原因:危險能力會隨誘發預算擴大,因此固定的短窗口會把安全評估鎖定在單一預算,這與開放權重發布有相同的失敗模式

  • Agentic Misalignment (AM)——發布前由競爭對手進行紅隊測試時,必須在有限窗口內找出的失敗類型

  • Elon Musk——提案作者;他的風險立場轉變,讓相容於加速發展的治理提案成為他目前的答案

  • Government Checkpoint Sharing——最接近的競爭機制,於十二天後從同一場辯論的另一極發布:同樣以專業知識不對稱為前提,但審查者是政府而非競爭對手,存取時點在訓練期間而非發布前,產出則是強化後的基礎設施,而非延遲發布的建議——因此完全沒有延遲發布的施力工具

  • Domestic Frontier Pacing——設計空間中的第四項提案,在本提案一週後發布,兩個變數都不同:審查者是持續駐在公司內部的第三方稽核者,而非拿著兩週 API 金鑰的競爭對手;稽核對象是運算資源分配,而非模型能力。它也是本資料集中第一個包含任何爭議處理機制的提案,這改變了下方共同裁決缺口的意義——三項由實驗室提出的提案都沒有機制,唯一一項非實驗室提案則有一些,而且四項都不允許受監管公司對調查結果提出異議。此處的過度通報疑慮在那裡並不適用,因為競爭對手從未掌握裁決權

  • Frontier AI Standards Body——Musk 表示自己曾在作者發布前與他討論「幾個小時」的提案,比這次訪談早十五天。前提相同,發布前窗口也相近(最多 30 天,本頁則為一至兩週);但審查者是常設的 FINRA 模式機構,擁有自己的基準、資金與測試運算資源——這正是上方 MPAA 類比所欠缺的秘書處。它同樣沒有指出裁決者、申訴途徑或實驗室之間的爭議處理程序,因此這項缺漏是整個設計空間的特性,而非本提案獨有

  • Embedded Evaluation——另一種獨立評估者方案:評估者持續駐在實驗室內,觀察內部部署,而非在一至兩週窗口內檢視完成的模型。它也有本頁缺少裁決者的問題,因為沒有說明實驗室對調查結果提出異議時要依循什麼規則

待解決的問題#

  • Mythos 網路風險升級處理是否真的如 Musk 所說,依序發生 Amazon → 白宮 → 出口管制威脅?目前只有單一來源,而且可對照 Anthropic 與美國政府自己的紀錄查證。
  • 取得發布前存取權的競爭對手,是否會為了延後對手上市而過度通報危險?提案中的誘因論證只模擬了少報,機制也沒有裁決程序——如今已知這是競爭提案也有的共同缺口,而非本提案獨有之處;這讓問題更明確,但不影響提案所提出的行為主張。

已解問題#

  • Hassabis 的七月下旬2026-07-14公私部門與監管機構合作提案已有提及,但未收錄於 wiki——請匯入,並比較其裁決設計與本提案。#oq/source (2026-08-12 已回答)依據 A Framework for Frontier AI and the Dawning of a New Age,答案是否定的,而且兩者的情形相同:無法進行比較,因為兩項提案都沒有裁決設計。Hassabis 的文章沒有說明實驗室對自身模型的評估提出異議時,誰有最終決定權、申訴程序應如何運作,或實驗室間的指控該如何處理——這項缺漏已從原始文本查證,並記錄為資料匯入者的明確觀察,而非作者的主張。本頁的機制在「競爭對手說要延後」與「通知政府」之間沒有任何步驟;Hassabis 的提案則在「機構判定模型不合格」與「模型不予部署」之間沒有任何步驟。Zuckerberg只因為根本不要求任何人做決定,才避開這個問題。三項提案、三家實驗室、二十七天,卻沒有任何地方設置爭議解決機制——這是整個設計空間的問題,而非閱讀資料留下的缺口。問題前提(認為文章發布於七月下旬,因此晚於本頁)也有誤,已在上文更正。

資料來源#

  • On the Navier–Stokes Millennium Prize Problem — OpenAI(無署名),openai.com,2026-09-08 發布,並於 2026-09-10 更新「Concurrent work」段落,約 1,900 字,vendor-claim。此處僅引用 §「Concurrent work」中對聯絡 Alpöge 與 Buckmaster、在強制 Euler 問題上讓出優先貢獻,以及自行調查競爭對手的 Codex 提示是否可能影響模型的說明。這是 OpenAI 對自身在一場自身也是當事方的爭議中所作行為的說明——本資料集中沒有另一方的說法。完整討論見 The Navier–Stokes AI Claim
  • The full-length interview with Elon Musk — 《經濟學人》,Elon Musk 完整訪談,2026-07-29(prediction,約 1:25 長,自動字幕逐字稿)。治理相關段落包含三層提案、競爭對手誘因與 MPAA 論點、Mythos/Amazon 主張、納入中國實驗室,以及信任相關對話。自動字幕沒有說話者標籤,因此依內容判定歸屬;除非另有標記,本頁所有主張皆為 Musk 所言。
  • A Framework for Frontier AI and the Dawning of a New Age — Demis Hassabis,demishassabis.substack.com,2026-07-14(practitioner-opinion)。此處僅用於更正日期、確立先後順序及比較裁決設計;提案本身見 Frontier AI Standards Body。日期已在文章頁面對照 JSON-LD 查證,這也是本頁原先「2026 年 7 月下旬」說法的修正依據
§ end
Cited by 19
Related articles