H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

無法約束陳述者自身的安全承諾

三個實體頁面的動機問題匯聚在同一個結構上:安全承諾以無法約束其作者的形式提出——Anthropic 的暫停立場以不存在的驗證制度為條件;DeepMind 的報告假設對齊問題已解決,因此在同一段中承認一項瓶頸會影響能力發展,卻又將它排除在自身的摩擦因素表之外;OpenAI 的章程則沒有持續存在的機制。Musk 的「所有道路都通往加速」概括缺乏支持:這是 n=1、依賴自我陳述、沒有反事實,而語料中只有一項具備真實機制的安全介入(RSP)曾經約束過一次——暫不公開 Mythos Preview——也朝著推出產品的方向彎折過兩次,其中包括一次 CB-2 判定:僅憑三次定性測試,就對上具前沿水準的自動化評估組合做出決定。每一項有記錄的機制都欠缺一個外部行動者,能做出違背開發者利益的決定;語料中只記錄過一次這種槓桿確實存在(LTBT 的外部審查權),但它從未被動用。

Article metadata
Publication details
Published:August 19, 2026
Filed:Essay
Domain:Superintelligence Trajectory
Tags:DerivedGovernanceAI PolicyIncentivesFrontier Labs
Reading:20 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

插圖:無法約束陳述者自身的安全承諾

資料來源#

三個問題#

  1. 來自 Anthropic Institute:研究所支持「保留暫停選項」的政策立場,與 Anthropic 推出前沿模型的商業誘因如何互動?文章承認競爭與地緣政治壓力,卻沒有化解這個問題。
  2. 來自 Shane Legg:報告假設對齊問題「已充分解決」,以便聚焦於發展軌跡——Legg 對 AGI 時程的樂觀看法,如何與這項範疇選擇相符?
  3. 來自 Elon Musk:對加速後悔的概括是否站得住腳——OpenAI 的案例真能支持「所有道路都通往加速」嗎?還是說,這只是一次介入,其設計缺陷明確可辨(非營利組織沒有維持非營利身分的機制)?

匯合點#

三者都描述了以一種無法約束陳述者自身的形式提出的安全承諾,但失敗方式各不相同:

  • 以不存在的前置條件為條件。 Anthropic 表示,如果其他人能經過驗證也暫停,它就會暫停;但驗證制度並不存在,而建立該制度正是研究所自身的議程之一(Frontier Pause Verification)。
  • 被排除在分析框架之外。 DeepMind 報告假設對齊問題已解決,好讓它分析發展軌跡——因此,在同一段中承認某項瓶頸會影響能力發展,卻又將它排除在摩擦因素表之外(AGI-to-ASI Pathways)。
  • 創立時沒有維持下去的機制。 一份接觸資本後未能存續的非營利組織章程(依 Musk 的說法,見 OpenAI)。

Q3 是關鍵,因為它是唯一提出一般性主張的問題——聲稱這種介入無法奏效。語料不支持這個說法。回答 Q3,就能把問題 1 和 2 從對動機的猜測,轉成對缺失條件的具體描述;後者範圍更窄,也可以查證。

對整篇文章有一項持續適用的保留:這份語料記錄的陳述立場遠多於實際行為的揭露,而下文幾乎所有關於 Anthropic 的觀察都來自 Anthropic 本身。凡有此情況,都會標明。本文延伸了 RSI Growth Curves: Which Friction Binds First? 的問題 (b)——人類實際能控制的那項摩擦,也就是刻意減速,能否真正形成約束?——從摩擦本身,延伸到必須設立這項約束的制度。


Q3 — 目前的證據不支持加速後悔的概括#

這項主張的依據#

Musk 明確以自身經歷提出推論:他創立 OpenAI,「基本上是為了制衡 Google」;Anthropic 接著從 OpenAI 分拆出去;「這些行動實際上產生了連鎖效應,加速了 AI 發展,而這原本不是我的本意。所以看起來所有道路都通往 AI 加速」(Elon Musk、The full-length interview with Elon Musk)。

在提出任何反例之前,先看這份證據的三項特性:

  • prediction 層級、單一來源、自動字幕逐字稿。 Elon Musk 唯一的來源就是這場訪談;沒有講者標籤,依據內容辨認發言者。
  • 結果是判斷,不是測量。 「加速了 AI」是 Musk 對自己介入的評估。本語料中完全沒有出現反事實——若 Google 壟斷市場且沒有 OpenAI,AI 發展會有多快——無論是測量結果或論證,都付之闕如。
  • 所述機制真實而具體。 出於安全考量而建立的制衡力量,反而成為競爭推手,這是可信的因果敘述;wiki 也已記錄,要從 n=1 個案推論,必須承擔相當重的論證負擔。

語料中有第二個案例嗎?#

我們直接檢驗了四個候選案例,沒有一個是獨立重現:

介入記錄到的結果是否獨立於 OpenAI 案例?
OpenAI 作為制衡 Google 的力量聲稱造成加速;非營利組織 →「價值 8,000 億美元、閉源的營利公司」(OpenAI)就是這個案例
Anthropic 從 OpenAI 分拆出去第三家前沿實驗室,紀錄好壞參半(見下文)否——Musk 將其描述為同一次介入的連鎖效應
2023 年的六個月暫停公開信沒有暫停;簽署者如今淡化自己簽名的重要性,並反對按下停止按鈕(Elon Musk)獨立,但這是一項呼籲,不是機制——它沒有任何可以施加約束的東西
Responsible Scaling Policy一次減速,兩次彎折(見下文)是——也是唯一設有預期能延續創辦人初衷之機制的候選案例

因此,語料中恰好只有一項同時以安全為動機,並且配備了預期能超越創辦人初衷而持續運作的制度: RSP——書面門檻、逐模型判定、ASL 分級、公開的 Risk Report,以及獲授權委託外部審查的 Long-Term Benefit Trust。

RSP 的紀錄實際呈現什麼#

它曾約束過一次。 Anthropic 暫緩公開 Mythos Preview,直到 Fable 5 的防護措施到位;之後判定該模型在進攻性網路能力上有重大躍進,因而推出 Project Glasswing。它也宣布對最具能力的模型採取 30 天保留期,並以自己的說法指出,這項安排不受客戶歡迎,且確實帶來商業風險(Anthropic §5.3、Risk Report: August 2026 (Redacted))。**證據的保留條件很重要:**這是 Anthropic 自己列出的「差異化影響」清單,Anthropic 在前言中指出「以下主張仍有討論空間」,並表示這份資料「與其說是嚴謹確立的結論,不如說是一份清單」。這些是陳述,未經稽核。

它曾兩次朝同一個方向彎折。 Opus 5 的 CB-2 判定,根據一項定性部署觀察——一次 n=3 的蛋白質設計測試——而做出判斷;另一方面,自動化 CB 評估組合顯示,Opus 5 的表現「與前沿模型相近,甚至略有改善」。若將此解讀為替代門檻,這樣的判斷有其道理;但這也是一次門檻判定:三次定性測試的權重高於整套自動化評估,方向則有利於推出模型。同一時期,已達飽和的 AI 研發排除測試套件,不再是「我們 RSP 和 FCF 能力門檻判定的關鍵組成部分」——這套架構本來要靠排除測試監看風險,如今卻眼看自己的排除測試失去排除效果(Responsible Scaling Policy Evaluations、Claude Opus 5 System Card)。

它也公布了預測,承認自己會在門檻過後仍推出模型。 2026 年 8 月 Risk Report 的 §4.8 指出:Anthropic 預期近期模型會達到 CB-2,或無法排除 CB-2;預期自己能達成 RSP「規劃中的」緩解措施;而「若模型能力提升的快速步調沒有改變,我們不預期能及時達成雄心勃勃的全產業建議(尤其是能可靠阻止資源充足的國家行為者發動攻擊的安全措施)」。這套架構可以要求採取與門檻相稱的防護措施,卻無法保證跨過門檻那天,相關安全措施已經到位。

Q3 的判斷#

目前的證據不支持這項概括。 就本語料的證據而言,這只有一項介入,由當事人自行評估,沒有反事實,也沒有重現案例;而根據同一份證據,設計缺陷的解讀更有說服力:語料中唯一一項具備持續機制的介入,曾留下減速的紀錄,這與「所有道路都通往加速」的說法相矛盾。

但設計缺陷的解讀也沒有完全勝出,剩下的問題在此。RSP 的機制從頭到尾都由 Anthropic 自行管理:Anthropic 設定門檻、執行評估、做出判定並發布評估結果。唯一由營運者以外的人掌握的槓桿——LTBT 對 Risk Reports 提出外部審查要求並核准審查者的權力——從未動用;現有的外部審查(METR 對 AI 研發的審查、SecureBio 對 CB 的審查)都是自願性試行(Anthropic)。因此,修正後的主張既不是「安全介入有效」,也不是「所有道路都通往加速」,而是:

本語料記錄的每項安全介入機制,都由受其約束的一方管理;而獨立槓桿唯一一次出現時,從未被動用。

還要留意,語料抵達 Musk 的結論,所走的路徑並非來自他自己的證據。DeepMind 報告提出的結構性論點——依循「軍事—經濟適應論」與「無政府狀態即架構師」的觀點(Dafoe 2015;MacInnes et al. 2024),採用能增強權力之技術的行動者會受到差異化篩選,使持續的多邊協調「難以實現,或許不切實際」(AGI-to-ASI Pathways、From AGI to ASI)——談的是行動者之間的協調問題,而不是單一行動者的介入是否適得其反。它支持對 Q1 多邊協調情境的悲觀看法,卻沒有說明 Musk 所概括的單一創辦人情境。Musk 也許是對的,只是理由並非他提出的那個。

第二個案例必須具備什麼條件#

若要讓 Q3 從「缺乏支持」轉為在任一方向上有定論,語料就需要一項介入,同時具備以下四點:

  1. 當時留下紀錄的安全動機,而不是事後重構。
  2. 可能做出不利決定的權力——明確列出的門檻,以及授權開發者以外的人判定是否達標的權力。
  3. 判定達標會帶來商業成本的時刻,而且是觀察所得,不是宣稱如此。
  4. 由介入方以外的人記錄的結果。

語料中沒有任何案例同時符合 (2) 和 (4)。最接近的全是提案,而非紀錄:Hassabis 的 Standards Body(對美國市場具約束力的通過/不通過標準,尚未實施,也沒說明由誰在組織內做決定)、Musk 本人提出的競爭者審查方案(建議延後,而非否決),以及 AI Futures Project 的 Option 4(由第三方評估者針對受監管的上限提出量化風險估計——但此方案也明確指出自身的缺口:現有的自願性第三方評估,包括 METR 的評估,「沒有提出這種制度要能運作所需的任何量化風險估計」)。有一項看似誘人的資料點不能採用:Fable 5 and Mythos 5 上線後遭到暫停,確實會是部署中止的真實案例,但來源橫幅沒有說明原因,語料也不知道這是安全評估結果,還是產能因素所致。


Q1 — 立場的設計讓能夠約束的版本既在外部,也不存在#

條件就是完整答案#

研究所的立場不是「我們會暫停」,而是世界應保有這個選項,並且 Anthropic 會減速或暫時暫停,如果其他前沿或近前沿開發者也能經過驗證採取同樣做法(Anthropic Institute、Frontier Pause Verification、When AI builds itself)。觸發這項承諾的驗證制度並不存在——研究所也如此明言,而建立制度正是它宣稱的議程。若承諾以作者仍在建構的前置條件為條件,目前就不會帶來任何成本。這是承諾形式的結構特性,不代表我們指控有人心懷不軌,而這正是 Q3 指出的形式。

文章提出的論據一舉兩用,最值得注意之處就在於此。「如果減速只是讓最不謹慎的行為者在技術上迎頭趕上,結果可能會使所有人都更不安全」;單方面暫停「會改變誰是領先者,卻無法創造目前缺少的、更廣泛的審慎協商程序」。這是實在的安全論據。同時,這也正是一家必須持續推出產品的公司,要想維持暫停立場卻不付出成本,所需要的論據。語料無法區分這兩種解讀,因為沒有任何案例能檢驗這項條件。

語料記錄的雙方證據#

實際承擔的成本(全部為第一方資料,且都來自 Risk Report 自己的清單): 暫緩 Mythos Preview,直到 Fable 5 的防護措施到位;推出 Project Glasswing;將 30 天保留期稱為真實的商業風險;支持 California SB 53,同時反對聯邦優先權;成為第一家支持 Illinois SB 315 的前沿開發者;發布 Advanced AI Framework,該框架「將允許美國聯邦政府阻止危險模型發布」——這是 Anthropic 唯一提出讓外部行動者掌握停止權的項目,也是反駁「純粹出於犬儒」解讀的最有力證據。尚未實施(Anthropic)。

兩者交會之處由壓力勝出: Opus 5 的 CB-2 判定與排除測試套件遭棄用(見上文);自動化研發評級維持不變,但信心下降,且出現「加速的早期跡象」,預測這個威脅模型「未來 6–12 個月將成為重大疑慮」;§4.8 則預測會在建議的安全措施到位前跨過 CB-2,唯一記錄下來的因應方式,是揭露缺口後仍繼續推出模型(Responsible Scaling Policy Evaluations)。

語料本身也對條件式立場的理由提出異議#

領先者論點承擔了「保留暫停選項」而非「暫停」的全部論據。Domestic Frontier Pacing 是第一個提出量化數據的來源:依 Epoch 的 ECI 國別視角,美國目前領先「約 4–8 個月」;但由於中國許多進展「來自蒸餾美國前沿成果並運用美國發現的演算法」,作者「估計如果美國停止發展,中國大約需要一年才能追上」——而且存在反向可能:一邊衝刺安全能力、一邊控制發展速度,「在超人類能力階段反而可能讓我們進一步拉開與中國的差距」(How to pace the US frontier)。雙方資料都屬於 practitioner-opinion,都不是測量結果,因此這裡只是記錄,不做裁決——但這代表,研究所立場的關鍵前提在 wiki 內部仍有爭議,尚未定論。

Q1 的判斷#

部分成立;對動機問題而言,這是誠實的判斷。 現在已經確立的是其形式:研究所的暫停承諾以不存在的制度為條件,因此今天無法形成約束;Anthropic 目前確實能形成約束的部分是 RSP,它由 Anthropic 自行管理,在自行選定的時點曾約束過一次,也公開預測過自己會在門檻過後仍繼續推出模型。尚未確立,而且本語料無法確立的是動機——條件式形式究竟是因為領先者論點有道理,還是因為這種形式方便。上述一切都是 Anthropic 評估 Anthropic;語料沒有第三方對門檻判定的紀錄,而唯一為了產生此類紀錄而設計的治理槓桿,至今仍未動用。


Q2 — 前提不在語料中;範疇缺陷則有紀錄,而且會影響路徑 3#

首先,修正問題中的說法#

wiki 沒有記錄任何 Shane Legg 對時間表的主張。 Shane Legg 記載了 Legg–Hutter 分數、智慧連續體的框架,以及他是報告的資深作者——沒有任何關於他預期何時出現 AGI 的內容。因此,「Legg 對 AGI 時程的樂觀看法」是從本語料以外引入的,無法拿來檢驗;本文也不會引入這項說法。

語料中確實記錄了兩件事,而問題真正關注的其實是這兩點:

  • DeepMind 確實有人提出短期時程主張,但說話者是 Hassabis,不是 Legg:AGI「大概只需短短幾年」,可比擬「電力或火的發現」,估計其影響「也許是工業革命的 10 倍,速度則快 10 倍」(Frontier AI Standards Body)。問題所暗示的張力確實存在於語料中,但對象是執行長。
  • 報告本身拒絕提出時間表。 報告結論指出:「與其聚焦在單一技術發展軌跡和時間表,不如為後 AGI 世界做好準備,並考量多種預測與情境」(From AGI to ASI);它也「刻意拒絕預測哪些摩擦會居於主導地位」(AGI-to-ASI Pathways)。因此,對齊假設並不是為報告中的時間表主張辯護,而是為一項沒有附帶時程的發展路徑分析辯護——這削弱了問題暗示的指控,卻讓真正的問題更加明確。

真正的缺陷:報告承認對齊問題是一項摩擦,卻將它排除在摩擦因素表之外#

這項假設出現在研究議程 §7,而同一段又削弱了它(強調為本文所加):

「為了讓本報告的範疇清楚明確,我們假設即使在後 AGI 世界,AI Safety 與對齊問題也會充分解決。這絕非理所當然,也不是輕率的假設……此外,對齊困難至少可能在某種程度上直接成為能力發展的瓶頸,因為不安全或無法控制的系統,無法妥善用於自動化研究或部署。」

按照報告自己的定義,凡是會拖慢發展路徑的因素都是一種摩擦。自動化研究的直接瓶頸就是一種摩擦。它不在表 4 列出的六項摩擦之中(AGI-to-ASI Pathways:資料瓶頸、經濟/資源需求、典範不足、研究日益困難、抽象化障礙、刻意減速)。範疇假設把一項報告在別處明言屬於摩擦的因素,從摩擦因素表中排除。

這項缺陷的影響範圍明確,並非普遍性的批評。它落在路徑 3,也就是遞迴式自我改進——這條路徑沒有歷史資料可供擬合,也是摩擦分析最重要的地方。如果不安全的系統無法妥善用於自動化研究,路徑 3 的發展速率就會受對齊進展限制,而報告卻把一個變數從最難預測的路徑中排除。這項問題與任何人的時程預測無關;因此它能根據語料回答,時間表問題則不能。

這也與語料先前的判斷相符。RSI Growth Curves: Which Friction Binds First? 將最可能形成約束的摩擦,排在迴圈與無法加速的現實之間的連結——即當今組織規模下的驗證與監督。從訓練的角度來看,對齊成為能力瓶頸正是同一項摩擦:無法驗證的系統,就不能交付任務。因此,這個遭排除的因素不是某種陌生的第七項摩擦;它會轉化為整合分析已排在首位的那一項——也與該頁在 2026-08-17 修訂版中對資料瓶頸的描述相同。

Q2 的判斷#

部分成立。 已確立的部分是:這項範疇選擇與報告本身承認的內容互相矛盾,而且矛盾明確影響路徑 3;報告沒有提出時間表,因此這項假設並非用來掩護某項預測。尚未確立、在此也無從確立的部分,是 Legg 個人對時程的看法;本語料沒有相關紀錄。若未來納入 Legg 親自談論時程的來源,再將標籤改為 #oq/source。


三個答案的共同指向#

失敗模式不在於以安全為動機的行動者並非真心。問題在於,每一個有紀錄的案例中,承諾都以讓行動者保有決定權的方式制定:

承諾誰能使它形成約束記錄到的結果
Q1如果其他人經過驗證也暫停,就暫停沒有人——該制度不存在未經檢驗;最接近臨界點的一次,內部煞車朝推出模型的方向彎折
Q2對齊問題「已充分解決」沒有人——這是前提,不是約束報告承認存在的一項摩擦,卻未列入摩擦因素表
Q3一個「由全世界擁有」的非營利組織沒有人——沒有持續存在的機制後來成為營利組織;事後被解讀為無物能形成約束的證據

Q3 對另外兩個問題的修正之處,在於這是設計特性,不是定律。RSP 顯示,書面的機制曾使模型發布減速一次。但本語料沒有任何案例顯示,機制曾在開發者不希望減速時使發布減速——因為沒有這類機制曾被動用。接下來值得觀察、也能查證的事情不是動機,而是:LTBT 外部審查權首次行使、首次提出量化的第三方風險估計,或首次由模型推出方以外的人做出門檻判定。

資料來源#

§ end
Cited by 12
  • Open Questions Dashboard×3

    Anthropic Institute: How does the Institute's policy posture (favoring an option to pause) interact…

  • Open Questions Backlog×3

    Anthropic Institute: How does the Institute's policy posture (favoring an option to pause) interact…

  • Anthropic Institute×2

    How does the Institute's policy posture (favoring an option to pause) interact with Anthropic's…

  • Elon Musk×2

    Is the acceleration-regret generalization sound — does the OpenAI case actually support "all roads…

  • Shane Legg×2

    The report assumes alignment is "solved to a sufficient degree" to focus on trajectories — how does…

  • AGI-to-ASI Pathways

    Safety Commitments That Cannot Bind — a seventh friction the report concedes and omits — alignment…

  • Anthropic

    Safety Commitments That Cannot Bind — the §5.3 differential-impacts inventory and the unused LTBT…

  • Frontier Pause Verification

    Safety Commitments That Cannot Bind — the conditional's structural consequence: a pause commitment…

  • Superintelligence Trajectory

    Safety Commitments That Cannot Bind — Three entity-page motive questions join on one structure: a…

  • Responsible Scaling Policy Evaluations

    Safety Commitments That Cannot Bind — this framework read as the corpus's only safety intervention…

  • RSI Growth Curves: Which Friction Binds First?

    > Follow-on to (b), 2026-08-19 — Safety Commitments That Cannot Bind takes the question from the…

  • Silent Revision Rate

    Safety Commitments That Cannot Bind — direct empirical grounding for that page's claim that "every…

Related articles
  • Responsible Scaling Policy Evaluations

    Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…

  • Frontier Pause Verification

    The arms-control problem of a credible, verifiable slowdown or pause of frontier AI: detectability is harder than for o…

  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Domestic Frontier Pacing

    AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…