資料來源#
- Claude Opus 5 System Card
- From AGI to ASI
- How to pace the US frontier
- Risk Report: August 2026 (Redacted)
- The full-length interview with Elon Musk
- When AI builds itself
三個問題#
- 來自 Anthropic Institute:研究所支持「保留暫停選項」的政策立場,與 Anthropic 推出前沿模型的商業誘因如何互動?文章承認競爭與地緣政治壓力,卻沒有化解這個問題。
- 來自 Shane Legg:報告假設對齊問題「已充分解決」,以便聚焦於發展軌跡——Legg 對 AGI 時程的樂觀看法,如何與這項範疇選擇相符?
- 來自 Elon Musk:對加速後悔的概括是否站得住腳——OpenAI 的案例真能支持「所有道路都通往加速」嗎?還是說,這只是一次介入,其設計缺陷明確可辨(非營利組織沒有維持非營利身分的機制)?
匯合點#
三者都描述了以一種無法約束陳述者自身的形式提出的安全承諾,但失敗方式各不相同:
- 以不存在的前置條件為條件。 Anthropic 表示,如果其他人能經過驗證也暫停,它就會暫停;但驗證制度並不存在,而建立該制度正是研究所自身的議程之一(Frontier Pause Verification)。
- 被排除在分析框架之外。 DeepMind 報告假設對齊問題已解決,好讓它分析發展軌跡——因此,在同一段中承認某項瓶頸會影響能力發展,卻又將它排除在摩擦因素表之外(AGI-to-ASI Pathways)。
- 創立時沒有維持下去的機制。 一份接觸資本後未能存續的非營利組織章程(依 Musk 的說法,見 OpenAI)。
Q3 是關鍵,因為它是唯一提出一般性主張的問題——聲稱這種介入無法奏效。語料不支持這個說法。回答 Q3,就能把問題 1 和 2 從對動機的猜測,轉成對缺失條件的具體描述;後者範圍更窄,也可以查證。
對整篇文章有一項持續適用的保留:這份語料記錄的陳述立場遠多於實際行為的揭露,而下文幾乎所有關於 Anthropic 的觀察都來自 Anthropic 本身。凡有此情況,都會標明。本文延伸了 RSI Growth Curves: Which Friction Binds First? 的問題 (b)——人類實際能控制的那項摩擦,也就是刻意減速,能否真正形成約束?——從摩擦本身,延伸到必須設立這項約束的制度。
Q3 — 目前的證據不支持加速後悔的概括#
這項主張的依據#
Musk 明確以自身經歷提出推論:他創立 OpenAI,「基本上是為了制衡 Google」;Anthropic 接著從 OpenAI 分拆出去;「這些行動實際上產生了連鎖效應,加速了 AI 發展,而這原本不是我的本意。所以看起來所有道路都通往 AI 加速」(Elon Musk、The full-length interview with Elon Musk)。
在提出任何反例之前,先看這份證據的三項特性:
prediction層級、單一來源、自動字幕逐字稿。 Elon Musk 唯一的來源就是這場訪談;沒有講者標籤,依據內容辨認發言者。- 結果是判斷,不是測量。 「加速了 AI」是 Musk 對自己介入的評估。本語料中完全沒有出現反事實——若 Google 壟斷市場且沒有 OpenAI,AI 發展會有多快——無論是測量結果或論證,都付之闕如。
- 所述機制真實而具體。 出於安全考量而建立的制衡力量,反而成為競爭推手,這是可信的因果敘述;wiki 也已記錄,要從 n=1 個案推論,必須承擔相當重的論證負擔。
語料中有第二個案例嗎?#
我們直接檢驗了四個候選案例,沒有一個是獨立重現:
| 介入 | 記錄到的結果 | 是否獨立於 OpenAI 案例? |
|---|---|---|
| OpenAI 作為制衡 Google 的力量 | 聲稱造成加速;非營利組織 →「價值 8,000 億美元、閉源的營利公司」(OpenAI) | 就是這個案例 |
| Anthropic 從 OpenAI 分拆出去 | 第三家前沿實驗室,紀錄好壞參半(見下文) | 否——Musk 將其描述為同一次介入的連鎖效應 |
| 2023 年的六個月暫停公開信 | 沒有暫停;簽署者如今淡化自己簽名的重要性,並反對按下停止按鈕(Elon Musk) | 獨立,但這是一項呼籲,不是機制——它沒有任何可以施加約束的東西 |
| Responsible Scaling Policy | 一次減速,兩次彎折(見下文) | 是——也是唯一設有預期能延續創辦人初衷之機制的候選案例 |
因此,語料中恰好只有一項同時以安全為動機,並且配備了預期能超越創辦人初衷而持續運作的制度: RSP——書面門檻、逐模型判定、ASL 分級、公開的 Risk Report,以及獲授權委託外部審查的 Long-Term Benefit Trust。
RSP 的紀錄實際呈現什麼#
它曾約束過一次。 Anthropic 暫緩公開 Mythos Preview,直到 Fable 5 的防護措施到位;之後判定該模型在進攻性網路能力上有重大躍進,因而推出 Project Glasswing。它也宣布對最具能力的模型採取 30 天保留期,並以自己的說法指出,這項安排不受客戶歡迎,且確實帶來商業風險(Anthropic §5.3、Risk Report: August 2026 (Redacted))。**證據的保留條件很重要:**這是 Anthropic 自己列出的「差異化影響」清單,Anthropic 在前言中指出「以下主張仍有討論空間」,並表示這份資料「與其說是嚴謹確立的結論,不如說是一份清單」。這些是陳述,未經稽核。
它曾兩次朝同一個方向彎折。 Opus 5 的 CB-2 判定,根據一項定性部署觀察——一次 n=3 的蛋白質設計測試——而做出判斷;另一方面,自動化 CB 評估組合顯示,Opus 5 的表現「與前沿模型相近,甚至略有改善」。若將此解讀為替代門檻,這樣的判斷有其道理;但這也是一次門檻判定:三次定性測試的權重高於整套自動化評估,方向則有利於推出模型。同一時期,已達飽和的 AI 研發排除測試套件,不再是「我們 RSP 和 FCF 能力門檻判定的關鍵組成部分」——這套架構本來要靠排除測試監看風險,如今卻眼看自己的排除測試失去排除效果(Responsible Scaling Policy Evaluations、Claude Opus 5 System Card)。
它也公布了預測,承認自己會在門檻過後仍推出模型。 2026 年 8 月 Risk Report 的 §4.8 指出:Anthropic 預期近期模型會達到 CB-2,或無法排除 CB-2;預期自己能達成 RSP「規劃中的」緩解措施;而「若模型能力提升的快速步調沒有改變,我們不預期能及時達成雄心勃勃的全產業建議(尤其是能可靠阻止資源充足的國家行為者發動攻擊的安全措施)」。這套架構可以要求採取與門檻相稱的防護措施,卻無法保證跨過門檻那天,相關安全措施已經到位。
Q3 的判斷#
目前的證據不支持這項概括。 就本語料的證據而言,這只有一項介入,由當事人自行評估,沒有反事實,也沒有重現案例;而根據同一份證據,設計缺陷的解讀更有說服力:語料中唯一一項具備持續機制的介入,曾留下減速的紀錄,這與「所有道路都通往加速」的說法相矛盾。
但設計缺陷的解讀也沒有完全勝出,剩下的問題在此。RSP 的機制從頭到尾都由 Anthropic 自行管理:Anthropic 設定門檻、執行評估、做出判定並發布評估結果。唯一由營運者以外的人掌握的槓桿——LTBT 對 Risk Reports 提出外部審查要求並核准審查者的權力——從未動用;現有的外部審查(METR 對 AI 研發的審查、SecureBio 對 CB 的審查)都是自願性試行(Anthropic)。因此,修正後的主張既不是「安全介入有效」,也不是「所有道路都通往加速」,而是:
本語料記錄的每項安全介入機制,都由受其約束的一方管理;而獨立槓桿唯一一次出現時,從未被動用。
還要留意,語料抵達 Musk 的結論,所走的路徑並非來自他自己的證據。DeepMind 報告提出的結構性論點——依循「軍事—經濟適應論」與「無政府狀態即架構師」的觀點(Dafoe 2015;MacInnes et al. 2024),採用能增強權力之技術的行動者會受到差異化篩選,使持續的多邊協調「難以實現,或許不切實際」(AGI-to-ASI Pathways、From AGI to ASI)——談的是行動者之間的協調問題,而不是單一行動者的介入是否適得其反。它支持對 Q1 多邊協調情境的悲觀看法,卻沒有說明 Musk 所概括的單一創辦人情境。Musk 也許是對的,只是理由並非他提出的那個。
第二個案例必須具備什麼條件#
若要讓 Q3 從「缺乏支持」轉為在任一方向上有定論,語料就需要一項介入,同時具備以下四點:
- 當時留下紀錄的安全動機,而不是事後重構。
- 可能做出不利決定的權力——明確列出的門檻,以及授權開發者以外的人判定是否達標的權力。
- 判定達標會帶來商業成本的時刻,而且是觀察所得,不是宣稱如此。
- 由介入方以外的人記錄的結果。
語料中沒有任何案例同時符合 (2) 和 (4)。最接近的全是提案,而非紀錄:Hassabis 的 Standards Body(對美國市場具約束力的通過/不通過標準,尚未實施,也沒說明由誰在組織內做決定)、Musk 本人提出的競爭者審查方案(建議延後,而非否決),以及 AI Futures Project 的 Option 4(由第三方評估者針對受監管的上限提出量化風險估計——但此方案也明確指出自身的缺口:現有的自願性第三方評估,包括 METR 的評估,「沒有提出這種制度要能運作所需的任何量化風險估計」)。有一項看似誘人的資料點不能採用:Fable 5 and Mythos 5 上線後遭到暫停,確實會是部署中止的真實案例,但來源橫幅沒有說明原因,語料也不知道這是安全評估結果,還是產能因素所致。
Q1 — 立場的設計讓能夠約束的版本既在外部,也不存在#
條件就是完整答案#
研究所的立場不是「我們會暫停」,而是世界應保有這個選項,並且 Anthropic 會減速或暫時暫停,如果其他前沿或近前沿開發者也能經過驗證採取同樣做法(Anthropic Institute、Frontier Pause Verification、When AI builds itself)。觸發這項承諾的驗證制度並不存在——研究所也如此明言,而建立制度正是它宣稱的議程。若承諾以作者仍在建構的前置條件為條件,目前就不會帶來任何成本。這是承諾形式的結構特性,不代表我們指控有人心懷不軌,而這正是 Q3 指出的形式。
文章提出的論據一舉兩用,最值得注意之處就在於此。「如果減速只是讓最不謹慎的行為者在技術上迎頭趕上,結果可能會使所有人都更不安全」;單方面暫停「會改變誰是領先者,卻無法創造目前缺少的、更廣泛的審慎協商程序」。這是實在的安全論據。同時,這也正是一家必須持續推出產品的公司,要想維持暫停立場卻不付出成本,所需要的論據。語料無法區分這兩種解讀,因為沒有任何案例能檢驗這項條件。
語料記錄的雙方證據#
實際承擔的成本(全部為第一方資料,且都來自 Risk Report 自己的清單): 暫緩 Mythos Preview,直到 Fable 5 的防護措施到位;推出 Project Glasswing;將 30 天保留期稱為真實的商業風險;支持 California SB 53,同時反對聯邦優先權;成為第一家支持 Illinois SB 315 的前沿開發者;發布 Advanced AI Framework,該框架「將允許美國聯邦政府阻止危險模型發布」——這是 Anthropic 唯一提出讓外部行動者掌握停止權的項目,也是反駁「純粹出於犬儒」解讀的最有力證據。尚未實施(Anthropic)。
兩者交會之處由壓力勝出: Opus 5 的 CB-2 判定與排除測試套件遭棄用(見上文);自動化研發評級維持不變,但信心下降,且出現「加速的早期跡象」,預測這個威脅模型「未來 6–12 個月將成為重大疑慮」;§4.8 則預測會在建議的安全措施到位前跨過 CB-2,唯一記錄下來的因應方式,是揭露缺口後仍繼續推出模型(Responsible Scaling Policy Evaluations)。
語料本身也對條件式立場的理由提出異議#
領先者論點承擔了「保留暫停選項」而非「暫停」的全部論據。Domestic Frontier Pacing 是第一個提出量化數據的來源:依 Epoch 的 ECI 國別視角,美國目前領先「約 4–8 個月」;但由於中國許多進展「來自蒸餾美國前沿成果並運用美國發現的演算法」,作者「估計如果美國停止發展,中國大約需要一年才能追上」——而且存在反向可能:一邊衝刺安全能力、一邊控制發展速度,「在超人類能力階段反而可能讓我們進一步拉開與中國的差距」(How to pace the US frontier)。雙方資料都屬於 practitioner-opinion,都不是測量結果,因此這裡只是記錄,不做裁決——但這代表,研究所立場的關鍵前提在 wiki 內部仍有爭議,尚未定論。
Q1 的判斷#
部分成立;對動機問題而言,這是誠實的判斷。 現在已經確立的是其形式:研究所的暫停承諾以不存在的制度為條件,因此今天無法形成約束;Anthropic 目前確實能形成約束的部分是 RSP,它由 Anthropic 自行管理,在自行選定的時點曾約束過一次,也公開預測過自己會在門檻過後仍繼續推出模型。尚未確立,而且本語料無法確立的是動機——條件式形式究竟是因為領先者論點有道理,還是因為這種形式方便。上述一切都是 Anthropic 評估 Anthropic;語料沒有第三方對門檻判定的紀錄,而唯一為了產生此類紀錄而設計的治理槓桿,至今仍未動用。
Q2 — 前提不在語料中;範疇缺陷則有紀錄,而且會影響路徑 3#
首先,修正問題中的說法#
wiki 沒有記錄任何 Shane Legg 對時間表的主張。 Shane Legg 記載了 Legg–Hutter 分數、智慧連續體的框架,以及他是報告的資深作者——沒有任何關於他預期何時出現 AGI 的內容。因此,「Legg 對 AGI 時程的樂觀看法」是從本語料以外引入的,無法拿來檢驗;本文也不會引入這項說法。
語料中確實記錄了兩件事,而問題真正關注的其實是這兩點:
- DeepMind 確實有人提出短期時程主張,但說話者是 Hassabis,不是 Legg:AGI「大概只需短短幾年」,可比擬「電力或火的發現」,估計其影響「也許是工業革命的 10 倍,速度則快 10 倍」(Frontier AI Standards Body)。問題所暗示的張力確實存在於語料中,但對象是執行長。
- 報告本身拒絕提出時間表。 報告結論指出:「與其聚焦在單一技術發展軌跡和時間表,不如為後 AGI 世界做好準備,並考量多種預測與情境」(From AGI to ASI);它也「刻意拒絕預測哪些摩擦會居於主導地位」(AGI-to-ASI Pathways)。因此,對齊假設並不是為報告中的時間表主張辯護,而是為一項沒有附帶時程的發展路徑分析辯護——這削弱了問題暗示的指控,卻讓真正的問題更加明確。
真正的缺陷:報告承認對齊問題是一項摩擦,卻將它排除在摩擦因素表之外#
這項假設出現在研究議程 §7,而同一段又削弱了它(強調為本文所加):
「為了讓本報告的範疇清楚明確,我們假設即使在後 AGI 世界,AI Safety 與對齊問題也會充分解決。這絕非理所當然,也不是輕率的假設……此外,對齊困難至少可能在某種程度上直接成為能力發展的瓶頸,因為不安全或無法控制的系統,無法妥善用於自動化研究或部署。」
按照報告自己的定義,凡是會拖慢發展路徑的因素都是一種摩擦。自動化研究的直接瓶頸就是一種摩擦。它不在表 4 列出的六項摩擦之中(AGI-to-ASI Pathways:資料瓶頸、經濟/資源需求、典範不足、研究日益困難、抽象化障礙、刻意減速)。範疇假設把一項報告在別處明言屬於摩擦的因素,從摩擦因素表中排除。
這項缺陷的影響範圍明確,並非普遍性的批評。它落在路徑 3,也就是遞迴式自我改進——這條路徑沒有歷史資料可供擬合,也是摩擦分析最重要的地方。如果不安全的系統無法妥善用於自動化研究,路徑 3 的發展速率就會受對齊進展限制,而報告卻把一個變數從最難預測的路徑中排除。這項問題與任何人的時程預測無關;因此它能根據語料回答,時間表問題則不能。
這也與語料先前的判斷相符。RSI Growth Curves: Which Friction Binds First? 將最可能形成約束的摩擦,排在迴圈與無法加速的現實之間的連結——即當今組織規模下的驗證與監督。從訓練的角度來看,對齊成為能力瓶頸正是同一項摩擦:無法驗證的系統,就不能交付任務。因此,這個遭排除的因素不是某種陌生的第七項摩擦;它會轉化為整合分析已排在首位的那一項——也與該頁在 2026-08-17 修訂版中對資料瓶頸的描述相同。
Q2 的判斷#
部分成立。 已確立的部分是:這項範疇選擇與報告本身承認的內容互相矛盾,而且矛盾明確影響路徑 3;報告沒有提出時間表,因此這項假設並非用來掩護某項預測。尚未確立、在此也無從確立的部分,是 Legg 個人對時程的看法;本語料沒有相關紀錄。若未來納入 Legg 親自談論時程的來源,再將標籤改為 #oq/source。
三個答案的共同指向#
失敗模式不在於以安全為動機的行動者並非真心。問題在於,每一個有紀錄的案例中,承諾都以讓行動者保有決定權的方式制定:
| 承諾 | 誰能使它形成約束 | 記錄到的結果 | |
|---|---|---|---|
| Q1 | 如果其他人經過驗證也暫停,就暫停 | 沒有人——該制度不存在 | 未經檢驗;最接近臨界點的一次,內部煞車朝推出模型的方向彎折 |
| Q2 | 對齊問題「已充分解決」 | 沒有人——這是前提,不是約束 | 報告承認存在的一項摩擦,卻未列入摩擦因素表 |
| Q3 | 一個「由全世界擁有」的非營利組織 | 沒有人——沒有持續存在的機制 | 後來成為營利組織;事後被解讀為無物能形成約束的證據 |
Q3 對另外兩個問題的修正之處,在於這是設計特性,不是定律。RSP 顯示,書面的機制曾使模型發布減速一次。但本語料沒有任何案例顯示,機制曾在開發者不希望減速時使發布減速——因為沒有這類機制曾被動用。接下來值得觀察、也能查證的事情不是動機,而是:LTBT 外部審查權首次行使、首次提出量化的第三方風險估計,或首次由模型推出方以外的人做出門檻判定。
資料來源#
- Anthropic Institute — 條件式暫停立場,以及研究所的驗證議程
- Frontier Pause Verification —「若能驗證,便會暫停」的表述、單方面暫停的反對論點,以及 Domestic Frontier Pacing 對此提出的量化挑戰
- Responsible Scaling Policy Evaluations — RSP 曾約束一次、彎折兩次的紀錄:暫緩 Mythos Preview、Opus 5 的 CB-2 判定、已飽和的排除測試套件,以及 §4.8 對門檻過後仍推出模型的預測
- Anthropic — §5.3 的差異化影響清單及其中「仍有討論空間」的免責聲明;LTBT 的外部審查權,以及尚未動用此權的事實
- Elon Musk — 加速後悔的引言、反轉表格,以及 wiki 對 n=1 推論已有的標記
- OpenAI — 制衡力量的創立初衷與從非營利轉為營利的爭議;兩者的唯一來源都是 Musk 訪談
- Shane Legg / AGI-to-ASI Pathways — 資深作者身分、六項摩擦的表格,以及對刻意減速/適應論的分析
- Frontier AI Standards Body — 語料中唯一來自 DeepMind 的短期時程主張(Hassabis),以及一項沒有說明決策者的約束性通過/不通過提案
- Cross-Lab Pre-Release Review / Domestic Frontier Pacing / METR — 三個最接近由外部掌握決策權的方案,全部是提案或自願試行
- Claude Opus 5 — 根據三次定性測試做出的 CB-2 判定
- Claude Fable 5 — 上線後暫停,但語料不清楚原因,因此不能計入
- RSI Growth Curves: Which Friction Binds First? — 本文延伸的前一份整合分析:它的問題 (b) 是能否讓刻意減速形成約束;本文則追問,負責設立約束的行動者,結構上是否有能力維持它
- When AI builds itself — §“What should we do?”:保留暫停選項的框架,以及領先者論點
- From AGI to ASI — §7(對齊假設及其對能力瓶頸的讓步)、§7.2(拒絕採用單一時間表)、摩擦因素表,以及 Dafoe 對適應論的段落
- The full-length interview with Elon Musk —
prediction層級、自動字幕逐字稿,也是加速後悔主張的唯一來源 - Risk Report: August 2026 (Redacted) — §1.2–1.3、§4.8、§5.3、§6.4.1
- Claude Opus 5 System Card — §2.1.3、§2.2.6、§2.3.5
- How to pace the US frontier — 美國目前領先 4–8 個月,以及約一年追上的估計
Cited by 12
- Open Questions Dashboard×3
Anthropic Institute: How does the Institute's policy posture (favoring an option to pause) interact…
- Open Questions Backlog×3
Anthropic Institute: How does the Institute's policy posture (favoring an option to pause) interact…
- Anthropic Institute×2
How does the Institute's policy posture (favoring an option to pause) interact with Anthropic's…
- Elon Musk×2
Is the acceleration-regret generalization sound — does the OpenAI case actually support "all roads…
- Shane Legg×2
The report assumes alignment is "solved to a sufficient degree" to focus on trajectories — how does…
- AGI-to-ASI Pathways
Safety Commitments That Cannot Bind — a seventh friction the report concedes and omits — alignment…
- Anthropic
Safety Commitments That Cannot Bind — the §5.3 differential-impacts inventory and the unused LTBT…
- Frontier Pause Verification
Safety Commitments That Cannot Bind — the conditional's structural consequence: a pause commitment…
- Superintelligence Trajectory
Safety Commitments That Cannot Bind — Three entity-page motive questions join on one structure: a…
- Responsible Scaling Policy Evaluations
Safety Commitments That Cannot Bind — this framework read as the corpus's only safety intervention…
- RSI Growth Curves: Which Friction Binds First?
> Follow-on to (b), 2026-08-19 — Safety Commitments That Cannot Bind takes the question from the…
- Silent Revision Rate
Safety Commitments That Cannot Bind — direct empirical grounding for that page's claim that "every…
Related articles
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
- Frontier Pause Verification
The arms-control problem of a credible, verifiable slowdown or pause of frontier AI: detectability is harder than for o…
- Recursive Self-Improvement
An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Domestic Frontier Pacing
AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…
