H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

國內前沿節奏管理

AI Futures Project 提出的四種單邊管理美國前沿 AI 發展速度的方案:暫停(100% 推論)、運算資源分配最低比例(70% 外部推論 + 25% 透明安全研究 + 5% 能力研發)、用於 AI R&D 的模型落後 9 個月能力,以及每月存在風險上限為 1% 的安全案例風險評估;另提出全文首個具體的稽核員存取階梯,以及運算資源分配規則首次明確列出的門檻比例

Article metadata
Publication details
Published:August 12, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceAI PolicyComputeCoordinationFrontier Labs
Reading:33 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

國內前沿節奏管理示意圖

資料來源#

摘要#

How to pace the US frontier — Tentative proposals for domestic AI regulation(How to pace the US frontier,2026-08-05,practitioner-opinion)由 AI Futures Project 的 Eli Lifland、Brendan Halstead、Romeo Dean、Thomas Larsen 和 Miles Kodama 撰寫;他們是 AI 2027 / AI 2040 預測團隊。除非另有標示,本文所有內容都是他們的提案;其中沒有任何內容已經實施或測量,作者也明確稱文章只是暫定版本:「這些提案都沒有 AI 2040 那麼完善或經過深思熟慮……希望幾個月後,我們能提出更經得起考驗、可以堅定支持的方案。」

他們將節奏管理定義為**「在特定司法管轄區內,調節超過指定能力水準的 AI 開發時間」,並將本文範圍限於國內、單邊**情境——也就是 Frontier Pause Verification 所處理問題的弱版本。他們主張,這個弱版本現在就能做到:「美國政府今天就可以要求美國公司放慢前沿 AI 開發,幾乎不需要進一步準備,也只需很少的設置時間。」本文是為回應 Pacing the Frontier 公開信而寫;該信由「超過 1,000 名前沿 AI 員工」簽署,呼籲美國支持一項國際行動。

本文是目前本知識庫中最具體可執行的治理文件,有兩個原因。它是本 wiki 首個為運算資源分配規則提出數字的提案——明列比例、測量工具和稽核機制;也是首個具體說明稽核員存取權究竟代表什麼的提案,並以五級階梯一路延伸到資料中心的網路竊聽點。

四種選項:由易到難的階梯#

作者明確按順序排列方案:「最自然的做法是依序實施提案,從最簡單、投入最低的選項開始,逐步推進到執行得宜時效果更好、但執行難度也更高的提案。例外是,我們建議只選擇選項 2 或 3 其中之一。」摘要圖的橫軸是準備與執行難度,縱軸是執行得宜時的風險降低幅度;四個選項沿著兩軸單調遞增。

機制核心數字準備時間難度
選項 1 — 暫時暫停所有運算資源都必須用於推論100% 推論數天容易
選項 2 — 運算資源分配最低比例 + 監控至少 70% 用於外部推論,至少 25% 用於透明安全研究;測量能力並調整最低比例70% / 25%數天至數週中等
選項 3 — 限制用於 AI R&D 模型的能力只能用低於能力上限的模型自動化 AI R&D能力落後 9 個月數天至數週中等
選項 4 — 安全案例風險評估第三方評估者估算承擔的風險,公司必須維持在門檻以下每月風險至多 1%數月至數年困難

選項 1 被定位為權宜措施——「直到允許恢復訓練的措施實施為止」;作者也承認可以跳過:「如果災難性能力看起來還很遙遠,最好直接採用選項 2 或 3。」他們指出兩種漏洞:公司可以預先大量生成資料供日後使用,以及由人類推動的推論效率提升仍會持續。

選項 2:分配比例,以及它的分母#

以下每個比例都以公司全部運算資源為分母,不是以 R&D 運算資源或資料中心總量為分母。圖中列出四種情境(實心部分 = 強制最低比例,條紋部分 = 估計剩餘量):

情境外部推論安全研究能力研發
目前(三者皆為估計)50%2%48%
安全研究最低比例(安全研究至少占 75%)12.5%75%12.5%
推論最低比例(推論至少占 90%)90%0.4%9.6%
安全研究與推論最低比例(建議方案)70%25%5%

建議的兩項最低比例加總為 100%:70 + 25,剩下 5% 用於能力研發。正文以「例如 70%」和「例如 25%」等措辭保留彈性;這種保留本身也是主張的一部分——作者並未聲稱這些就是正確數字。

「等同於推論最低比例 90%」的等同範圍比表面看來窄。 在建模章節,作者假設安全運算資源「造成的能力外部性,等同於額外分配 5% 給能力研發;也可以把這視為模擬外部推論最低比例為 90% 的效果。」這種等同只適用於能力研發占比——強制分配 5% 加上外洩的 5%,合計約為 90% 推論最低比例留下的約 10%;除此之外,兩種情境並不相似,因為前者分配 25% 給安全研究,後者只有 0.4%。圖表中的數字讓算式可以核對:目前估計的能力研發占比從 48% 降至約 9.6%,正好是建模圖表標題所說的「原先比例的五分之一」。

推行分階段進行,起步比例比核心數字低一個數量級。 建議的實施路徑是:(1)「先採用相對低的運算資源最低比例(例如 5%),低到即使全部實際用於能力研發也可以接受。」(2) 預設要求透明安全研究所用運算資源的所有工作負載都公開結果,並公開所有程式碼,「部分預先核准的例外除外(例如會揭露模型架構的程式碼)。」(3) 開放申訴,要求進一步遮蔽資訊。(4)「調整這套安排,直到它似乎能推動安全進展、但不會造成太多能力進展,再提高運算資源最低比例(例如 25%)。」另就準備工作提出的建議是先試行**「5–20% 安全運算資源最低比例」**,稱這是「直接效益最大」的試點。因此,本文實際建議近期採用的數字是 5–20%,而非 25%。

透明化作法,以及它為何是設計核心#

作者要繞開的難題是,監管機關無法區分安全研究與能力研究——「資訊不對稱,而且實際上有模糊地帶——多數研究很可能兩者兼具。」作者不要求稽核員分類研究,而是以公開要求強制執行安全研究最低比例:如果公司將透明運算資源用於能力研究,「就得自行承擔運算資源的全部成本,同時把成果分享給所有競爭者。」由此形成的誘因會促成分類。

作者承認,最大程度的透明會損害研究品質:公司「可能不想在安全實驗中使用前沿生產程式碼和演算法,因為這些內容會外洩。」他們提出一個競爭性替代方案,認為效果相近:設置內部安全研究最低比例,由稽核員驗證運算資源確實用於安全研究,並估算公司若整合任何研究成果會取得多少能力增益,再依這些外部性的大小調整最低比例。

反規避條件:設計不可或缺的一環#

每項最低比例都附有條件,防止公司只在名義上達標。這些條件是提案中最具體的部分,單獨引用比例時很容易忽略。

70% 外部推論最低比例的附加條件——外部部署可能透過合成資料生成、由合作夥伴評分的 RL rollout,或利用部署紀錄訓練,轉化為能力進展,因此公司應:

  1. 「同意不購買任何外部 AI 生成資料」
  2. 「同意不使用客戶資料或其他未納入外部推論的內部資料訓練」

而「如同享有特權的內部員工」的稽核員必須確認所申報的外部推論確實是外部推論,並檢查是否違反任一條件。作者指出,如果政府施加嚴厲懲罰,吹哨者訪談與保護或許就足夠,但認為派駐稽核員是更好的工具。

25% 透明安全研究最低比例的附加條件——預設公開研究成果,除預先核准的例外外公開所有程式碼;更關鍵的是,須有申訴途徑及相關標準:「安全研究人員可以向第三方稽核員申訴,逐案要求進一步遮蔽資訊,但稽核員奉命確保能力進展公開。稽核員可以完整存取安全工作負載的真實紀錄。」

註腳 3 指出,單獨採用任一最低比例就足以達成目標——「推論最低比例本身就足以放慢前沿發展;安全研究最低比例只要訂得夠高也行」——而建議兩者並用,是為了「在可行性與安全性間取得平衡」。

選項 3:能力落後 9 個月#

限制可用於自動化 AI R&D 的模型能力。最可能採用的執行方式以時間而非指標為準:「AI R&D 只能由至少在 9 個月前訓練完成的 AI 執行或輔助。」以 ECI 門檻為準的版本被列為「另一種更複雜」的選項;固定 X 值則放在註腳中,表示只有在 X 訂得夠高時才適合在國內執行。

作者聲稱此方案有三項特性,第二項是本知識庫中其他提案都沒有的:

  1. 延後破壞窗口——也就是「AI 有能力破壞 AI 研究並讓下一個模型與自身對齊的時點」。此方案直接鎖定 Recursive Self-Improvement 風險,而不是透過替代指標處理。
  2. 造成「內部與公開模型的負向落差」——模型會在用於內部 AI R&D 之前先向公眾發布。此 wiki 中其他發布前監督提案(Cross-Lab Pre-Release Review、Frontier AI Standards Body、Government Checkpoint Sharing)都假設內部模型領先公開模型,並討論誰先看到;此方案則刻意將順序反轉,作為設計目標。
  3. 在快速起飛的世界中最有效,作者以此向 RSI 懷疑者提出理由:「對快速遞迴自我改進持懷疑態度的人可能願意接受這項政策,因為依照他們的世界觀,此政策的影響不會那麼大。」

執法時,稽核員必須「檢視 AI 模型的活動並判斷其是否構成執行或協助 AI R&D」——作者稱這個分類問題「經過一些迭代即可處理」,但值得注意的是,他們並未對此採用透明化的權宜作法。他們希望能對測試、安全研究和監控設置例外,但也明確指出,如果這會造成太多複雜性或容易被鑽漏洞,可以刪除這些例外。

文章後來追加的編輯內容指出此選項最糟糕的情況:若安全性不佳,中國可能竊取最頂尖的內部模型,最後用來做 AI R&D 的模型甚至比美國公司更好;內部與公開模型的負向落差也使蒸餾成為可透過合法途徑達成的同一種危險。

選項 4:每月 1%,以及數字的由來#

第四種選項不再依賴替代指標。具員工層級存取權的第三方評估者,估算特定公司的持續營運在未來一段期間內造成的存在風險;政府依門檻進行監管,例如「公司每月承擔的存在風險必須低於 1%。」評估必須著眼未來,因為「單一失誤若不可逆且無法接受,事後評估就行不通。」

1% 這個數字來自作者自己的預測,並非實測;在一篇其他內容都標為 practitioner-opinion 的文件中,它屬於 prediction 等級。 作者明確說這只是「舉例說明」,推導方式如下:評估者判斷從 Automated Coder 到 Top-Expert-Dominating AI 的全速差距需要 1.5 年;全速起飛「會帶來 75% 的不可逆 AI 接管機率,但在安全案例制度下,風險可降至約 40%,同時仍能保持領先中國」;「假設有 3 家前沿公司,平均每月承擔的風險約為 1%。」 所有輸入值都是提案者自己的估計,作者還補充說:「起飛初期的風險可能低於後期,因此每月最高門檻可以訂得更高。」

接著,他們也提出反駁自己的數字:「從某個角度來看,這個門檻高得驚人。FAA 將每次飛行小時內發生『災難性故障』的上限訂為 10 億分之一。而我們在此提議,允許發生機率為百分之一、後果遠比飛機失事嚴重得多的事件。」

文件明確規定如何彙整不同評估者的結果——「每家公司承擔的總風險,將以評估者估計值的加權平均來估算(所有公司使用相同權重)」——所有公司採用相同權重,是為了防止偏袒。文件沒有說明由誰設定權重。註腳 8 也坦承,門檻所指的事件同樣未被具體定義:不可逆的接管涉及許多漸進步驟,作者偏好設定在較早階段的門檻(「執行長已無法關閉自己的資料中心」、「USG 已無法關閉前沿 AI 公司」),而非較晚的門檻(「超過 10 億人死亡」);但他們承認,早期門檻更難取得共識,而且「仍有些模糊」。

相較於選項 2 和 3,作者主張其優勢在於形狀,而不是水準:固定比例限制運算資源,在能力水準較低時就取得大部分額外時間,「這正好與我們想要的相反」;安全案例式節奏管理則會恰好在風險門檻生效時達到平緩。此方案還允許採取比放慢開發更細緻的介入措施,例如撤下被發現不對齊的模型、採用更安全但成本更高的架構(不以思維鏈訓練;避免長而難以解讀的推理鏈),以及設置內部治理機制,指定一位有權撤下模型的人。作者列出四項限制,其中兩項是結構性的:評估涉及主觀判斷,因此相較於一體適用、執法標準「更明確」的運算資源規則,此制度較難抵禦政府惡意操作;此外,「AI 公司會對風險評估程序施加壓力」,因此「執行不佳的制度可能排擠其他更難鑽漏洞的作法。」

模型對「何時」的實際說法:只有圖例呈現的結果#

本文使用兩位預測者的中位數參數執行 AI Futures Model,報告 Automated Coder 的出現時間和起飛長度(從 AC 到超級智慧)。正文只說:「越早介入,AC 時程就越長,但起飛期的延長幅度較小。」圖例揭示了更明確的結果。

削減日期(運算資源降至五分之一)Kokotajlo 參數:AC / 起飛期Lifland 參數:AC / 起飛期
不削減2028.3 / 1.0 年2029.5 / 2.6 年
2026.75(目前)2029.4 / 1.6 年2031.1 / 3.7 年
倒數第二早2029.1 / 1.8 年(削減時間 2027.51)2030.8 / 3.9 年(削減時間 2028.12)
在不削減情境的 AC 日期介入2028.3 / 2.3 年(削減時間 2028.28)2029.5 / 5.0 年(削減時間 2029.50)
AC 之後2028.3 / 1.9 年(削減時間 2028.79)2029.5 / 4.3 年(削減時間 2030.78)

起飛期延長幅度隨削減時機呈非單調變化,在削減時間落在 Automated Coder 時達到高峰——兩位預測者的參數都是如此,而且在 AC 之後才削減,效果比在 AC 時削減更差。正文和圖表標題都未明說這點;只有從圖例才能讀出。這是量化結果,支持作者提出的規則(「前沿模型大致達到 Automated Coder 時,就積極放慢其發展」),但作者並未在文字中如此主張。

(此處依 wiki 數據計算,非作者所述:將 AC 出現時間加上起飛期長度,可得超級智慧出現年份;以此指標衡量時,排名反轉——兩組參數下都是越早削減越好(Kokotajlo 為 2031.0 對 2030.6;Lifland 為 2034.8 對 2034.5)。因此,「在 AC 時削減」和「儘可能早削減」最佳化的是不同目標;作者偏好前者,完全取決於其主張:後期時間比早期時間更有價值。)

以同一尺度比較選項 3,從 2026.75 起實施:Kokotajlo 的 AC 為 2028.4,起飛期為 2.4 年;Lifland 的 AC 為 2029.7,起飛期為 4.1 年。今天採用 9 個月落差,比今天削減運算資源更能延長起飛期(2.4 對 1.6;4.1 對 3.7),代價是 AC 延後 0.1–0.2 年,而不是 1.1–1.6 年。與最佳運算資源削減時機相比,結果依預測者而異——以 Kokotajlo 的參數而言,優於在 AC 時削減;以 Lifland 的參數而言則較差。

**以上所有內容的利益衝突:**模型由作者自行開發(AI Futures Model),兩組參數分別來自一位作者(Lifland)和一位獲承認的審閱者(Kokotajlo)。提案的量化論據由提案者提出,使用提案者的先驗假設,在提案者的模擬器中生成。模型內部一致,但未經外部檢驗。

稽核員存取階梯#

這是 wiki 一直缺少的具體驗證設計。文章的分類章節列出稽核員存取權的五個逐級層次:

  1. 只能取得公開資訊。
  2. 可以提出一組高層次問題並取得答覆,或要求執行基準測試——範例:METR 的 Frontier Risk Report。
  3. 以員工層級存取公司系統——範例:METR 在 Anthropic 的存取權。「這讓稽核員可以取得公司可能基於 IP 顧慮而想保密的資訊。」
  4. 派駐公司內部,「而不只是例如取得一台公司配發的員工級筆記型電腦。」
  5. 直接稽核運算資源分配的能力,例如透過網路竊聽點。

作者特別指出第五級本身的代價,而非留給批評者提出:「如果執行方式天真,可能會損害相關公司 AI 系統使用者的隱私」——並列出三項技術性緩解措施。他們也說明這個階梯的定位:認為派駐稽核員(第四級)加上政府執法,在國內已經足夠;僅靠軟體的證明(TEE attestations、zero-knowledge proofs)「可能更穩健」;並主張以硬體為基礎的驗證,例如網路竊聽點,只有在國際情境下才有必要,因為對手是能實際接觸設備並觸及供應鏈的民族國家。相同分類中還包括另外兩個維度:由誰稽核(依「大學認證機構或船舶分類機構的核准方式」認證的獨立第三方、政府機關、其他公司的代表、公眾、吹哨者,以及 AI),以及指標作用於什麼。

與 Frontier Pause Verification 對照,後者追問驗證制度具體由哪些部分構成;這是本知識庫首個逐項列出選項的方案。它的結構性主張是降低了問題難度:只有條約才需要高難度的儀器設備,而國內制度只需配備筆記型電腦的稽核員和吹哨者法規。

觸發指標,以及它承襲的問題#

能力測量是選項 2 的回饋迴路——先測量,再「用這些測量結果調整運算資源分配最低比例」。提議的工具是 Epoch Capabilities Index (ECI),「但可能聚焦於 AI R&D 自動化等高風險能力」,並且「理想上納入一些私人基準測試,以降低可被操弄的程度」。執法時,稽核員必須對內部模型執行評估。

wiki 中最接近的現有工具是 AECI,也就是 Anthropic 從這個指標分支而出的版本,詳見 AI R&D Autonomy Evaluation (AECI)。將兩者並列後,可以提出本文未考慮的兩點質疑。

  • 此指標不夠穩定,無法支撐法定門檻。 Anthropic 揭露,每份系統卡都會在全球範圍重新擬合 ECI,因此隨著加入模型和基準測試,已發布的數值也會變動,而且「與先前 AECI 報告中的數值不完全相符」——wiki 記錄指出,AECI 明確不是跨系統卡的時間序列。以一個會因自身維護而改寫歷史數值的指標來調整運算資源最低比例,與以測量結果調整最低比例,是兩回事。
  • 里程碑門檻取決於預測者,而非客觀事實。 建模圖表以 ECI 為縱軸單位,並標出兩條水平線。從圖中讀取,依 Kokotajlo 的參數,Automated Coder 約為 192 ECI,依 Lifland 的參數則約為 208;超級智慧分別約為 253 和 304。 同一行為里程碑會因採用誰的先驗假設而差約 16 或 51 個指數點。任何寫明 ECI 數值的法規,都等於選擇某位預測者。

以尺度來看,文章內嵌的 Epoch 即時 ECI 圖表顯示,截至 2026 年年中,美國前沿約為 161–162,最佳中國模型約為 157,最佳歐盟模型約為 142——這些數字與 wiki 自己記錄的 AECI 讀數大致相同(Claude Opus 5 為 162.1,Claude Mythos 5 為 161.3)。因此,提案的實際運作範圍,從比今日前沿高約 30 個指數點,到高約 145 個點;而同一份文件預測,這段期間長度為兩到八年。

作者確實討論了規避問題,但只處理他們能處理的部分:公司可能會在 AI R&D 評估中刻意隱藏能力,以避免觸發更嚴格的分配要求;作者認為可以透過「將模型微調至 AI R&D 任務,再讓自動化 AI 稽核員審查所有 AI R&D,確認是否涉及為隱藏能力而訓練」等策略加以偵測。這正是 Evaluation Awareness & Grader Gaming 探討的問題,只是這裡附帶了監管誘因——它是本知識庫首個讓公司有法律理由刻意讓模型看起來較差的提案。

評議:首次部分打破既有模式#

本知識庫中前三項提案(Frontier AI Standards Body 2026-07-14、Cross-Lab Pre-Release Review 2026-07-29、Government Checkpoint Sharing 2026-08-10)完全沒有任何爭議解決機制。第四項提案部分打破了這種模式,而且這個突破的方向很有參考價值。

它明確規定的內容——比前三項加起來還多:

  • 具名裁決者、決策標準和證據規則的申訴途徑。 安全研究人員可以向第三方稽核員申訴,要求遮蔽資訊;稽核員受命確保能力進展公開,也能完整存取真實紀錄。
  • 評估者意見不一時的彙整規則——採用估計值的加權平均,且所有公司使用相同權重。
  • 稽核員本身的認證機制——類似認證機構和船舶分類機構。

它仍未明確規定的內容——與前三項相同的缺口:

  • 公司沒有管道對調查結果提出異議。 設計中的所有申訴,都由受監管方的研究人員針對自身保密需求提出,從未讓他們有機會挑戰判定。沒有程序可供公司爭議運算資源分配違規指控或風險評估結果。
  • 由誰設定評估者的權重,以及由誰判斷權重設定是否公平。
  • 由誰決定升級措施。 階梯的排序——包括「只選擇選項 2 或 3 其中之一」,以及安全研究最低比例從 5% 調升至 25%——只是對讀者的建議,並未授予任何人決策權。文件沒有指出誰是決策者,也未提供判準。
  • 假設存在權力,但未論證權力來源:「本文假設由美國政府執行節奏管理。」註腳則承認,公司之間協調或州政府執法「對其中一些提案也足夠」。

有趣之處在於作者的身分。 三項沒有裁決設計的提案,由將受裁決的實驗室執行長撰寫;唯一包含任何裁決設計的提案,則出自一個不會受裁決的預測與倡議組織。樣本數只有四,且只有一位非實驗室作者,因此證據力偏弱,但它與 Frontier AI Standards Body 提出的核心問題一致——這種缺漏可能反映作者身分,而非技術現況——也是本知識庫首次從實驗室外部取得支持該假設的資料點。四項提案共有的問題,比「完全沒有任何裁決機制」更具體、也更值得注意:本知識庫沒有任何提案讓受監管方有管道反駁對其不利的調查結果。

在整體治理版圖中的定位#

wiki 中其他所有機制,都作用於發布時或發布前的模型。此方案作用於輸入項目,並持續運作,完全不觸及發布決策——因此它有三項其他方案都沒有的特性。

  • 這是唯一在權重公開時仍能運作的設計。 發布前審查窗口,預設開發者能控制發布,也預設評估不會立刻過時(Open-Weight Elicitation Irreversibility);運算資源分配最低比例則限制公司接下來能建造什麼,不受已發布內容影響。選項 3 的內部與公開模型負向落差,會讓模型更早而非更晚公開,卻仍能放慢前沿發展。
  • 它以不同於 Government Checkpoint Sharing 的方式達成零發布延遲。 Zuckerberg 的設計透過不產生判定來達成零延遲;此方案則藉由監管與發布日期無關的數量達成——同時,與他的設計不同,仍保有徹底停止能力成長的權力(選項 1)。
  • 這是首個說明代價為何的提案。 運算資源分配架構存在的理由,正是節奏管理會釋出運算資源;設計的核心問題是公司會如何運用:在推論服務上賺取收入,還是資助安全研究。其他三項提案都未談及其提議措施的經濟效應。

與 Frontier Pause Verification 相較,這項分歧實質而且值得記錄。Anthropic Institute 主張,單邊暫停「會改變誰是領先者,但無法建立目前欠缺的更廣泛審議程序」,因此多邊驗證才是關鍵。本文作者在司法管轄區層級而非實驗室層級回應這項質疑,並提出量化估計:美國原始能力領先幅度估計為「約 4–8 個月」(資料來自 Epoch 的 ECI 國家檢視);但由於中國的進展「有很大一部分來自蒸餾美國前沿模型,並使用美國發現的演算法」,因此他們「估計如果美國停下來,中國大約一年就能追上」。他們還提出安全方面的反轉論點——美國實驗室「目前距離能抵禦民族國家行為者的穩健安全性還很遠」,因此「在放慢能力進展的同時,全力提升安全性,實際上可能讓美國在超人能力水準上拉開更大的領先幅度」。這是本知識庫首次量化回答「單邊克制難道不會把領先地位拱手讓人嗎?」;這些數字是提案者自己的估計。

相關連結#

  • Structured Safety Case (Claim Decomposition) — 強制要求的第三方風險評估者必須提出的文件:真實開發者的安全案例,內容始終採用定性描述,且自身評級可能因論證之外的理由修訂

  • Frontier Pause Verification — 本文刻意從多邊方案退回的另一端,也是最直接提供缺漏機制的來源:五級稽核員存取階梯首次具體回答「驗證制度由什麼構成」,並主張只有條約才需要高難度的硬體儀器設備。本文也反駁該頁的核心論點,透過量化的美國領先幅度(原始差距 4–8 個月,計入蒸餾與演算法竊取後約一年),在司法管轄區層級回應單邊暫停的質疑

  • Frontier AI Standards Body — 第四項提案對照第三項,也用來檢驗後者的核心發現。本文首次提出本知識庫中的裁決機制(具名裁決者與決策標準的遮蔽申訴管道;跨評估者採用相同權重的彙整規則),但仍未說明受監管公司如何反駁調查結果;四項提案中,這也是唯一不是由可能受裁決的一方撰寫的

  • Cross-Lab Pre-Release Review — 相同治理問題,但審查者與時機都不同:競爭者花 1–2 週審查完成的模型;而本提案由第三方稽核員持續派駐公司內部,稽核運算資源而非能力。Musk 擔心過度通報的問題在此並不適用,因為競爭對手從未持有判定權

  • Government Checkpoint Sharing — 另一項零發布延遲設計,但採取相反方向:前者沒有會延誤發布的判定;本方案監管與發布無關的數量,同時保留全面停止權力(選項 1)

  • Balance-of-Power Superintelligence — 將該頁的 RSI 運算資源分配規則化為實務操作,作者則是另一人。Zuckerberg 所說的「將絕大多數資源投入個人目標」與本提案所說的「至少 70% 用於外部推論」接近同一條規則;差別在於,本文明列比例、工具(ECI)和機制(以派駐稽核員為主,網路竊聽點作為上限),並以限制能力研發占比,而非擴大分母,來解決競爭困境

  • Recursive Self-Improvement — 選項 3 是本知識庫中唯一正面針對 RSI 機制介入,而不是處理其替代指標的方案:限制可用於 AI R&D 的模型落後 9 個月,目的是延後「AI 有能力破壞 AI 研究並讓下一個模型與自身對齊的時點」

  • Intelligence Explosion Dynamics — 以量化起飛長度回答成長曲線相關問題:在兩位預測者的中位數估計下,從 Automated Coder 到超級智慧全速前進需要 1.0 年和 2.6 年;運算資源削減後延長至 2.3–5.0 年,能力落差方案則延長至 2.4–4.1 年;此外,起飛期延長幅度呈非單調變化,在介入時間落在 Automated Coder 時達到高峰

  • Effective Compute Scaling — 本文所有比例的分母,以及這種設計採用比例而非絕對值的原因:有效運算資源每年成長約 10 倍,分配最低比例便能限制能力投資的速度,而不必指定 FLOP 數量

  • AI R&D Autonomy Evaluation (AECI) — 觸發指標,僅差一個分支。本文提議以 ECI 加上私人基準測試作為調整運算資源最低比例的依據;AECI 是 Anthropic 從同一指標分支出的版本,wiki 已記錄其數值會在每份系統卡中全球重新擬合,明確不是跨系統卡的時間序列——這項特性用於實驗室內部判斷尚可接受,卻不適合法定門檻

  • Responsible Scaling Policy Evaluations — 選項 4 相當於將 RSP 的安全案例移出開發者手中並加上數字:由第三方評估者量化預測風險並制定受監管上限;RSP 則採用開發者自己的定性判斷。註腳 7 指出現行作法的具體缺口:目前自願進行的第三方評估「沒有提出任何量化風險估計,而這是此制度要運作所必需的」

  • Open-Weight Elicitation Irreversibility — 說明輸入端限制在結構上為何不同於審查窗口:本知識庫的所有把關提案,都以固定的引導預算對模型進行安全評估;運算資源分配最低比例則限制接下來會建造什麼,不受已發布內容影響。選項 3 刻意讓公開發布先於內部 AI R&D 使用

  • Measuring Beyond Accuracy Saturation — 本月第二個以基準測試分數設定監管界線的提案,也是第二個以保留測試集或私人測試作為防規避措施,卻未考慮重新配置評估工具的提案。Hassabis 的 Body 會自行制定基準測試;本文則採用已發布的第三方指標,並加入「一些私人基準測試,以降低可被操弄的程度」

  • Evaluation Awareness & Grader Gaming — 帶有法律誘因的刻意隱藏能力:在此制度下,公司有法定理由讓模型在 AI R&D 評估中的分數降低;這是本知識庫首個讓低報能力有利可圖的案例

  • METR — 五級稽核員存取階梯中有兩級的範例(其 Frontier Risk Report 代表基準測試層級存取,其 Anthropic 合作代表員工層級存取);註腳 7 也指出,選項 4 所需的量化風險估計,目前仍缺少 METR 這個組織

  • Anthropic Institute — 對照議程:建立多邊驗證基礎設施;本提案則主張國內只需派駐稽核員與執法,硬體驗證屬於國際問題

  • Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It — 以七項必要特性檢驗 ECI 能否作為負有義務的測量指標,並指出本文通過自身觸發指標質疑的原因,而該原因未被本文明說:實際義務是運算資源占比和訓練日期,兩者都是可執行管理的事實;ECI 只作為調整既有最低比例的回饋訊號。選項 3 的 ECI 門檻替代方案則無法通過

  • Open Weights as Competitive Strategy — 對相同議題採取相反政策立場,也是本文作者必須回應的立場。本文所有選項都刻意放慢國內前沿發展;Ng 則主張國家面臨的主要風險是行動太慢,限制開放發布反而是自我傷害。值得注意的是,兩者有一項共同假設——政策作用的對象都是擴散,只是一方加以抑制,另一方加以促進

  • Embedded Evaluation — 本頁第四級(「派駐公司內部」)指向模型行為,而非運算資源分配。Transluce 在 2026 年 9 月提出的方案,為派駐評估者設定四個關注領域(群體、訓練實務、員工操縱、特權存取研究),但沒有本頁所列的存取條件或申訴管道

開放問題#

  • 不讀取使用者流量,能否驗證運算資源分配比例? 設計的最高階是網路竊聽點,作者承認這會危及使用者隱私;他們聲稱較低階的方式(派駐稽核員、吹哨者)在國內已足夠,卻沒有提出證據。TEE attestations 或 zero-knowledge proofs 能否在不暴露內容的情況下驗證分配比例,是整個制度所依賴的技術問題。
  • 有沒有節奏管理提案讓受監管方有管道反駁調查結果? 現在有四項提案明確規定由誰稽核;其中唯一包含申訴機制的提案,申訴方向是由公司研究人員針對自身保密需求提出,而非挑戰判定。觸發條件:任何作者提出包含公司方申訴機制的公開提案。

已解決問題#

  • 能力指標能否作為法定門檻? ECI 被提議用來調整運算資源最低比例,但 wiki 中與之最接近的版本(AECI)會在基準測試組合改變時全球重新擬合;同一行為里程碑在兩位預測者的參數下,對應的 ECI 數值相差約 16–51 點。指標必須具備什麼穩定性,義務才能以之為依據?已於 2026-08-17 由 Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It 回答:共有七項特性;依本文設定,ECI 有三項不合格。它不符合參照固定性(其維護者自己揭露會全球重新擬合——AI R&D Autonomy Evaluation (AECI));不符合可辯護的分數→義務映射,因為兩個前沿模型在統計上無法區分(Opus 5 為 162.1 [158.0–167.3],Mythos 5 為 161.3 [157.3–165.4]),而提議的里程碑比它們高約 30–47 點,兩位預測者的估值則相差約 16–51 點,因此雜訊相較於到達觸發門檻的距離不可忽略;也不符合雙向操弄抵抗力,因為這是本知識庫首個會獎勵低報能力的制度,而且 wiki 沒有任何基準測試經過配置以偵測這點;另一方面,評分者條件設定確實是一個可調旋鈕(CI 反事實測試將操弄比例從 77.4% 降至 0.0%,口頭表達的評估覺察為 0/101——Task Gaming)。固定性可以靠行政命令取得(凍結某個版本),但會犧牲區辨範圍,而飽和會摧毀這個範圍——這個治理案例已出現在 Responsible Scaling Policy Evaluations,其中 AI R&D 排除測試套件已飽和,因此不再用於門檻判定。不過此提案仍然成立,因為義務本身不是指標:運算資源分配最低比例是全部運算資源中的占比,9 個月落差方案首選的執行方式則依訓練日期判定;兩者都是可執行管理的事實,ECI 只充當定期回饋訊號,用來調整已生效的最低比例。無法成立的是選項 3 的可選 ECI 門檻版本。剩餘問題記錄於該頁,這裡不再重提:尚無人測試凍結且具版本標記的指標,能否在飽和耗盡區辨範圍前,於多年法定期間內有效追蹤能力使用情況。

資料來源#

  • How to pace the US frontier — Eli Lifland、Brendan Halstead、Romeo Dean、Thomas Larsen、Miles Kodama(AI Futures Project),How to pace the US frontier — Tentative proposals for domestic AI regulation,blog.aifutures.org,2026-08-05,約 48K 字元(practitioner-opinion——一份提案,全文沒有任何實測)。Route C 網頁文章;頁面日期已核實;WebFetch 漏掉的 9 個註腳另行找回,其中註腳 3、7 和 8 包含上文引用的關鍵內容。四項選項、運算資源分配數字、稽核員存取階梯和分類軸都出自作者。利益衝突的方向在此直接揭露,而非自行推論:AI Futures Project 是具公開立場的預測倡議組織(AI 2027、AI 2040: Plan A);建模採用其自有 AI Futures Model,兩組參數分別來自一位作者(Lifland)和一位獲承認的審閱者(Kokotajlo)——因此,提案的量化論據由提案者使用提案者的先驗假設生成。九張圖片均依兩階段規則檢視。 沒有 PDF、沒有 docling 解析,也沒有來源表格,因此不適用表格折疊、位移或 canary 檢查;本頁所有表格均由 wiki 根據圖表或文字建構。img-2 和 img-3 位元組完全相同(作者重複使用分配圖);原始內容的 img-3 替代文字描述了不同於圖片內容的圖示,已依圖片下方說明修正。每月 1% 的數字以及 AC/起飛日期,在本文中屬於 prediction 等級,所有出現處均在行文中標示來源。非單調的時機結果及 AC 加起飛期的算式,是根據圖例讀取並於此計算,不是作者陳述。ECI 里程碑數值(Automated Coder 約為 192/208,超級智慧約為 253/304)及今日前沿水準(約為 161–162)是從圖表座標軸讀取,應視為約數
§ end
Cited by 23
Related articles
  • Responsible Scaling Policy Evaluations

    Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…

  • Frontier AI Standards Body

    Hassabis's July 2026 proposal for a US-led, FINRA-modelled public-private standards body that tests Frontier-class mode…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Balance-of-Power Superintelligence

    Zuckerberg's thesis: distribution of personal superintelligence to individuals — not centralized control — is the safet…

  • Cross-Lab Pre-Release Review

    Musk's proposal that frontier labs get 1–2 weeks of competitor API access to test each other's models before release, w…