H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

靜默修訂率

Zhu 提出的語料衡量指標,用來量化前沿 AI 安全框架承諾中有多少實質變動,未在開發者自行發布的說明中揭露——嚴格解讀下有 67% 未揭露(95% CI 0.62–0.72),寬鬆解讀下為 53%,按章節粒度計算則為 49%,涵蓋 12 家開發者;弱化承諾被隱匿的頻率約為強化承諾的兩倍,而 TFAIA 與 EU GPAI Code of Practice 的修訂揭露義務都未能顯著降低此比率

Article metadata
Publication details
Published:September 24, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceAI PolicyTransparencyFrontier LabsMeasurement
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

靜默修訂率插圖

資料來源#

摘要#

每家主要前沿開發者都會發布安全框架(Responsible Scaling Policy、Preparedness Framework、Frontier Safety Framework 等),承諾評估並因應危險能力。EU 的 GPAI Code of Practice 和 California 的 TFAIA(SB 53)現在都對這些框架的修訂設下義務,但都未要求修訂必須清楚可辨——也就是讀者能從開發者自己的說明中得知改了什麼。Zhu(Oxford,arXiv 2609.08789)定義了靜默修訂率(SRR):框架承諾中屬於實質變動的部分,有多少未被開發者自行發布的說明(變更記錄、修訂標記稿或敘述式公告)指出。此指標應用於一份以雜湊值固定的語料,涵蓋 2024 Seoul Summit 之後曾發布安全框架版本的 12 家開發者所有公開版本;測得比率偏高(嚴格解讀下為三分之二),而且並非隨機(承諾放寬的修訂被隱匿的頻率約為收緊修訂的兩倍)。

語料與分析單位#

  • 12 家開發者:所有在 2024 AI Seoul Summit 後發布常設災難風險政策的開發者:Amazon、Anthropic、Cohere、G42、Google DeepMind、Magic、Meta、Microsoft、NVIDIA、Naver、OpenAI、xAI。不納入系統/模型卡(它們是某一時間點的文件,不是常設政策)。
  • 52 列清單(43 個框架版本+9 份配套文件),每份檔案都固定了雜湊值(SHA-256)並追蹤來源;35 份檔案來自供應商、14 份來自 Internet Archive、1 份來自有門檻的入口網站。9 份檔案在相同網址/版本標籤下遭靜默替換,文字已有變動,卻沒有新識別碼(「同標籤靜默重新上傳」),因此保留為獨立列。
  • 19 組連續標記版本配對,依揭露方式區分:修訂標記稿(5 組,皆為 Anthropic 自 v2.2 起的 RSP 修訂——完整標示差異的修訂稿,屬於「完整涵蓋該揭露方式」,因此依定義 SRR = 0,不納入追蹤);逐項變更記錄(6 組);敘述式公告(4 組);無(4 組,皆為 xAI——完全沒有任何形式的說明)。表 1 追蹤 12 組非修訂標記稿配對。
  • 分析單位:承諾——句子中以供應商為文法上的主詞,陳述某種強度介於 must 到 may 的做法(也包括現在式描述性陳述,論文稱為「常設承諾語域」)。若變動涉及範圍、門檻/觸發條件、行為者、義務強度、揭露範圍或後果,即屬於實質變動。
  • **編碼流程:**Claude 系列的代理系統依據凍結的編碼手冊(v0.2,於 2026-09-03 凍結)作為唯一指令,產生 710 列的初步編碼;每個引用欄位都對照語料文字查核(2,130 次檢查,只能確認引用忠實度)。接著論文作者逐一裁定 710 列中的 244 列(所有低信心列、所有受初步編碼後澄清影響的列,以及 50 列一致性抽樣),變更 4 個結果代碼與 54 個公告代碼——其中 46 列從「靜默」改為「部分公告」,也就是人工修正的方向反而不利於嚴格靜默的研究結果。對其餘 466 列抽查 45 列,又進一步更改一列。
  • **作者指出的信度缺口,也是論文最弱的一環:**提交時尚未完成 50 個單位的分層第二編碼者抽樣,因此尚未報告編碼者間一致性 Krippendorff's α。
  • SRR 以兩種方式報告:SRR_strict = (silent + partially announced) / material changes、SRR_lenient = silent / material changes。每個比率都附 Wilson 分數 95% CI(這是普查語料,不是抽樣調查)。

主要發現#

**RQ1——幅度。**在有任何修訂說明的 8 組追蹤配對中(排除 xAI 的 4 組完全無說明配對),383 項實質變動中有 257 項在嚴格解讀下未揭露——0.67(95% CI 0.62–0.72)——寬鬆解讀下則有 203 項未揭露——0.53(0.48–0.58)。每組有說明的配對,嚴格比率都高於 0.55。若改以章節粒度計算(99 個單位),嚴格比率降至 0.49(0.40–0.59),寬鬆比率則為 0.34——分母的選擇確實有影響,但無論採用哪種粒度,大部分變動仍未獲說明。供應商彙總比率介於 OpenAI 的 0.61 至 Microsoft 的 0.81。

**RQ2——形式,而非長度。**敘述式公告的靜默率為 0.74(0.66–0.81),逐項變更記錄則為 0.63(0.57–0.69)——在尊重配對內群聚的置換檢定中,差異有些許跡象(合併 p = 0.071,逐對平均 p = 0.089);忽略群聚、因而高估精確度的天真變動層級 Fisher 檢定則得到 p = 0.041。寬鬆解讀下差異消失(OR 1.19,p = 0.46),因此任何揭露方式的效果都完全來自部分公告。說明的文字長度與靜默幾乎沒有相關(ρ = −0.17);逐項發布內容的數量則有相關(ρ = −0.58)——降低靜默率的關鍵,是逐項列出個別變動,而非增加篇幅。

**RQ3——方向。**12 組配對中共有 299 項追蹤到的實質變動,其中 229 項弱化、移除或移位了承諾——0.77(0.72–0.81)——且 12 組中有 9 組以弱化為主。可見度與變動方向相關:在有說明的變動中,弱化項目的靜默率為 0.75(135/181),強化項目則為 0.50(25/50),勝算比為 2.93(Fisher 精確檢定 p = 0.002);移除承諾是最常靜默的結果(0.83)。此不對稱現象在 8 組有說明的配對中有 7 組成立(唯一例外是 Anthropic 最早的配對 RSP 1.0→2.0,該配對中強化項目反而更常被隱匿)。

兩種可能機制#

論文以兩種組織社會學解釋檢視結果,兩者所預測的方向不同:

  • Vaughan 的結構性保密(例行的專業分工,意味著知道變動意圖的人負責撰寫變更記錄,而不在其注意範圍內的內容便不會進入記錄)預測靜默程度不均,但無法解釋為何靜默會隨方向而變——這符合 RQ2 中揭露方式/形式的結果。
  • Meyer & Rowan/Brunsson 的組織脫鉤(組織向外界展示的正式結構與實際做法有所出入)確實預測方向性靜默,因為有利的變動值得展示,不利的變動則不值得——這符合 RQ3 的弱化不對稱現象。論文沒有推斷背後意圖(撰寫變更記錄的人可能只是更願意為新增工具背書),但指出,就變動方向而言,資料符合脫鉤的解釋。

語料中 Anthropic 自身的紀錄#

  • RSP 1.0 → 2.0(逐項列出):76 項實質變動,SRR 嚴格值 0.57/寬鬆值 0.50。
  • RSP 2.2 → 3.0(敘述式)——這是 Anthropic 最大的一次修訂,也是自 2.2 以來唯一沒有採用修訂標記稿的 RSP 修訂,儘管其他五次都有採用:86 項實質變動,嚴格值 0.73/寬鬆值 0.59——即使採寬鬆解讀,86 項中仍有 51 項完全未揭露。說明花了不少篇幅解釋為何移除單方面暫停承諾,卻沒有逐項列出變動。論文追蹤了其中未逐項列明的變動(附錄 F):移除無法滿足安全防護要求時刪除模型權重的承諾,以及將模型能力超出已落實防護措施時暫停訓練的承諾,改為承諾「迅速採取行動以降低過渡期間的風險」。Anthropic 是否採用修訂標記稿,本身就是一項自行選擇:論文的可辨識度分類中最高一級(修訂標記稿)依定義得分為 0,而開發者自行決定哪些修訂採用這種形式。
  • Anthropic 的Frontier Compliance Framework(FCF)——一份配套文件——在四個版本間(2025 年 12 月至 2026 年 7 月)都有逐項變更記錄,並明文承諾在 30 天內提供變更記錄及理由,措辭幾乎逐字沿用 TFAIA 的法條。但FCF 早期的三份文本已從託管入口網站撤下,所以讀者能看見 Anthropic 表示改了什麼,卻無法對照已撤下的原始文件查證。
  • 同一研究結果中的另兩個具名例子:OpenAI 的 Preparedness Framework Beta→2 配對移除了「持續提供外部研究與政府存取」的承諾,其 12 項變更記錄中完全未提及。DeepMind 的 FSF 2.0→3.0 將研發門檻從量化基準(「相較 2020–2024 年速度大幅加快(例如 2 倍)」)改為質化基準(「相較歷史速度大幅加快」),但配套公告僅稱能力層級經過「微調」。

監管缺口#

TFAIA(2026-01-01 生效)和 EU GPAI Code of Practice 都已規定修訂揭露義務——但要求的是說明理由(框架為何改變),而非逐項列明(逐一列出承諾改了什麼、變動方向為何);只有後者可以稽核。以說明理由為主的敘述式說明,在語料中是可辨識度最低的形式(0.74 靜默率,相較逐項記錄的 0.63)。依 TFAIA 生效日期拆分追蹤配對後,看不出有測得改善:生效前完成的 3 組配對嚴格比率為 0.61(90/147);生效後完成的 5 組為 0.71(167/236);弱化項目的占比幾乎不變(0.78 對 0.76)。每邊只有三組配對,無法據此作因果推論,但這是語料中唯一針對該法規揭露效果的事後觀察,而且結果朝相反方向發展。論文提出的建議是:發布義務應包含逐項列明的義務——修訂標記稿可自動滿足要求,而 Anthropic 的 FCF 是最接近的先例(但屬自願且不完整)。

本頁保留的限制#

  • 尚未報告編碼者間信度(提交時第二編碼者樣本尚未完成);裁定與抽查數據(0.6% 的結果代碼、7.6% 的公告代碼有所變動)只能作為較弱的指標。
  • 初步編碼者的抽樣參數尚未固定——作者仍需以不同種子重新執行。
  • 修訂標記稿依定義得分為 0,這在一定程度上是循環論證(有標記的差異稿會呈現所有文字變動,卻不會指出哪些變動具有實質性,也不會指出它們的方向),而且只有 Anthropic 會採用修訂標記稿——因此,8 組有說明的配對無法區分 RQ2 的揭露方式效果究竟有多少來自選擇效應、多少來自形式本身。
  • 沒有比較基準:論文無法判斷約三分之二的靜默率,相較其他受監管的揭露領域(隱私政策、財務申報)是否偏高。
  • 單一作者的論文;編碼手冊設計者同時也是主要裁定者。裁定方向與論文自己的主要發現相反,加上語料、編碼手冊、編碼表及腳本都已完整公開(CC BY 4.0/MIT,GitHub),在一定程度上降低了這項疑慮。

表格解析說明#

verify 匯入檢查在表 1 和附錄表格標記了 table-collapse/table-weld。表 1(「十二組追蹤配對」)已完成核對且內容完整:12 列都包含 11 個已填欄位,Mat. = W + A 與納入 S 的統計相符,每列皆符合 ANN + ANN-P + SIL = Mat.,各配對的嚴格/寬鬆比率也與上文引用的附錄 D 文字區間完全吻合——屬於誤報。附錄 N 的表 10(52 列語料清單)確實有錯誤——供應商列在表格中被焊接在一起(例如兩列相鄰的 Naver 資料被合併為橫跨兩個版本標籤的單一「Naver Naver」儲存格;「OpenAI OpenAI」亦同;數列 xAI 資料則被拆開並移入錯誤欄位)——已直接檢查原始 Markdown 確認。本頁沒有任何數字取自表 10 的單一資料列;以上 12 家開發者名單只根據仍可辨識的 Provider 欄位名稱整理,並與第 1–3 節文字所述的開發者數量交叉核對。

延伸閱讀#

  • Responsible Scaling Policy Evaluations — 此衡量指標兩度應用的框架:RSP 1.0→2.0(0.57/0.50)及 RSP 2.2→3.0(0.73/0.59;即使採寬鬆解讀仍有 51/86 項未揭露)——後者正是刪除權重承諾,並將暫停訓練承諾改為「迅速採取行動」,但 Anthropic 自身說明未逐項列明的同一修訂
  • Frontier Pause Verification — 暫停承諾若以外部查證機制為條件,是「自我管理式治理」的一種失效模式;靜默修訂率則衡量另一種更早發生的失效模式——在任何暫停承諾接受檢驗之前,開發者對自身現有框架修訂所做的說明就已不可靠
  • Safety Commitments That Cannot Bind the Actor Who States Them — 為該頁的主張提供直接實證依據:「此語料記錄的每種以安全為目的的機制,都由其所限制的一方管理」;這篇論文橫跨 12 家而非一家開發者進行衡量,發現管理機制的一方對機制變動方式的說明,對多數實質變動都保持靜默,且對削弱機制的變動尤其如此

開放問題#

  • 提交時尚未完成編碼者間信度分析(50 個單位的分層樣本之 Krippendorff's α)——獨立第二位編碼者能否確認約 0.67/0.53 的嚴格/寬鬆比率,還是報告信度後比率會有所變動?
  • 論文發現 TFAIA 生效後未測得靜默率下降(生效前 3 組配對,生效後 5 組)——若執法行動或 EU AI Office 指引實際要求逐項列明,而非只要求說明理由,靜默率是否會下降?觸發條件:TFAIA 執法行動,或開發者明顯依逐項列明義務重新編排其變更記錄。
  • 論文指出,語料沒有比較基準可判斷約三分之二的靜默率是否偏高。弱化比強化更常遭靜默的現象,是否也會在其他受監管的企業揭露領域重現(例如隱私政策修訂,如 Amos 等人一百萬份文件研究——本文最接近的方法學先例——所探討的情況)?

資料來源#

  • Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers — Louis Yiven Zhu(Oxford),arXiv 2609.08789,2026-09-08,empirical,27 頁 docling 解析(10 張表、3 張圖片)。目前由 NeurIPS 2026 的 AI & Science workshop(AISciK)審查。初步承諾編碼由 Claude 系列代理系統依據論文凍結的編碼手冊產生;作者進行裁定,並依致謝聲明承擔責任。解析說明:verify 匯入檢查在表 1 和附錄表格標記了 table-collapse/table-weld。表 1(「十二組追蹤配對」)已與文中敘述(附錄 D 各配對區間、第 5 節主要數字)核對,確認完整——屬於誤報。附錄 N 的表 10(52 列語料清單)經直接檢查,確實有資料焊接/移位問題(供應商列合併、拆分至不同欄位),因此本文不引用其個別列;僅使用仍可辨識的 Provider 欄位名稱確認 12 家開發者名單。本頁所有數字皆依編譯器提示中的表格引用規則,取自正文敘述,未取自個別表格列。
§ end
Cited by 4
Related articles
  • AGI-to-ASI Pathways

    DeepMind's four non-exclusive, parallel technological routes from human-level AGI to superintelligence — scaling, algor…

  • Cross-Lab Pre-Release Review

    Musk's proposal that frontier labs get 1–2 weeks of competitor API access to test each other's models before release, w…

  • Domestic Frontier Pacing

    AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…

  • Frontier AI Standards Body

    Hassabis's July 2026 proposal for a US-led, FINRA-modelled public-private standards body that tests Frontier-class mode…

  • Government Checkpoint Sharing

    Zuckerberg's August 2026 proposal that frontier labs hand governments intermediate training checkpoints plus technical…