H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translatedENHOWARDISM

Discovery Certification Protocol (DCP)

CMU 對 AI 研究代理程式主張進行的結果層級稽核:Gate 1 確認經封存的效用增益;Gate 2 將已登記的背景資料與擷取到的 Web 位元組提供給全新的配對挑戰者(不提供目標執行過程自身的研究歷史),並將容許範圍內的任何有效路徑視為否決見證;若零次恢復,則給出有限樣本恢復機率界限;選擇性的 Gate 3 從共用檢查點出發,隨機採用真實或配對中性的回饋政策。兩項受控稽核(SQLite 查詢最佳化、虛擬催化劑控制)都得到 0/96 次恢復(上界 0.0468)及 Core+Evidence 判定

Article metadata
Publication details
Published:September 24, 2026
Filed:Concept
Domain:Evals & Benchmarks
Tags:Evaluation MethodologyAI RdBenchmark ValidityResearch AgentsContamination Adjacent
Reading:10 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Discovery Certification Protocol (DCP) 插圖

資料來源#

摘要#

DCP(Ning、Zhong、Li 與 Zeng,CMU,arXiv 2609.09219,empirical)是一套稽核流程,將「我們的 AI 研究代理程式找到有用結果」這類主張,轉化成針對單一數值結果、可分別檢驗的三個問題,而不是一個基準分數:

  1. Gate 1 — 結果真的有用嗎? 封存評估會檢查代理程式的最終輸出 A* 是否至少比基準 b 高出已登記的最低增益 δ_min,並採用信賴下界檢定。
  2. Gate 2 — 不依賴目標執行過程的私人研究軌跡,能否重新找回結果? 全新的配對挑戰者代理程式會取得相同背景資料 K、相同初始觀察 E0,以及目標執行過程實際觀察到的每個 Web 位元組(W_obs),但不會取得目標執行過程的假設、實驗結果或推理軌跡(L*)。如果挑戰者產生的任何有效方法得分都在目標結果的已登記容許差距 ε 之內,這就是一個恢復見證,會直接否決認證(Core 遭到推翻),無論這種情況多罕見。如果在 n 個獨立回合中,沒有任何挑戰者恢復結果,DCP 會報告真實恢復機率的有限樣本上界:p_upper = 1 - α^(1/n)。
  3. Gate 3(選擇性)— 真實回饋確實有幫助嗎? 從共用的凍結檢查點出發,配對的全新分支會取得真實實驗觀察,或取得欄位結構與時序相符、但隱去實際資訊的中性政策。估計目標是真實回饋相較中性回饋對結果效用的平均影響,並以獨立的虛無研究校準,確認中性通道沒有暗中提供資訊。

Core = Gate 1 通過 + Gate 2 零次合格恢復 + 控制組充分 + p_upper ≤ ρ。Evidence = Core + Gate 3 回饋效果的信賴下界高於已登記且高於虛無校準範圍的門檻。登記失敗或控制組薄弱會判為稽核未完成;Gate 2 出現合格恢復則判為已恢復(Core 遭否決),不受 Gate 1 或 Gate 3 結果影響。

Gate 2 為何比表面看起來更重要#

Gate 2 是一項允許任何有效路徑達成相同數值結果的重新發現測試,而非針對目標實作方式做消融。挑戰者可以重新組合已知元件、將其他領域的技術移植過來,或編寫完全不同的程式;唯一的判準,是在已登記的有效性檢查下是否達到分數門檻。這正是 DCP 自己的背包校準案例直接檢驗的設計:某個配對挑戰者回合產生兩種不同的合法解法(0.9363、0.9356),兩者都高於恢復門檻(0.9329),其中一個甚至高於目標執行過程本身;這便是合格的恢復見證,僅憑共用數值規則就觸發 Core 否決,完全不必比較兩種解法是如何得出的。

E0/L* 的界線就是整套機制的核心:執行一開始就存在的觀察屬於 E0(挑戰者可以使用);目標代理程式選擇執行實驗後才取得的測量結果則屬於 L*(不提供給挑戰者)。這是「如果沒有產生結果的特定研究軌跡,只憑公開資訊和一般能力,是否仍會找到這個結果」的正式、可執行版本——也就是先前文獻/重新發現問題。本知識庫在 Autonomous Scientific Discovery 條目中將此列為尚待解決的問題,當時還沒有可用來回答的工具。

兩項受控稽核,依據論文敘述核對(而非表 2 的儲存格)#

表 2(原始論文第 9 頁)的數個儲存格各包含兩個數值——Main, baseline 和 Gate 2 欄都以有序配對呈現(例如 0.8855, 0 和 0/96, best 0.6734)。匯入驗證將此標記為 table-collapse。確認為誤報:這是論文本身每格兩個數值的設計,不是 docling 合併儲存格;每一組數值都與附錄 C 的敘述完全一致(§C.1–C.4),逐格吻合。依照解析警告慣例,稽核數字引用敘述而非表格列:

  • SQLite-Web(DeepSeek-v4-flash,§C.1)。 主要分數 0.8855470,基準 0,恢復門檻 0.8805470。全部 96 個挑戰者回合都有效且確認未恢復結果,得分介於 0.0368978 和 0.6733847 之間。零命中上界:1 − 0.01^(1/96) = 0.0468381。全部 45 個正控制組都成功(召回率下界 0.8889268)。Gate 1 要求 δ_min = 0.5;計畫相較於無索引基準,將依流量加權的 SQLite VM 工作量降低 88.55%,這就是此處認證的有用改進主張。
  • 虛擬催化劑控制(DeepSeek-v4-pro,§C.2)。 主要分數 1.0(在 256 個封存條件下命中全部五個隱藏最佳控制等級),基準 0.5989989,恢復門檻 0.95。全部 96 個回合都是有效且確認未恢復結果,最高分 0.814649。相同的零命中上界 0.0468381(兩項稽核都使用 α_recovery = 0.01、ρ = 0.05,並登記 96 個回合;§A.3 要求每組至少 90 個回合,依據公式 n ≥ ⌈log(α)/log(1-ρ)⌉)。
  • 兩項稽核的 Gate 3。 30 組目標回饋研究得到 30/30 真實回饋恢復、0/30 中性回饋恢復,配對精確 99% CI 為 [0.6379, 1.0]。另行進行的 60 組虛無研究——比較中性通道與第二個獨立、無方向性的通道,以檢查中性政策本身是否洩漏資訊——發現每一組中兩個實驗組的成功情形都相同:差異 0,99% CI 為 [−0.0950, 0.0950],落在已登記的 ±0.17 等效範圍內。這是兩項不同的研究,不是「60 組中 30/0」這個數字:30 組目標研究提供 30/0 的真實對中性恢復計數;60 組研究則校準中性通道本身,回報的是零差異,而非恢復次數。差距計算(LCB(Δ) ≥ δ_evidence + δ_sham → 0.6379 − 0.17 = 0.4679 > 0.34)使兩項稽核都從 Core 升級為 Core + Evidence。
  • 成本。 507 個工作階段 / $61.17(SQLite-Web);催化劑稽核共 419 個確認性工作階段、總計 435 個工作階段 / $56.40(確認性研究加開發)。

校準案例(§4.4,表 2)#

  • 裝置校準 — 受控資訊缺失案例(24 個隱藏二元增益,預先提供 4 個):0/80 次恢復,上界 0.0477,全部 60 個正控制組通過 → 僅達 Core(未執行 Gate 3)。
  • 多維背包 — 證明恢復機制能檢出正例:兩個合格見證高於恢復門檻 → 開發階段(恢復)遭推翻,也就是依設計由 Core 否決,保留作為「規則確實能抓到東西」的控制案例。
  • 仿射奇偶性(附錄 C.6)— 兩個回合、兩組目標配對、兩組虛無配對;正控制組的召回率下界僅 0.0707 → 在控制組充分性關卡判為稽核未完成,儘管觀察到 1.0 的回饋差異。這顯示充分性關卡確實發揮作用,而不只是恢復關卡。

威脅模型:主張者才是對手,不只是模型#

DCP 的附錄 B 將證據產生者視為可能採取策略性行動——稽核的目的,是防止實驗室誇大自家代理程式的成果,而不是測試代理程式的安全性。這套機制包括結果出爐前先登記(任務、模型、預算、有效性規則、停止規則都必須在執行前固定)、完整的嘗試紀錄(每次逾時、無效輸出及基礎設施故障都保留在紀錄中)、對基準/目標/控制組使用同一個對稱評估器,以及逐位元組記錄模型看過的每一個 Web 回應。這與 Evaluation Awareness & Grader Gaming 指出模型行為層面缺少的反作弊機制相同,但往上一層,套用在實驗室對外發布的代理程式成果主張上。

論文未涵蓋的範圍#

兩項完整稽核都是在封存數值分數下進行的軟體/工程最佳化任務(SQLite 查詢規劃、虛擬化學程序控制模擬器),由四人 CMU 團隊以 DeepSeek-v4-flash/pro 作為受稽核與挑戰者代理程式執行;它們並非開放式科學假設主張,也不是 Anthropic 或其他前沿實驗室對自身 AI 研發的評估,目前也尚未套用到濕實驗室或文獻式發現主張。恢復稽核的設計可以推廣(論文明確指出:「相同的結果稽核適用於程式、模型、資料產品和實驗配方」),但本文所引資料中沒有任何實際案例如此運用。

相關條目#

  • Autonomous Scientific Discovery — 為該條目的既有未解問題(「任何 AI 生成假設的主張能否通過獨立、預先註冊的先前技術搜尋?」)提供可執行的工具;不過此處僅展示於封存分數的工程最佳化,並未用於開放式假設生成——範圍差距請見該條目的 Open Questions
  • AI R&D Autonomy Evaluation (AECI) — 針對 CoBench 和顯示性偏好論證所探討的同一廣泛問題,提供另一種防止誇大主張的工具:一項 AI 研究成果究竟反映了代理程式的真實能力,還是能從公開資訊和一般能力中重新取得。CoBench 問「模型能否診斷根本原因」;DCP 問「沒有目標執行過程的私人軌跡時,全新的配對代理程式能否獨立得到相同數字」
  • Benchmark Contamination and Decontamination — 防止誇大主張的邏輯相同,但洩漏途徑不同:該條目的方法用統計線索或行為探測,檢查基準答案是否洩漏到訓練資料(或沙箱);DCP 的 Gate 2 則透過即時重新發現回合,而非語料檢查,偵測研究結果是否僅憑公開資訊和既有能力就能取得
  • Evaluation Awareness & Grader Gaming — DCP 的登記、封存評估、完整紀錄及獨立驗證器,對應該條目在模型行為層面所關注的反作弊問題,作用於主張產生者層級

尚待解答的問題#

  • DCP 式的恢復稽核是否曾用於開放式科學假設主張(例如 Anthropic 約 80% 的盲測假設偏好結果,或 Co-Scientist 式建議),而非封存分數的工程最佳化任務?這正是 Gate 2 正式檢驗的範圍,與 Autonomous Scientific Discovery 的先前技術問題真正關心的範圍之間的差距。
  • 隨著挑戰者預算增加,零命中恢復上界是否仍成立?也就是說,增加 Gate 2 挑戰者的回合數、使用更強的 harness,或改用能力更強的模型,是否會讓 p_upper 往「零次恢復變成正比率」的方向變化?這和 AI R&D Autonomy Evaluation (AECI) 的 CoBench 分數在 3 倍 token 預算下幾乎不動,但「harness effort... could produce significant further gains」的情形相似嗎?

資料來源#

  • Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents — Jingjie Ning、Shanshan Zhong、Xiaochuan Li、Ji Zeng(Carnegie Mellon University),Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents,arXiv 2609.09219,2026-09-07,17 頁,empirical。已閱讀全文;§3(流程定義)、§4(兩項完整稽核與三個校準案例)、§5(結果)、附錄 A(統計決策細節與 n ≥ ⌈log(α)/log(1-ρ)⌉ 公式)、附錄 B(威脅模型與稽核有效性)、附錄 C(各案例的數值細節,此處優先採用,而非表 2)。解析註記:匯入驗證對表 2 發出 warn,指出有 table-collapse——確認為誤報;被標記的儲存格是論文本身每格兩個數值的設計(Main, baseline 與 Gate 2 的計數/最佳值配對),已逐一對照附錄 C 的敘述,確認兩項完整稽核都完全相符。原始資料中沒有其他表格(docling 回報 2 個)。共有五張圖,但沒有任何圖表提供本文使用、且敘述中未出現的重要數值(圖 1–4 說明關卡結構和判定圖;本文未依據任何圖表引用數值)
§ end
Cited by 5
Related articles