資料來源#
摘要#
這個資料集中的每次基準測試執行,都使用固定抽樣預算:N 個項目,每個重複 K 次,不論模型每次都答對或只是猜硬幣正反面,每個項目都使用相同的 K。Toby D. Pilditch(UK AI Security Institute、arXiv 2608.14425,2026-08-14,32 頁,empirical)提出統計學家首先會問、而評估文獻中沒有人曾針對評估資料收集提出的問題:**評估何時已收集足夠資料?**答案是一個 Python 套件 optstop:它會隨著執行進度擬合階層式 Bayesian 模型,並在項目的後驗可信區間夠窄時,立即淘汰該項目,或整個模型-任務分組。
核心結果是:在 3x3 驗證矩陣中(三種分數類型 x 三種效能水準,每個單元 200 個項目 x 10 個 epoch = 計畫 2,000 次試驗,seed 42,delta = 0.05,97% 可信區間),它減少 57.2% 至 97.3% 的計畫試驗,平均 81.1%;在正規化 [0,1] 尺度上的平均絕對分數偏差為 0.006,截斷效應合併值為 +0.0003(97% HDI [-0.002, +0.003]),落在 +/-0.02 的 ROPE 內——對截斷是否造成分數偏誤這個問題,結論是接受虛無假設。
這個數字每次出現在本 wiki 都必須附帶三項限定,而且它們的重要性足以讓這個數字絕不可單獨引用:
- **這是作者自己的工具,由作者自己的機構在單一實驗設定下驗證。**論文如此說明:「目前的驗證……代表單一實驗設定。」
- **效率是評估設計的特性,不是方法本身的特性。**同一框架在較精簡的 100 個項目 x 5 個 epoch 設計、相同 delta = 0.05 下,節省 59.5%,而非 81%(表 4)。論文明確指出:「較精簡的設定(較少項目或 epoch)必然較少有提前終止的空間。」
- **標題結果沒有啟用安全機制。**用來防止觀察到罕見成功前就停止的非對稱保守調整,在 3x3 矩陣中從未啟動——即使最低的單元也有
p-hat ~ 0.05,高於啟動門檻 1%。它的行為是在合成資料上另外驗證的。
重新定位:評估是序列測量問題#
這個重新定位是本文的貢獻,而且表述得很清楚。評估資料是階層式巢狀結構——回應隸屬於項目、項目隸屬於模型-任務分組、分組隸屬於能力領域——而整體效能呈現鋸齒狀:有些模型-任務配對在三次觀察後就趨於穩定,另一些觀察五十次後仍在變動。統一抽樣制度對兩者花費相同。因此,停止問題「化約為資源配置問題:如何最大化下一次觀察的預期資訊增益。」
其脈絡源自 Wald 的序列分析(1945),採用此方法的依據是停止規則原理:由於 Bayesian 後驗只取決於似然與先驗,無論由什麼規則決定何時停止收集,推論都有效。這就是此方法採用 Bayesian 而非帶有 alpha-spending 的頻率學派序列檢定的原因——反覆查看資料不需要付出多重性懲罰。
在序列分析中,論文區分了兩類停止規則,本 wiki 應保留這項區分,因為它能清楚區分兩個都談「停止」的頁面:
- 以推論為基礎的規則:當證據足以在假設之間作出判斷時停止(Bayes factor 超過門檻,或後驗機率跨越決策邊界)。用於確認性分析。
- 以精確度為基礎的規則:當估計值夠準確時停止——可信區間窄於門檻。用於描述性分析,適合回答「這個模型在任務 X 上的表現如何?」
optstop 明確屬於第二類。VRR-Stop 則屬於第一類,應用於生產流程,而非測量。
論文也明確指出,這不是分析框架的搭配工具:AISI 自己的 HiBayES 在資料收集後回答這些資料告訴我們什麼?;optstop 回答的是邏輯上先一步的問題:何時可以停止收集?
機制如何運作,依觸發順序排列#
**兩項準則。**主要準則是區間寬度:以 W = theta_U - theta_L 表示 (1 - alpha) 可信區間的寬度,當 W < delta 時停止。提供兩個門檻——delta_item 控制單一提示會取得多少個 epoch,delta_cap 控制整個模型-任務分組何時完成,並略過其餘項目。delta = 0.05 的意思是,在預設 97% 可信度下,精確到 +/-2.5 個百分點(選用這個預設值,是因為區間比常見的頻率學派 95% 更寬,又不必承擔 99% 的成本)。
次要準則是穩定化,用來處理達到寬度目標需要不切實際的觀察次數時的情況:對最後 k 個區間寬度擬合線性迴歸,當斜率接近零,且沒有朝下降速度變陡的方向趨勢時,就判定已穩定(這項防護能避免把暫時停滯當成穩定);而且至少要累積四個斜率估計值。這項準則以三種效能水準 x 三個門檻,在合成資料上獨立驗證:九種條件全部透過穩定化停止,效率為 75-81%,不受 delta 影響——對 delta 不敏感,證明此準則真正依據斜率,而不是偽裝成斜率準則的寬度準則。
兩個層級,部分池化。項目層級推論以單一提示的 epochs 為基礎;分組層級推論則以項目摘要擬合階層模型,將觀察稀疏的項目向母體平均值收縮。池化不是裝飾——在自適應停止下,項目樣本數會刻意不均(簡單項目提早終止,困難項目累積更多觀察),而這正是完全池化與不池化都會失效的情況。分組由使用者定義(模型 x 任務、模型 x 任務 x 難度,或依標籤分組),每組有自己的推論狀態;建議採用涵蓋所有可能影響效能之操弄因素的因子設計。分組越細,越能辨識異質性,但收斂越慢;分組越粗,收斂越快,卻會掩蓋異質性。
這套機制所形成的級聯流程才是重點:項目準則最先觸發,分組準則則隨著項目資料累積而觸發,計算資源集中到會變動的項目,以及內部意見不一致的分組。
值得記住的發現:二元評分成本最高#
三條推論路徑由設定決定,而非由觀察資料決定(必須宣告序位與連續任務,否則一律預設為二元):
| 路徑 | 項目模型 | 分組模型 | 估計目標 |
|---|---|---|---|
| 二元 | 自適應 Beta、依資料調整的先驗 | logit-normal 階層模型 | 母體平均成功機率 |
| 序位 | 對眾數類別做 Bayesian bootstrap | 階層式有序 logistic(累積連結),以 Dirichlet-Multinomial 作為備援 | 項目平均分布的眾數類別 |
| 有界連續 | 透過動差法估計 Beta | 對項目層級平均值採用 logit-normal 階層模型 | 項目層級平均值的母體平均數 |
各路徑的效率差異明顯:連續 95.1%(93-97%)、序位 75.0%(57-92%)、二元 73.3%(59-84%)。機制在於資訊密度——二元結果最多帶有 1 bit 資訊,序位類別更多,實數分數則更多,因此每個連續觀察能更大幅收縮後驗分布。
論文將此轉化為設計建議,也是全文最容易應用到其他情境的一點:**「考量效率而設計評估的實務工作者,若評估任務允許,應優先選用連續或序位評分規準,而非二元通過/失敗評分。」**這與該領域的直覺相反:該領域將二元精確匹配視為乾淨的評分方式,並把評分規準當成妥協。就抽樣成本而言,順序正好相反,而且試驗數量也清楚呈現差距:連續單元只需 **54-142 次試驗(總計 2,000 次)**就停止;二元單元則需要 318 次與 815 次。
第二層模式是極端值效應:每條路徑中,接近下限與接近上限的單元都比中間範圍的單元更早停止,因為中間分數會使每個項目的變異數最大。換個角度說,也更容易記住:自適應停止恰好在基準測試最無法告訴你資訊時節省最多成本;在真正能區分表現的中間區段,成本反而最高。
保守性:讓罕見成功仍可被發現的非對稱設計#
任何能力評估的提前停止規則,都有一種明顯的失效模式:一個成功率為 1% 的模型,在連續失敗多次後看起來就和完全無法完成任務的模型一模一樣——但在 pass@k 範式下,這是本質上不同的發現。後驗若集中在零附近,可能會很精確,卻可能在唯一重要的方向上出錯。
補救方式刻意採取單向調整。當估計效能低於 low_performance_threshold(預設 1%)時,會先將有效區間寬度乘上保守因子 c(預設 5)再進行比較;穩定化斜率門檻則除以同一個 c;項目層級的自適應先驗衰減速度也放慢五倍。高效能不會得到相同處理:「成功率 99% 的模型所需觀察次數少於成功率 1% 的模型,就足以建立可信的特性描述。」能力偵測與能力測量的推論需求不同,這項規則將差異編碼其中。
獨立敏感度研究(合成二元資料,200 個項目 x 10 個 epoch,四種校準效能水準,c 分別為 {1, 5, 10, 50})提供證據,顯示預設值並非任意選定。在真實效能 1%(實現值 0.0065)時:c = 1 在 120 次試驗後停止,theta-hat = 0.027,高估四倍;c = 5 延後至 910 次試驗,theta-hat = 0.008;c = 10 與 c = 50 則消耗 1,590-1,920 次試驗,只換得些微改善。效能 >= 10% 時,依設計 c 不會產生影響。這兩個參數彼此耦合——有效目標為 delta/c,因此預設值(c = 5、delta = 0.05)代表真正的精確度目標是 0.01,必須確保它在預算內仍可達成。
同一研究也記錄了一個值得坦承的細節:當寬度路徑變得無法達成時,停止流程會落到隨機性的穩定化路徑,而該路徑的試驗數量對 c 不呈單調變化(在相同資料上重複執行 MCMC 時,c = 50 的變異係數最高達 13%;效能為 1% 時,五個資料種子中只有兩個呈單調變化)。
驗證支持哪些結論,又不能支持哪些結論#
**等效性檢定做得恰當。**每個單元都以影子模式執行——即使內部追蹤停止準則,仍會執行全部 2,000 次試驗——因此比較的是同一份資料的完整執行與截斷執行,排除了不同執行之間的 LLM 隨機性。分析 A 依項目身分配對各項目的 epoch 平均分數,並對差值擬合常態模型;以 ROPE 檢定 94% HDI。九個單元中有六個接受,三個結果未定(低二元、中二元、高序位),沒有單元拒絕。階層式隨機效應統合分析合併九個單元後,透過收縮解決了三個未定結果;單元間異質性 tau-hat = 0.001,並在四種設定下檢查先驗敏感度。
未定結果提供了資訊,不值得尷尬;論文也正確解讀了它們:兩個二元單元的項目標準差為 0.135 與 0.136,相較於 +/-0.02 的 ROPE 都很大——再一次印證 1-bit 的問題,而不是截斷問題;在符合框架自身 delta 的 +/-0.05 ROPE 下,兩者都能接受。高序位單元則不同,值得特別指出:mu_diff ~ -0.059,94% HDI [-0.114, -0.001],原因是真正的估計目標不一致——序位路徑依據眾數類別停止,分析 A 卻評估平均分數。論文提醒,評估者可以合理地回報平均值,同時讓停止規則追蹤眾數,「但在報告中不應混淆兩者。」
排名保持不變。在 WritingBench 的三個 max_tokens 水準(50 / 500 / 5,000)中,完整與截斷條件的排名順序都一致,且 94% HDI 互不重疊——但分析 B 的完整執行有序 logistic 模型發生嚴重收斂失敗(8,000 次抽樣中 7,982 次發散,R-hat 最高達 1.14,bulk ESS 最低僅 23),論文承認這使絕對估計值無法解讀;支持該主張的是乾淨的連續型複驗(分析 C)。
它未能證明的事項,取自論文自身的限制與附錄:
- 寬度保證不等於涵蓋率保證,論文兩度如此說明。準則設定的是區間寬度;區間的位置則取決於資料。受控模擬發現,在中度異質性的情況下,階層式二元模型的實證涵蓋率在名目值 94% 時約為 80%;在精確效能邊界(0.0 或 1.0),無論使用目前提供的 logit-normal 或替代方案 Beta-Binomial,涵蓋率都為零。順序穩健性研究所報告的 100% 實證涵蓋率(90/90 個二元與連續比較),明確是「一項設計特性」——當停止條件為
W = delta時,區間仍夠寬,足以涵蓋約 0.01 的截斷偏誤——「而非 Bayesian 校準在頻率學派意義上的證據」。 - 序位區間完全不涵蓋平均值,原因同樣是估計目標不同:不同排列下的涵蓋率為 0/15(低)、12/15(中)、1/15(高)。論文建議序位分組改用成對 CI 重疊作為一致性指標(Jaccard 0.954 / 0.729 / 0.772)。
- **序位效率會受到呈現順序影響。**事後以打亂項目順序重新執行時,序位效率為 95.7-97.3%,而固定順序的影子執行只有 57-92%——光是排序就造成 38 個百分點的變化。二元與連續結果則分別在 1-6 個百分點內與 <1 個百分點內相符。
- **Epoch 偽重複。**同一項目的 epochs 被視為可交換,因而相較於獨立觀察值高估有效樣本數;論文表示這會影響收斂速度,但不會影響點估計值。
- **測試的不是成本高昂的任務。**研究動機提到代理程式基準測試的單項任務「會消耗價值數百美元的 token」;驗證所用的則是 MATH Level 5、GPQA Diamond、MMLU 0-shot、TruthfulQA、RACE-H、SciKnowEval 與 WritingBench——都是單輪、依項目評分,且每次試驗成本低。節省效果是在試驗便宜的地方展示,並被主張可用於試驗昂貴的地方。
部署時的陷阱:預設關閉關鍵假設#
方法有效與否取決於兩個條件:分組內觀察值必須具備可交換性,而項目呈現順序必須隨機化。第二個條件不是模型上的細節——前面提到的序位效率變化,正是難度排序項目清單違反條件時的結果。
而 optstop 整合的框架預設並未啟用此功能。Inspect(inspect_ai,也是 AISI 的成果)透過 sample_shuffle 支援隨機化,但此功能**「預設並未啟用」**——論文三度如此指出,並建議「當評估者無法保證項目排序獨立於難度或其他混淆因素時,將其作為預防措施。」若基準測試的項目 ID 隨難度遞增,且兩個套件都使用出廠預設值執行,就會在毫無提示的情況下違反方法明定的前提。這應與本 wiki 中其他預設設定的陷阱並列:組合方式可行,但開箱即用的設定與它自身的要求不相符。
讓評估成本降低的三種途徑,以及各自的失效方式#
這是本資料集中第三種回答「評估成本太高」的方法;三者分別壓縮不同面向,也以不同方式失效。選擇方法時,失效方式欄才是關鍵。
| 途徑 | 壓縮面向 | 所需條件 | 失效方式 |
|---|---|---|---|
| BenchPress(Benchmark Score Redundancy) | 跨基準測試——執行約 5 個探測項目,預測其餘 128 個 | 84x133 分數矩陣維持有效的 rank-2 結構 | 無聲地失效:幾何結構壞掉會污染點估計,且沒有任何訊號 |
| CollabEval(Benchmark Score Redundancy) | 跨項目——標記部分提示,將其餘項目作為預測式推論中的控制變數補齊 | 不需要結構性假設;低秩只提升效率 | 平順地退化:正確性不取決於秩,因此矩陣出問題只會降低效率,並退化為傳統樣本平均數 |
optstop(本頁) | 跨重複測量與項目序列——每個項目都保持可測,直到精確度足夠才停止抽樣 | 可交換性、隨機化順序、設定妥當的階層模型 | 悄悄失效:模型設定錯誤或效能接近邊界時,可能在錯誤位置得到狹窄區間;它保證寬度,不保證涵蓋率 |
optstop 相較於自適應項目選取文獻(IRT/電腦化自適應測驗,最多可減少 90% 所需項目)的差異特性是:不需要事先校準的項目庫,也不會預先選取子集——所有基準測試項目都保持可測,這是安全關鍵涵蓋率要求所需的條件,也是探測集或核心集方法無法提供的。這是真正的差異,而 CollabEval 的比較也在此發揮作用:CollabEval 的消融研究發現,核心集「兩方面都輸」(點估計有偏、區間無效);optstop 從不預先選取子集,因而避開核心集的失效。但在失效面向上,它其實更接近 BenchPress,而非 CollabEval,因為它的正確性確實取決於模型是否設定正確。
延伸關聯#
- Compute-Controlled Benchmarking——相同的評估者、相同的成本問題、不同的槓桿,而且兩者不能同時使用。該頁記載 AISI「正在研究如何從低成本執行預測高預算下的效能」——沿著運算預算軸進行外插,預測從未付費測試的預算下曲線會如何變化。
optstop完全不做這件事:它固定預算,減少精確定位曲線上各點所需的抽樣量。一個預測未觀察的區域,另一個停止觀察已充分描述的區域。兩者可以組合(自適應停止降低能力曲線上各點的成本,才能讓人負擔得起完整曲線),但保證不會彼此移轉;若以optstop的等效性檢定驗證預測,驗證的就會是錯誤的事項 - Benchmark Score Redundancy——上方途徑比較表的第三條路徑。最值得比較的是失效模式,而非壓縮的面向:CollabEval 的設計讓錯誤假設造成效率損失,而非正確性損失;
optstop則不是如此——它明確不保證涵蓋率,因此設定錯誤的階層模型會在錯誤位置回傳狹窄區間。兩者也有一個共同且尚未檢視的接縫:optstop所有序位與連續驗證都在 WritingBench 上執行,而 WritingBench 是 由 LLM 評分的評分規準;因此可信區間其實是評分者平均值周圍的區間,論文卻從未提及這點——同一項質疑也已在該頁提出,針對 CollabEval 的自動評分者矩陣 - Measuring Beyond Accuracy Saturation——同一項預算論證的兩個部分。該頁建議保留已飽和的基準測試,並從六個面向重新配置量測工具,這會增加測量負擔;此處介紹的機制則用來支付這項額外成本。兩者的互動還有一點值得留意,而且兩份資料都沒有提到:接近效能上限正是
optstop最有效率的極端值區域(高二元 MMLU 單元與連續單元最早停止),因此飽和的基準測試恰好是測量精確度最高、成本最低的種類。值得保留的反轉令人不太舒服——準確度軸最沒有資訊時,抽樣成本最低;中間範圍仍有區別力時,成本最高 - Stopping Under a Noisy Verifier——wiki 中另一種停止規則。兩者不是名稱相近,而是互補方法,因為論文自身的分類已清楚區分:VRR-Stop 是一項以推論為基礎的規則,依估計的邊際真實增益停止生產流程;這裡則是以精確度為基礎的規則,依區間寬度停止測量。兩者的不對稱性互為鏡像:前者的風險是繼續下去會損害好答案(以
beta計價,b* = alpha/(alpha+beta));此處的風險則是停止會漏掉罕見成功(效能低於 1% 時以c = 5計價)。兩者的界線只取決於一個假設——此框架假設評分者正確,只有抽樣帶有雜訊,因此它能精確測量評分者所產出結果的平均值;一旦評分者本身有誤接受率,同一問題就成了 VRR-Stop 所處理的情況 - LLM-as-a-Judge——評分規準設計的結果,與本 wiki 一貫的直覺相反。二元觀察最多只帶有 1 bit 資訊,因此通過/失敗評分是精確估計時成本最高的分數類型;論文明確建議,若任務允許,應優先採用序位或連續評分規準。就抽樣成本而言,這支持了評判流程因其他理由也希望採用的評分規準細緻度。但此建議也伴隨報告風險:序位路徑的估計目標是眾數類別,而非平均值;高序位驗證單元中最大的單一偏差(
mu_diff ~ -0.059),正是這種不一致造成等效性檢定結果未定,而非停止錯誤 - Expenditure Horizon——成本實際所在之處,也說明為什麼本研究沒有觸及它。研究動機提出的成本,是單項價值數百美元的代理任務;METR 發現,在代理式 AI R&D 任務中,實驗運算約占軌跡成本 70-90%,這是目前最有力的論據,說明減少試驗能降低主要成本項目——但
optstop的驗證完全是在單輪、依項目評分的基準測試上進行,一次試驗就是一個 API 呼叫。另一個方向也存在明顯張力:METR 對自身雜訊測量採取的補救方式,是增加重複測量(n = 8 次確認、40 次以上重新執行、取較低包絡線);當測量本身帶有雜訊,且代理程式正針對該雜訊最佳化時,就會採取這種方式——這種情況下可交換性不成立,自適應截斷就不是合適工具 - Large-Scale Test-Time Compute——從評估者的角度檢視「運算即曲線」論點。該篇系列衡量模型在推論時應花費多少;此處衡量評估者測量模型時應花費多少,兩項預算會相乘——運算曲線上的每個新增點,都會再多出一個需要達到自身精確度的分組
- Item Response Theory for LLM Benchmarks——在正交面向上的同類停止規則,停止的是另一個迴圈。
optstop固定項目集,並在 Bayesian 可信區間夠窄時停止每個項目的epochs抽樣;ATLAS 則固定 epoch 數,並在潛在能力尺度上的SE(θ̂)夠小時,停止對每個模型施測更多項目。兩者都以精確度而非準確度為目標;兩者都相對於固定預算基準測試回報節省成本(此處節省計畫試驗的 57.2–97.3%,彼處節省項目庫的 89–99%),而且兩者取得的都是寬度保證,而非位置保證。目前沒有人將兩者合併使用,而且這種組合是否安全並不明確:自適應項目選取會將測驗集中在資訊量高的項目上,而那些項目恰好也是每項目變異數最大的地方,自適應 epoch 停止規則也會在這裡最早截斷 - UK AI Security Institute——發布機構;這篇屬於該機構的方法與工具系列,而非研究發現系列
- Recurring Production Agent Evaluation——第四種降低評估成本的途徑,應納入上方表格,而非與其他方法相互競爭:She 與 Lin 比較非自適應方法(快取、固定子集)與自適應 IRT 測驗(Rasch 與多維度 2PL 延伸),並在本資料集中少見地刻意部署統計上較差的方法——難度分層固定子集勝過多維度 2PL 自適應測驗,從 k=200 起,在 MAE 與排名相關性兩方面都更好。原因在於操作,而非統計:自適應測驗需要依序更新各次執行的能力估計,不適合以平行方式執行的評估系統;
optstop的核心結果避開了同一種協調成本,因為它不會預先選取或校準任何項目。他們對部署方案的驗證——未重新校準即轉移到另外五種代理程式家族,並將校準窗口縮短至一天——尚未在optstop上測試:沒有人檢查過,在沒有重新擬合的情況下,根據一個系統抽樣變異擬合的 Bayesian 停止規則能否轉用到另一個系統
尚待解答的問題#
- 在精簡或代理式評估設計中,效率是否仍然成立?是否存在某個設計規模,在該規模以下自適應停止的成本會高於節省的成本?測得的 81.1% 來自 200 個項目 x 10 個 epoch 設定;同一框架在 100 個項目 x 5 個 epoch、相同門檻下,節省比例為 59.5%,而論文也承認精簡設定可提前終止的空間較少。沒有人在 1-3 個 epoch 的代理式測試套件上執行過此方法;這類套件的單次試驗成本最高、重複次數最低,而且反覆執行 MCMC 重新分析的固定成本,可能高於省下的試驗成本。可直接驗證:在既有代理式評估紀錄上以影子模式執行
optstop,比較它預計省下的試驗次數與推論開銷。 - 對需要位置保證的決策而言,寬度保證是否足夠?此框架明確以區間寬度而非涵蓋率為目標,其自身模擬在中度異質性下的實證涵蓋率約為 80%,低於 94% 的名目水準;在精確效能邊界則涵蓋率為零,而危險能力門檻可能就落在這些位置。任何治理用途的自適應停止評估,都需要涵蓋率數字,而非寬度數字;本資料集中沒有來源回報模型設定正確且真值已知時,位於邊界的涵蓋率。
- 評估者實際上是否滿足隨機化前提?可交換性要求呈現順序隨機化,但
optstop所依據的框架預設關閉了sample_shuffle,而序位效率單是順序就變動 38 個百分點(固定順序為 57-92%,隨機排序為 95.7-97.3%)。可透過稽核驗證:抽樣公開的 Inspect 評估設定,統計其中啟用了多少項目隨機排序。
資料來源#
- Efficient Benchmarking in Production: A Study of an Evolving LLM Agent — Yining She(CMU,研究於 Meta 期間完成)與 Lei Lin(Meta),arXiv 2609.21267,2026-09-18,28 頁,
empirical。此處僅用於上方延伸關聯的註解:§7 實務建議,以及部署決策在操作與統計面向上的取捨(§5.1、§6)。完整討論見 Recurring Production Agent Evaluation - Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations — Toby D. Pilditch,Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations(UK AI Security Institute,arXiv 2608.14425,2026-08-14,32 頁,
empirical)。本頁所有內容:以精確度為基礎與以推論為基礎的停止規則分類,以及停止規則原理的理據(第 2.1 節、附錄 A.1);寬度與穩定化兩項準則,以及delta_item/delta_cap(A.1.1-A.1.2);階層式項目/分組結構與分組設計指引(2.3、A.2-A.3);三條推論路徑與表 1(2.4、A.4);非對稱保守性以及c = 5/1% 預設值(2.2、A.1.3),及其獨立敏感度研究(B.11);3x3 矩陣結果、各路徑效率差異與分數忠實度(第 3.1 節);HDI+ROPE 等效性檢定、三個未定單元與階層式統合分析(3.2、B.8.3-B.8.5);排名保持,以及分析 B 的收斂失敗(B.8.6);兩種門檻下精確度-效率取捨表(B.2);四個基準測試與 29 次驗證執行中的路徑涵蓋情況(B.1);logit-normal 與 Beta-Binomial 模擬,包括約 80%(名目涵蓋率 94%)的數值(B.6);呈現順序穩健性、序位涵蓋率與偏誤拆解(B.10);穩定化驗證(B.12);以及矩陣設計明列的四項限制(B.8.9)。套件 v0.4.0 搭配inspect_aiv0.3.170;程式碼、模擬與影子資料集位於github.com/UKGovernmentBEIS/optstop。層級範圍:採用empirical恰當——全程進行即時 LLM 推論、同次執行內以影子模式比較,並公開資料——但效率數字是作者自己的工具由作者自己的機構在單一設定下測得,而保守性防護僅以合成資料驗證。解析備註:來源為 PDF(docling 2.126.0);匯入時修復七個表格中的四個;表 7 在儲存格合併時無聲遺失了一整列資料(high_cont.)。編譯時以pdftotext -layout -f 25獨立重新核對表 7,結果與修復後的原始資料逐儲存格相符。正文保留了少量 docling 產生的瑕疵(µ 0、\_、>)。原始備註區塊提到 AISI 的配套部落格文章 Optimal stopping: spending evaluation compute where it counts(2026-08-27),但該文未匯入,本頁也未在任何地方引用
Cited by 11
- Compute-Controlled Benchmarking×4
It gives the "plot the whole curve" prescription a price ceiling. METR's dollar-axis argument and…
- UK AI Security Institute×3
The substance is on Adaptive Stopping In Evaluation Sampling: fit a hierarchical Bayesian model as…
- Benchmark Score Redundancy×2
optstop bayesian optimal stopping llm evaluations — Toby D. Pilditch (UK AI Security Institute),…
- Expenditure Horizon×2
optstop bayesian optimal stopping llm evaluations — Toby D. Pilditch (UK AI Security Institute),…
- LLM-as-a-Judge×2
Adaptive Stopping In Evaluation Sampling — a sampling-cost argument for rubric granularity, running…
- Measuring Beyond Accuracy Saturation×2
optstop bayesian optimal stopping llm evaluations — Toby D. Pilditch (UK AI Security Institute),…
- Stopping Under a Noisy Verifier×2
optstop bayesian optimal stopping llm evaluations — Toby D. Pilditch (UK AI Security Institute),…
- Item Response Theory for LLM Benchmarks
Adaptive Stopping In Evaluation Sampling — the sibling stopping rule, on the orthogonal axis.…
- Evals & Benchmarks
Adaptive Stopping In Evaluation Sampling — UK AISI's optstop (Pilditch, arXiv 2608.14425): treat an…
- Open Questions Backlog
Adaptive Stopping In Evaluation Sampling ×3 (oldest 25d) — Does the efficiency survive a lean or…
- Recurring Production Agent Evaluation
Adaptive Stopping In Evaluation Sampling — a fourth axis in that page's "routes to a cheaper…
Related articles
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
