資料來源#
- A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
- Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus
- Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
摘要#
這份 wiki 中所有多模型架構——裁判群組、驗證器集成、製作者/檢查者分工、多數決——都假設錯誤彼此獨立,並以此為可靠性的基礎;LLM-Judge Validation、Reference-Free Judge Over-Crediting 和 Weak-Verifier Ensembling 各自提供了不同測量,指出這項假設並不成立。但這些工作都沒有提供一種工具,能以虛無模型和顯著性檢定衡量模型彼此之間的依賴本身,而不是判決之間的依賴。
Kuai et al.(A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges,arXiv 2604.07650,v2 2026-08-09,Texas A&M / Marquette / Utah,COLM 2026,empirical)提出了其中一種方法。論文用自己的話如此描述核心概念:
正確答案自然會趨於一致,因為任務通常只有一個解答。相較之下,錯誤所處的假設空間大得多。
因此,稽核只在失敗流形上進行。兩個模型答對同一題,資訊有限;兩個模型在同一個簡單問題上都答錯,還選了同一個錯誤選項,就不一樣了。
本頁現在收錄了兩種這類工具,檢視的對象不同,卻得到相同判決。Kuai et al. 衡量作為答題者的模型之間的依賴,並據此預測裁判偏誤。Kohli(Apple,arXiv 2605.29800)衡量裁判群組彼此判決之間的依賴,並將其換算成群組因此損失的準確率:來自七個家族的九個前沿裁判,合計只有 n_eff = 2.18 個獨立投票;多數決比具備相同個別裁判錯誤概況的獨立投票低 22.0 個百分點。合讀兩篇研究可看出:所有工具都證實依賴確實存在,兩篇研究都發現依賴無法由題目難度解釋,而目前測試過的聚合規則,最多只能挽回其代價的十分之一。
衡量什麼,以及用什麼資料衡量#
標題同時提到「行為依賴」和「LLM 裁判」,兩者衡量的是不同對象。這項差異決定本頁數字能如何使用:
- 依賴是以答題行為衡量,不是以評判行為衡量。 18 個模型都在一個由 1,000 題組成的 MMLU-Pro 子集中作答(生物/心理學,473/527),使用統一的 5-shot 提示詞;支援時溫度設為 0。BEI 和 CIG 由這份錯誤矩陣逐對計算。沒有任何裁判判決參與其中。
- 偏誤是在評判行為上衡量,使用的是不同資料集。 接著從 18 個模型中選出三個——Llama-3.1-70B-Instruct、GPT-5、GPT-4o-mini(開放權重、高能力閉源、成本效益高的閉源模型)——讓它們評判另一個不重疊的 1,000 題 MMLU-Pro 子集(法律/商業,295/705)中的候選回答,依固定評分規準評估正確性(0/1)和推理品質(0–5),並在同一個打亂順序的提示詞中放入所有候選回答。
- 兩階段之間的連結,是跨越(裁判、目標)配對的等級相關,不是作用機制。 第一階段估計出的依賴,能預測第二階段衡量的偏誤量。兩者之間沒有任何量依建構方式直接傳遞;因此,這種關聯是研究結果,而非同義反覆;但也因此只能視為關聯。
論文明確指出,標題中的「誘發」並非因果主張:「所提出的稽核可辨識行為關聯,但無法確立其因果來源。」 以下所有數字都應解讀為相關性。
第一層——BEI:以難度為條件的超額共同失敗#
這項測量的直覺版本有個顯而易見的問題:兩個弱模型經常一起答錯,因為難題本來就難。BEI 會控制這一點。
對模型 i, j 在任務 t 上而言,難度採用留出配對法估計——由其餘 M − 2 個模型的失敗率計算,d_t = (1/(M−2)) Σ_{m ∉ {i,j}} Y_{m,t}——因此受測配對不會進入自身的條件變數。每個模型的難度反應函數 p_m(d) = P(Y_m = 1 | d) 以邏輯迴歸配適;虛無假設是給定難度後的條件獨立,H₀: Y_{i,t} ⊥ Y_{j,t} | d_t,在此假設下,預期共同失敗率為 p_i(d_t)·p_j(d_t)。
接著,殘差 Y_{i,t}Y_{j,t} − p_{i,t}p_{j,t} 會乘上任務的容易度權重 a_t^w = (1 − d_t)^w:
BEI_w(i,j) = (1/T) Σ_t (1 − d_t)^w (Y_{i,t}Y_{j,t} − p_{i,t}p_{j,t})
這項加權是研究設計的關鍵,論文也充分說明了理由:對困難任務而言,虛無模型下的共同失敗機率本來就高,因此,沒有共同失敗會產生很大的負殘差,但其實沒什麼意義(只是其中一個模型有能力作答);反之,在兩個模型個別都預期能答對的簡單任務上共同失敗,才是有診斷價值的事件。命題 1 證明容易度權重是 d_t 的確定函數,因此在虛無模型下仍以零為中心;這項結果逐題成立,不要求任務之間彼此獨立。
顯著性以 Monte Carlo 估計:在擬合的 p̂_{i,t}, p̂_{j,t} 下,將兩個模型的結果分別重抽樣為獨立 Bernoulli 抽樣,固定觀測到的難度,重新計算 BEI;以模擬出的虛無分布計算單尾 p 值,再對所有模型配對使用 Benjamini–Hochberg 校正並回報 q 值。難度反應函數會經過診斷,而非直接假定有效:平均 AUC 0.865(範圍 0.752–0.934)、平均 ECE 0.041、平均 Brier 0.130(表 C.1)。
第二層——CIG:超額同一干擾選項碰撞#
BEI 表示兩個模型共同失敗的頻率高於隨機機率。CIG 則問它們是否以相同方式失敗。在有 K − 1 個干擾選項的多選題中,干擾選項吸引力 π_{k,t} 以其他模型的失敗答案經 add-one 平滑估計(再次排除受測配對);方向性虛無假設則是共同失敗的兩個模型各自依該分布獨立抽取干擾選項,因此虛無碰撞機率為 c_t = Σ_k π²_{k,t}。每個碰撞殘差再乘上自身的驚訝度 −log c_t:
CIG(i,j) = (1/T) Σ_{t ∈ co-failures} (−log c_t)(1[S_i = S_j] − c_t)
若某題有一個幾乎人人都會踩的干擾選項,選項碰撞就不太重要;若其他 16 個模型的答案四散,兩個模型卻選到相同干擾選項,這種碰撞就很有意義。顯著性同樣採用 Monte Carlo 與 BH 流程。
用論文的話說,這兩項指標分工明確:第一層衡量兩個模型是否過度共同失敗;第二層衡量它們是否過度以相同方式失敗。
稽核結果#
模型名單(附錄 B.1 文字說明,並與圖 2 的 18 個節點交叉核對)包含18 個模型、六個家族,刻意納入不同世代:
| 家族 | 模型 |
|---|---|
| GPT | GPT-5、GPT-4o、GPT-4o-mini、GPT-oss-20B |
| Claude | Claude 4.6 Sonnet、Claude-3.5-Sonnet、Claude-3.5-Haiku |
| Gemini | Gemini-3.1-Pro、Gemini-1.5-Pro、Gemini-1.5-Flash |
| Llama | Llama-3.1-70B、Llama-3.1-70B-Instruct、Llama-3-70B、Llama-2-70b |
| Qwen | Qwen1.5-110B、Qwen1.5-72B-Chat、Qwen1.5-14B-Chat |
| DeepSeek | DeepSeek-Chat-v2.5 |
兩項指標找到結構不同的圖,這是論文最有用的發現。
- BEI 排名前 10 的配對全都來自 Llama 和 Qwen(表 C.2,並以
pdftotext -layout重新核對):Llama-3-70B ↔ Llama-3.1-70B 為 0.0525,Llama-2-70b ↔ Qwen1.5-110B 為 0.0398,Llama-3-70B ↔ Qwen1.5-110B 為 0.0352,Qwen1.5-14B ↔ Qwen1.5-72B 為 0.0333,最低至 0.0211;每一組在 FDR 校正後都達顯著(q = 9.5 × 10⁻⁴ 至 1.3 × 10⁻²)。沒有任何前沿模型出現。依此衡量,共同失敗的糾纏是較舊開放權重級別的特徵。 - CIG 排名前列的配對呈現跨家族情況(表 C.3,共九列,已重新核對):Llama-3-70B ↔ Llama-3.1-70B 仍以 0.1332 居首,接著是 Claude-3.5-Sonnet ↔ GPT-4o(0.0525)、GPT-4o ↔ GPT-4o-mini(0.0523)、DeepSeek-v2.5 ↔ Gemini-1.5-flash(0.0502)、Claude-4.6-Sonnet ↔ GPT-5(0.0471)、Gemini-1.5-flash ↔ Gemini-1.5-pro(0.0454)、Claude-3.5-haiku ↔ Gemini-1.5-flash(0.0429)。方向性的錯誤對齊會跨越廠商界線,共同失敗則不會。
- 正文補充了表格未呈現的組成觀察:「閉源權重模型之間觀察到的統計顯著糾纏配對較多,開放與閉源權重模型之間則較少。」這是整份研究資料中最接近回答「混合供應商有什麼好處」的方向性結果——跨越開放/閉源界線混合模型,去相關效果比在同一級別內混合更好——但它只計算顯著配對數量,沒有提供效應量。
作者的解讀是,糾纏「不只存在於架構脈絡或模型系譜內」,也可能反映「共享的訓練訊號、對齊策略和世代設計選擇」;每次提出這些可能原因時,作者都附上因果限制聲明。
裁判偏誤的關聯,以及數據實際能支持的主張#
過度背書以條件精確率的偏差定義:
ΔPrec(J_j, M_i) = P(Y=1 | Ŷ_j=1) − P(Y=1 | Ŷ_j=1, M=M_i)
——也就是裁判對這個特定目標模型的精確率,比整體精確率低多少。正值表示裁判背書該模型錯誤答案的比例高於平均。依賴指標的 Spearman 相關(表 1,已逐格依 pdftotext -layout 重新核對):
| 指標 | MMLU-Pro ρ | p | MATH-500 ρ | p |
|---|---|---|---|---|
| Pearson 相關 | 0.063 | 0.724 | 0.187 | 0.360 |
| 互資訊 | 0.113 | 0.525 | 0.208 | 0.309 |
| 共同失敗 Jaccard | 0.428 | 0.012 | 0.275 | 0.175 |
| BEI | 0.508 | 0.002 | 0.441 | 0.024 |
| 僅限錯誤的一致性 | −0.107 | 0.545 | −0.172 | 0.399 |
| 難度調整後的殘差相關 | 0.151 | 0.394 | −0.057 | 0.746 |
| CIG | 0.520 | 0.002 | 0.457 | 0.019 |
MATH-500 欄展現了論文最有力的結構設計:依賴程度是在選擇題 MMLU-Pro 上估計,之後不做調整就用於自由作答的數學回答;同樣三個裁判在評估時還能取得的14 個模型上進行評判,指標仍具預測力。CIG 本身甚至沒有在此重新估計——它是為選擇題定義的,研究轉移的是方向性結構,而非重新計算。多數基準指標在這種轉移測試中不再顯著;BEI 和 CIG 則仍然顯著。
有三點需要留意,第一點攸關核心結論。
1. 相關分析的樣本點約為 34 和 26 個,論文卻從未說明。 內文和表格都沒有列出任何 Spearman 相關的樣本數。根據各欄的(ρ、p)配對,使用常見的 t 近似反推,可得 MMLU-Pro 每列 n = 33–34,MATH-500 每列 n = 26——兩欄各自七列(包括不顯著的列,例如 ρ = 0.063 / p = 0.724 和 ρ = 0.187 / p = 0.360)都反推出相同的 n,因此是共用樣本數,不是單一儲存格造成的假象。這是 wiki 的算術推算,不是論文提供的數字。 由此帶來兩個後果:
- 信賴區間寬到足以涵蓋論文的核心對比。 n = 34 時,BEI 的 ρ = 0.508,其 95% 區間約為 [0.21, 0.72];CIG 的 0.520 約為 [0.22, 0.73];互資訊的 0.113 則約為 [−0.23, 0.44];Jaccard 的 0.428 約為 [0.11, 0.67]。「BEI 和 CIG 顯示最強的關聯……相較之下,Pearson 相關和互資訊只有微弱且不顯著的關係」是以互有重疊的區間作比較。BEI 和 CIG 的方向與顯著性仍成立,但在此 n 下,尚未證明它們優於基準指標。較誠實的說法應以 MATH-500 欄為據:Jaccard 不再顯著,BEI/CIG 則仍顯著;這顯示的是轉移能力的差異,而非效應大小的差異。
- 樣本數的計算對不上。 三個裁判 × 17 個其餘目標等於 51;在 ρ = 0.508 時,這會得到 p ≈ 1.4 × 10⁻⁴,而非報告的 0.002。完全吻合的數字是 2 × 17 = 34 和 2 × 13 = 26——代表兩個裁判,而不是研究設計所描述的三個。也許一個裁判未納入主要關聯分析,或者觀察單位並非論文所述。這本應在「指標」段落用一句話交代清楚。
2. 難度加權指數 w 是依據報告資料選出的自由參數。 表 2(已重新核對)顯示,在 w = 0 時,BEI 退化為單純的共同失敗殘差平均值,ρ 降至 0.289(MMLU-Pro)和 0.032(MATH-500)——也就是說,這項指標相較於原始殘差的優勢幾乎全來自容易度加權;這正是論文的主張,而且論證充分。但超過 w = 1 後,轉移效果迅速惡化:MATH-500 的 ρ 在 w = 1…5 時依序為 0.441 → 0.275 → 0.231 → 0.236 → 0.180;MMLU-Pro 則維持在 0.508 / 0.490 / 0.504 / 0.465 / 0.363。論文根據同一張報告主要結果的表格,得出「中度加權,約為 w = 1–2,能取得合理平衡」的結論;但若看跨基準表現,只有 w = 1 真正有效,而且研究沒有在留出資料上選擇 w。
3. 一個成本極低的基準指標,在主要基準上已達到大部分效果。 共同失敗 Jaccard——只計算失敗集合的重疊,不控制難度,沒有虛無模型或推論程序——在 MMLU-Pro 上達到 ρ = 0.428(p = 0.012)。這套方法真正的價值在跨基準轉移和方向性分析,而非主要相關結果。
緩解方法,以及實際可歸因於它的增量#
後續示範對三個驗證器構成的集成進行重加權。每個驗證器 J_m 都有一個能力分數 q_m 和兩項依賴懲罰:R_m 是其與其他驗證器的平均糾纏程度;T_m^(S) 是其與受評判目標模型的糾纏程度。兩者結合如下:
w_m^(S) ∝ q_m^κ · exp(−η₁ R_m − η₂ T_m^(S))
其中 λ 用於混合經正規化的 BEI 與 CIG,組成兩兩糾纏指標 E(i,j)。四個參數以 500 題校準集的交叉熵擬合,並在 500 題留出集上測試前固定。這項研究紀律確實值得肯定。
結果(表 3,已重新核對):
| 聚合方式 | Acc | F1 | Precision |
|---|---|---|---|
| 多數決 | 0.847 | 0.901 | 0.870 |
| 依準確率重加權 | 0.881 | 0.919 | 0.891 |
| 依糾纏程度重加權 | 0.882 | 0.922 | 0.896 |
摘要所稱「準確率和精確率分別比多數決提升 3.5 和 2.6 個百分點」,算術上正確,修辭上卻容易誤導。只依能力重加權的基準方法,已達成 3.5 個百分點增益中的 3.4 個百分點。 可歸因於糾纏項的增量——也就是論文對此表格真正的貢獻——是 準確率 +0.1 個百分點、F1 +0.3 個百分點、精確率 +0.5 個百分點;這是在 500 題的留出集上測得,而準確率 1 個百分點約等於一個標準誤。圖 3 說明了原因:校準後的權重主要由能力決定(GPT-5 對每個目標模型的權重約為 0.42–0.50,GPT-4o-mini 約為 0.25,Llama-3.1-70B-Instruct 介於兩者之間),目標模型改變時,權重只略微變化。熱圖看得出去糾纏調整,但指標上幾乎看不出差異。
以下是緩解方法部分的誠實總結:稽核才是貢獻;重加權則證明稽核結果可以接入聚合器而不造成傷害,但驗證器群組僅有三個成員,無法充分發揮冗餘懲罰的作用。 目前尚未證明,為依賴定價能比為能力定價帶來更多效益。
九位裁判,兩個有效投票——同一缺口換算成判決影響(2026-09-22)#
Kohli(Apple,Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels,arXiv 2605.29800,2026-05-28,14 頁,empirical)進行了上述章節無法做到的測量:在裁判群組執行實際工作時,直接以群組自身的判決估計依賴,並以足夠豐富的真值資料,將其影響換算為準確率差距,而非相關係數。
研究設計,以及為何資料集選擇就是整個設計#
來自七個家族的九個前沿裁判——GPT-4o 和 GPT-4o-mini(OpenAI)、Claude Sonnet 4.5、Gemini 2.5 Pro、Llama 4 Maverick 和 Llama 4 Scout(Meta)、Qwen3-32B、Mistral Large 3、DeepSeek-V3——在溫度 0 下,以一份標準化提示詞分類 NLI 題目。各模型在 MNLI 上的錯誤率介於 0.282(Qwen3-32B,最佳)至 0.356(GPT-4o-mini)(表 1,已重新核對)。
語料是 ChaosNLI(Nie et al., 2020):每題有100 份人工標註。黃金標籤採 100 位標註者的多數決;從 MNLI(可用 1,599 題)、SNLI(1,514 題)和 AlphaNLI(1,532 題)各抽出 1,000 題,依熵分層;另加入 1,000 組 RewardBench 成對偏好題,作為第四項任務。這麼深入的標註同時完成兩件事——提供答案鍵,並提供每題難度指標(3 類資料集的人類 Shannon 熵為 0–1.58 位元,AlphaNLI 則為 0–1.00)——第二項功能讓論文得以在不借用受測模型所估難度的情況下控制依賴程度,避開 Kuai et al. 所需的留出配對迂迴做法。
測量工具:Kish 有效樣本數#
每個裁判都會在 1,000 題上形成一組二元錯誤向量(若裁判 j 不同意 ChaosNLI 多數標籤,則 e_{j,i} = 1);對所有 C(9,2) = 36 組配對計算 phi 係數;再以 Kish 設計效應將平均值轉換成獨立投票者的有效數量:
n_eff = k / (1 + (k − 1) · φ̄)
論文刻意選用 Phi:對二元錯誤向量而言,它就是 Kish 公式要求的 Pearson 積矩相關;相較之下,「替代關聯度量(例如 Cohen's kappa)會混淆盛行率與依賴性」。
主要結果(表 2,已依 pdftotext -layout 重新核對): φ̄ = 0.391 ± 0.111(配對範圍 0.161–0.603),n_eff = 2.18 [2.07, 2.31](對 10,000 次題目重抽樣計算的 bootstrap 區間),獨立性比例 n_eff / k = 24.2%。不需假設可交換性的檢查結果相符:k/λ_max = 2.16,其中 λ_max = 4.17;因此 Kish 假設適用於這個群組。九位裁判,兩張票。
後果:難度無法解釋的 22 個百分點 Condorcet 差距#
單看 n_eff,它只是相關矩陣的統計量。論文利用Condorcet 虛無模型,將其轉化為對群組輸出的主張:依人類熵三分位數逐組估計每個裁判的 3×3 混淆矩陣,接著針對每題進行 10,000 次 Monte Carlo 抽樣;抽樣時,各裁判根據該題黃金標籤,從自身所屬難度分箱的混淆矩陣獨立投票。這是明確的條件獨立檢定——可由共通題目難度解釋的相關性視為免費扣除,剩下的差距才是檢定結果。
- 獨立性假設下的預測多數決準確率:94.0%。實際值:72.0%。加權差距 22.0 個百分點 [19.5, 24.1]。
- 共同題目難度只占差距的 6.8%(若改用 10 個分箱而非 3 個則為 13.5%;所有資料集中仍有 66–87% 無法解釋)。
- 分層置換檢定(在熵分層內打亂每位裁判的錯誤向量,保留其個別錯誤率與難度結構,進行 10,000 次置換):10,000 次中沒有一次得到觀察到的 φ̄。虛無平均值 0.060,標準差 0.005,z = 65.6,
p < 10⁻⁴。 - 半樣本交叉驗證(在一半 500 題上擬合混淆矩陣,再於另一半模擬)得到 21.9 個百分點,與樣本內的 22.0 個百分點相近;過度擬合比率為 0.997,SNLI/AlphaNLI 則分別為 0.960/1.000。
錯誤直方圖清楚呈現了這點(圖 1,編譯時讀取;十個長條合計 1,000 題,數量為 290/140/103/108/68/69/65/61/45/51)。獨立性假設下,錯誤數集中在每題 2–4 個。實際觀察則堆積在兩端:290 題(29%)九位裁判全對,51 題(5.1%)九位裁判全錯;預期全錯題數則少於 1 題。
單靠相關係數無法得出的三項結果#
1. 每個資料集上,最佳單一裁判都能追平或勝過群組。 表 3(跨資料集比較;這份原始資料唯一需要修復的表格,見來源):
| MNLI | SNLI | AlphaNLI | |
|---|---|---|---|
| n_eff(Kish) | 2.18 [2.07, 2.31] | 2.35 [2.21, 2.51] | 2.48 [2.32, 2.69] |
| φ̄ | 0.391 | 0.354 | 0.328 |
| 群組準確率 | 72.0% | 77.7% | 88.7% |
| 最佳個別裁判 | 71.8% | 84.2% | 91.2% |
| 群組增益 | +0.2 個百分點 | −6.5 個百分點 | −2.5 個百分點 |
| Condorcet 差距 | 22.0 [19.5, 24.1] | 14.0 [11.9, 16.1] | 7.6 [6.0, 9.1] |
MNLI 上的 +0.2 個百分點落在平手裁決範圍內(以雜湊值打破 11 次平手,占題目 1.1%),因此較誠實的解讀是群組從未勝出。請注意,基礎準確率越高,差距越小——準確率越高,相關錯誤的發揮空間越少——這也是為什麼 RewardBench 的群組準確率達 92.7%,Condorcet 差距卻只有 6.8 個百分點;然而該資料集的 φ̄ 反而更高,達 0.440。Condorcet 差距小,不代表群組彼此獨立。
2. 增加裁判幾乎沒有價值,移除裁判往往更好。 擴展曲線(表 8,C(9,k) 子集)幾乎完全符合 Kish 預測:k = 2…9 時,平均 n_eff 分別為 1.45 / 1.69 / 1.85 / 1.96 / 2.03 / 2.09 / 2.14 / 2.18;預測值為 1.44 / 1.68 / 1.84 / 1.95 / 2.03 / 2.09 / 2.14 / 2.18——並以 1/φ̄ = 2.56 為硬上限。前五位裁判已取得可達獨立性的 90%(n_eff 從 1.96 到 2.18);第六至第九位裁判只增加 +0.22 個有效投票。逐一移除(表 9)比不移除任何人更糟:移除九位裁判中的六位,群組準確率會上升;移除 Gemini 2.5 Pro——它與 Claude(φ = 0.603)和 GPT-4o(0.52)糾纏最深——準確率會提高 1.3 個百分點 [+0.1, +2.6]。三個移除後會使表現變差的裁判中,有兩個是個人準確率最高者。Austen-Smith 和 Banks(1996)曾預測正相關可能讓投票者有害;這項研究在 LLM 裁判情境中實際展現了這點。
3. 更聰明的聚合無法挽救結果,即使知道黃金標籤也一樣。 表 5/表 11(已重新核對),準確率以百分比計:
| 方法 | 使用預言者資訊? | MNLI | SNLI | AlphaNLI | RewardBench |
|---|---|---|---|---|---|
| 多數決 | 否 | 72.0 | 77.7 | 88.7 | 92.7 |
| Dawid–Skene EM | 否 | 70.7 | 77.6 | 89.5 | 92.7 |
| 準確率加權(5-fold CV) | 是 | 72.2 | 77.7 | 88.7 | 92.7 |
| Phi 最佳化/Markowitz(5-fold CV) | 是 | 72.4 | 78.4 | 86.2 | 94.1 |
| 最佳個別裁判 | — | 71.8 | 84.2 | 91.2 | 95.5 |
| Condorcet 預測 | — | 94.0 | 91.7 | 96.3 | 99.5 |
準確率加權投票只能縮小 MNLI 差距的 不到 1%。Dawid–Skene 在 MNLI 上不如多數決(裁判彼此相關時,非監督式 EM 會錯估錯誤率);它在任何資料集上的最佳表現,也只縮小 AlphaNLI 差距的 10.5%。穩定的預言者資訊方法最多只縮小 11%。Markowitz 加權——直接依相關性定價,精確反轉 phi 矩陣,方向上類似 Weaver 式加權——是最有啟發性的失敗案例:它在 MNLI(72.4)和 RewardBench(94.1,縮小該差距的 20.6%)上最佳,卻在 AlphaNLI 上低於單純多數決(86.2)。依相關結構擬合權重,會對該結構過度擬合。
同家族與跨家族:這份研究資料不斷假設的關鍵因素#
這項結果對 wiki 其他內容影響最大;phi 矩陣(圖 3,編譯時讀取,並與 §5.3 和附錄 B 文字交叉核對)以視覺方式定論:依階層式集群排列的矩陣中,有一個五模型緊密區塊——Mistral Large、DeepSeek-V3、GPT-4o、Claude Sonnet、Gemini 2.5 Pro,兩兩相關為 0.46–0.60——橫跨五家不同廠商;較鬆散的區域則是兩個 Meta 模型,加上 Qwen3 和 GPT-4o-mini。OpenAI 的兩個模型分屬兩個集群(GPT-4o 在緊密區塊內,與 Claude 相關為 0.59、與 Gemini 為 0.52;GPT-4o-mini 則在區塊外),集群本身就說明廠商不是劃分依據。
- 同家族配對:OpenAI×OpenAI φ = 0.437、Meta×Meta 0.435。跨家族平均 φ̄_cross = 0.389。差值:+0.047。
- 群組中相關性最高的三組配對全都跨家族:Claude Sonnet × Gemini 2.5 Pro 0.603、GPT-4o × Claude Sonnet 0.588、Mistral Large × DeepSeek-V3 0.564。相關性最低的配對也跨家族(Gemini × Llama 4 Scout,0.161)。
- 讓家族多樣性最高,效果反而更差。 每個家族限制選出一位裁判——共七位,每個家族選表現最佳者——得到 n_eff = 1.93,低於九人群組的 2.18,也低於表 8 所列 36 個隨機七人子集的平均值 2.09(依論文數字所做的 wiki 算術推算)。論文將此解讀為選擇效應:最佳裁判會把錯誤集中在相同難題上。不論原因為何,「每家廠商選一個」這條群組建構規則,在此反而降低獨立性。
- 有一項相反證據值得一併保留:RewardBench 上同家族的額外相關程度為 +0.109,MNLI 則是 +0.047。家族對成對偏好任務的預測力高於分類任務,因此「系譜無關」只對特定任務成立,並非普遍結論。
全體一致並非表面所見#
在 319 題全體一致的 MNLI 題目中,群組準確率為 90.9%;681 題中只要有任何意見不一,準確率就降至 63.1%。全體一致時仍有 9.1% 錯誤,聽起來不算特殊;但若對照九位準確率約 68% 的投票者在獨立假設下的預測,錯誤率應約為 ~0.02%。逐分箱表格(表 6,共 11 列)中,離散群組熵的 12 個級距有 8 個達到 p < 0.05。全錯題也不只是模糊題:51 題之中,29 題(56.9%)的人類至少有 50% 同意群組漏掉的答案;而群組高估矛盾選項,造成其中 51% 的全錯(n→c 14 題,e→c 12 題),儘管矛盾只占黃金標籤的 16.5%。
這是幾個頁面已經以非正式方式提出的原則,其量化版本:群組一致衡量的是共享先驗,而非正確性;若將全體一致當成信心門檻,就會把相關性整套帶進來。
穩健性,以及那個會讓表現惡化的選項#
讓全部九位裁判在相同 1,000 題 MNLI 上重新評估(表 4):改寫提示詞為 2.17、反轉標籤順序為 2.15、溫度 0.5 為 2.17,基準值為 2.18;信賴區間彼此重疊,反轉標籤的實驗組也排除了位置偏誤作為主因。另一個使用確定性黃金標籤的不同任務 RewardBench,得到 1.99 [1.83, 2.20]。依黃金類別將 MNLI 分層時,n_eff 介於 1.85(矛盾)到 2.40(中立);即使是人類同意率 ≥80% 的 179 題,n_eff 也只有 2.67——高於全體題目,但離 9 仍很遠,因此「從眾只因題目模糊」的說法並不成立。
例外是實務者最先會試的選項。思維鏈會提高相關性:φ̄ 由 0.391 升至 0.456,n_eff 由 2.18 降至 1.94,群組準確率由 72.0% 降至 69.2%。共用推理會放大共通錯誤。若想靠「讓裁判多思考」來增加群組多樣性,結果恰恰會相反。
建議,以及採行後的代價#
我們建議將 n_eff 作為群組的標準診斷指標:若 n_eff/k < 0.5,就應審慎看待結果。
本文所有設定都未通過這項檢驗(k = 9 時為 24.2%;RewardBench 為 1.99/9 = 22%)。只要有答案鍵,這項診斷的成本就很低——裁判群組本身的錯誤矩陣,是任何有評分的評估工作都會產生的副產品——進展指標也很明確:將 φ̄ 從 0.39 減半至 0.20,n_eff 就會從 2.2 升至 3.5,Condorcet 差距約可縮小一半。
這項建議有三個限制。人類比較基準是模擬的,不是實際測量值。 表 3 的「人類 n_eff」為 4.03–5.79——論文據以主張「人類群組的獨立性約為兩倍」——是透過在可交換性假設下,從整體 ChaosNLI 分布為每題抽樣 10 個標籤得到(論文原註如此說明);因此,它代表可交換標註者群組會有的表現,而非對 100 位實際標註者測得的 n_eff。Bootstrap 信賴區間涵蓋的是題目,而不是裁判——論文明確指出這點;若換成另一組九個模型,結果可能不同。此外,這裡的任務全是分類或二元偏好;作者指出開放式生成和程式碼審查尚未測試,而裁判群組實際上正是部署在這些情境中。
兩篇論文的共識,以及看似不一致的一點#
兩篇論文在關鍵之處一致:錯誤並非獨立;控制難度後,差距仍然存在;虛無模型讓這項主張得以檢驗。兩篇論文也從不同方向顯示緩解方法有其上限——Kuai et al. 建構去糾纏聚合器,比能力加權多得 +0.1 個百分點;Kohli 測試兩種最接近的既有聚合器,即使給予黃金標籤,也只挽回差距的 ≤11%。
表面上的衝突在於家族。Kuai et al. 的 BEI 前 10 名共同失敗配對全都是同家族(Llama 和 Qwen);Kohli 的判決相關性前 3 名配對則全都跨家族。兩者衡量的構念不同,因此並不矛盾:
- BEI 衡量以難度為條件的超額共同失敗,對象是答題行為。 系譜影響會在這裡顯現;但在 Kuai 的名單上,這又和模型世代混淆,因為前十名全是 2023–2024 年的開放權重模型。
- CIG 衡量方向性的錯誤對齊,其前幾名配對跨越廠商(Claude-3.5 × GPT-4o、DeepSeek × Gemini-flash)。Kohli 的 φ 是判決層級的相關,和 CIG 的構念比和 BEI 更接近,研究結果也一致:對齊會跨越系譜。
- Kohli 的群組控制了 Kuai 名單所欠缺的單一發布時期條件。 九個裁判都是目前的前沿端點,沒有跨三代模型;即便如此,跨家族結果仍成立,φ̄ = 0.391。這是另一條獨立證據,反駁把 BEI 同家族配對歸因於世代差異;但它採用不同工具和任務,因此不是複現,只是指向相同解釋。
還有一項構念差異必須釐清:Kohli 的 φ 未經條件化——它是錯誤向量之間的原始兩兩相關,也就是 Kuai et al. 發現只能微弱預測裁判偏誤的單純基準指標。Kohli 並未用它來預測偏誤;他將它用於 Kish 計算,此時原始相關正是正確的輸入;而難度條件化則放在下一層的 Condorcet 虛無模型中。兩篇論文將相同的修正放在不同位置,卻都找到了同一種殘餘依賴。
第三項 n_eff 測量,以及新的後果:合併投票與配對顯著性(2026-09-25)#
Hossain, Yousefi & Lim(Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus,UCF,arXiv 2609.22512,2026-09-18,empirical)在不同的裁判群組、不同真值來源和不同下游後果上,採用與 Kohli 相同的設計效應測量——Ledoit-Wolf 縮減錯誤相關 → n_eff = n / (1 + (n−1)ρ̄)。在 Kuai et al. 和 Kohli 之後,這是第三個建立裁判/模型錯誤依賴虛無模型、而非只報告原始一致性數字的獨立研究團隊;三組人的方法並不重疊:Kuai 以任務難度為條件,不需裁判真值以外的額外資料;Kohli 以 Condorcet 準確率預測為依據計算 n_eff;這篇論文則以假設檢定的結論為依據。
主要結果在不同組成的群組上驗證了 Kohli 的發現。 由 10 個開放權重邏輯推理裁判構成的群組(五個 7–9B 基礎模型 × 成對比較/Likert 評分後比較提示方式:Llama-3.1-8B、Qwen-2.5-7B、Gemma-2-9B、Mistral-7B、Phi-3.5-mini),在 1,133 組 RewardBench v2 完整列表配對上得到 ρ̄ = 0.206、n_eff = 3.51 個有效投票(共 10 位,表 9)——獨立性比例為 35%,接近 Kohli 在規模更小、前沿模型占比更高的群組中測得的 24.2%;質性結論也相同:名目群組大小會讓獨立證據高估約三倍。設計效應的變異膨脹因子為 1 + 9·0.206 ≈ 2.85。估計值對校準標籤雜訊穩健(隨機翻轉 1–10% 黃金標籤後,ρ̄ 只從 0.206 變為 0.226),也能推廣至 73 種替代群組組成(68 個至少有 5 個裁判的子群組中,ρ̄ 介於 0.13–0.28)以及另外兩個資料集(UltraFeedback 上 n_eff = 3.36,PKU-SafeRLHF 上為 2.89);這是整份資料中,單一 n_eff 估計背後範圍最廣的穩健性測試。
新發現:相關投票會翻轉顯著性檢定對「顯著」與否的判斷。 Kohli 將 n_eff 轉換為預測的準確率差距;本文則將其轉換為預測的假設檢定不一致。若「合併投票」檢定將每位裁判對每個題目的每次投票都視為獨立觀察值,就會以相同設計效應因子(≈2.85)低估平均投票的變異;「配對式」檢定則以每組偏好配對為推論單位,不會如此。在從 RewardBench 的 Focus 和 Factuality 子集中抽取、每組 100 個配對的 5,000 組重抽樣群組中,合併投票檢定有 79% 達顯著,配對式檢定則為 52%;也就是說,在最多 28% 的群組中(僅 Factuality 為 22%;Math 和 Precise IF 均 ≤2%),兩種檢定對一個系統是否優於另一個系統的判斷不一致,儘管使用的是相同的 1,000 張票:一個實例的合併投票結果為 z = 2.03,配對結果則為 z = 1.52。這是整份資料中「題目應作為推論單位」主張最鮮明的證據;Yang et al. 和 Kohli 都從準確率角度提出過這項主張。此處翻轉的是結論,不只是數字變小;而且除了偏好配對本身(RewardBench 的參考標籤)外,不需要黃金標籤,因此比兩種以準確率為基礎的工具更便宜。
前沿裁判在全新名單上驗證 Kohli 的跨家族結果。 三個來自不同供應商的前沿裁判——GPT-5.6-sol、Claude Opus 5、Grok 4.5——在 RewardBench 上的準確率為 91–93%,ρ̄ = 0.56 [0.42, 0.68],有 n_eff = 1.41 個有效投票(共 3 位),共同失敗的頻率是獨立性預測的 7.7 倍(Pr[B fails | A fails] = 0.64,邊際機率為 0.083)。依配對類別拆解(表 8)後,跨供應商前沿模型配對的相關性為 0.42,幾乎等同於三個同屬一個供應商的 Gemini 模型之間測得的 0.40——這是 Kohli 發現「供應商不是降低相關性的變數」的第二個獨立實例(Kohli 的同家族為 0.437/0.435,跨家族平均為 0.389,差距 +0.047,方向相反但量級相同;本文則在不同任務與較新一代裁判上得到跨供應商 ≥ 供應商內部的方向)。以開放權重群組測得的題目難度進行調整後,前沿模型配對的相關性幾乎不變(RewardBench 上由 0.465 變為 0.467),因此共同難度也無法解釋;這和 Kohli 及下方部分回答的開放問題所提出的「不是世代差異,也不是難度」一致,只不過現在是在 GPT-5.6-sol/Opus 5/Grok 4.5 上重現,而非 GPT-4o/Sonnet 4.5/Gemini 2.5 Pro。
Kuai 和 Kohli 都未執行的機制測試:偏好最佳化是否造成前沿模型層級的依賴? 研究者為每個基礎模型訓練一個 GRPO QLoRA adapter(三個開放權重模型,強制選擇協定相同,訓練前後的題目與候選項位置一致),結果為 Δρ̄ = −0.021 [−0.035, −0.007]——GRPO 微調讓錯誤相關性略微降低,而不是升高;平均準確率則只變動 0.7 個百分點。DPO 沒有顯著效果([−0.014, +0.002])。兩種訓練後的群組相關性都遠低於前沿群組的 0.32–0.60。研究明確限定結果範圍(訓練 100 步 GRPO、單一種子、三個基礎模型,且 adapter 使用的校準資料並未完全留出),但這是整份資料中首次嘗試測試「為何前沿裁判的相關性更高」的特定因果假說,結果否定了最簡單的候選機制:光靠偏好最佳化,無法重現或解釋前沿層級的依賴。
本文提出、Kuai 與 Kohli 都未指出的情境差異。 ρ̄ 與 n_eff 可能朝相反方向變動,取決於錯誤如何分布:當一個易受影響的裁判子群在對位置敏感的題目上共同失敗時,加入更多這類失敗會降低整體群組測得的相關性(ρ̄ 0.22 → 0.08,表面上的 n_eff 卻從 3.4 上升至 6.0),即使多數決精確率正在下降——「群組看似更加獨立,多數決判斷卻越來越不可靠。」這項發現導出的情境配對篩選方法(針對共享錯誤「整體共同失敗」的 CorrFilter,以及針對集中式「脆弱子群組失敗」的 Bias-Cluster),完整介紹於 Weak-Verifier Ensembling,因為它屬於理解依賴後進行的聚合方法,而非依賴測量方法。
三種工具,三種不同的依賴關係#
目前語料庫裡有四種方法可以用來詢問模型的錯誤是否彼此獨立,而它們不能互換。把這些構念區分開來,正是同時擁有這四種方法的最大價值。
| 測量對象 | 需要 ground truth | 需要外部錨點 | 可識別嗎? | |
|---|---|---|---|---|
| Yang 的類內 ρ (LLM-Judge Validation) | 評審的判定,取自投票矩陣 | 否 | 否 | 可以,但無法說明評審們對什麼達成共識 |
| Sunkavalli 的 ρ_k (Weak-Verifier Ensembling) | 評審的分數,以共變異數表示 | 否 | 是,至少 2 個錨點 | 僅在分數為連續值且整個評審團沒有共同殘差時成立 |
| BEI / CIG(本頁) | 模型的答案,以失敗流形為準 | 是 | 否 | 可以,依定義即可識別 |
| Kohli 的 Kish n_eff(本頁) | 評審的判定,取自評審團自身的錯誤矩陣 | 是(100 位標註者的多數決) | 否 | 只對它唯一要做的事可識別——把 φ̄ 轉成預測的多數決準確率 |
這項取捨很明確,值得直說。Sunkavalli 的識別障礙之所以存在,是因為評審共變異數 K = σ_t² + σ_c² 把訊號與共同錯誤混在一起,而評審團內沒有任何統計量能將兩者拆開——高度一致既可能代表評審團判斷正確,也可能代表他們一致判錯。BEI 和 CIG 不會遇到這個障礙,因為 ground truth 能替它們拆開兩者:以 Y = 1 為條件會排除所有「因為正確而一致」的情況,因此留下的依定義就是共同錯誤;而難度反應擬合則提供了共變異數方法必須估計的虛無模型。代價是,這種方法只適用於答案能客觀驗證的情況——論文在第一句實驗描述中就明白指出這點——因此不適用於評審團最常被使用的開放式生成任務;而 Reference-Free Judge Over-Crediting 所述的共同潛在合理性失效,恰恰就在這類任務中發生。
第二個差異在於對象。Yang 和 Sunkavalli 衡量的是評審之間的依賴關係。Kuai 等人衡量的是模型作為答題者時彼此之間的依賴,再用它來預測這些模型會如何被評判。因此本頁能與 Same-Model Review Blindness 和 Agent Behavioral Homogeneity 連結,也因此依賴關係重新加權的數據弱於稽核數據:重新加權需要答題者端的依賴關係能良好代表驗證者端的依賴關係,而本文沒有檢驗這一步。
語料庫缺少的正是第四列,如今已補上。 Yang 的 ρ 根據評審團自己的投票來估算評審團的表現,但無法說明評審們對什麼達成共識;Sunkavalli 的 ρ_k 能將訊號與共同錯誤分開,但需要外部錨點,而且在序位分數下無法成立;BEI/CIG 透過 ground truth 取得可識別性,但只適用於答案可驗證的情況,且測量的是模型作為答題者時的表現。Kohli 的 n_eff 在實際情境中衡量評審團——真實評審、真實判定、不需錨點——代價是需要與 ChaosNLI 每個項目 100 次標註同樣昂貴的 ground truth,且測量的是原始相關性,自身沒有虛無模型(虛無模型位於下游的 Condorcet 模擬中)。四者之中,只有它能直接把依賴關係轉換成實務工作者關心的數字:評審團少了多少個準確率百分點。
論文指出的限制,以及一項未提及的限制#
論文明確指出:此框架僅處理成對依賴關係(不包含更高階依賴);CIG 是為 MCQ 定義,因此 MATH-500 測試的是遷移能力,而非重新估計;稽核辨識的是關聯性,而非因果來源;實驗僅使用英文;此外,這句話應與本文每個數字一同引用——「由於模型 API 和對齊流程會持續演進,估計出的依賴結構不應被視為永久的模型屬性。」 糾纏圖是某個日期下、一組端點的快照,而不是權重本身的屬性。
論文未提及的是:模型名單橫跨大約三個世代(Llama-2-70b 和 Qwen1.5,以及 GPT-5、Claude 4.6 Sonnet 和 Gemini-3.1-Pro),而 BEI 圖的最高層全是最老、能力最弱的一群。難度條件化本應處理能力差異,但 d_t 是從其他 16 個模型估計出來的,所以對一對能力都弱的模型而言,擬合出的 p_m(d) 在各處都偏高,殘差幾乎只能是正值。Zhu 指出的發布日期混淆——基準測試分數矩陣的主要因子追蹤發布日期,R² = 0.505——在整體軸線上也構成相同風險;目前沒有人檢查,將範圍限制在單一發布時段後,失敗流形版本的結果是否仍然成立。
延伸閱讀#
- LLM-Judge Validation — 本文補充的評審端測量方法。Yang 的類內 ρ = 0.66–0.97 是從投票矩陣讀出,並將評審團人數轉換為預測的評審團準確率;但它無法說明評審們對什麼達成共識。BEI/CIG 回答的是另一個問題,採用更嚴格的虛無模型並要求 ground truth,且從另一側落在該頁自己的測量軸上:評審對特定目標的過度認可程度,與它和該目標的糾纏程度相符,因此評審的鑑別力是評審與目標配對的屬性,而非評審本身的屬性
- Weak-Verifier Ensembling — 直接的下游應用:對糾纏程度加上懲罰的集成權重,也是語料庫首次嘗試回答該頁開放問題所提出的「為依賴關係定價」。目前結果令人不利於這項前提,而非方法本身——相較於僅按能力加權,懲罰只多出 0.1pp。此文也是 Sunkavalli 估計器的出處;這項工具透過要求 ground truth 而非錨點,繞過了它的識別障礙
- Reference-Free Judge Over-Crediting — 本文測量的正是該機制在人群層面的形式。Zhou 的 Proposition 2 指出,共同的潛在合理性軸線會使每種單調聚合規則都坍縮成該軸線上的門檻;BEI 和 CIG 則在虛無模型與 FDR 控制下,測量整個群體的錯誤實際共享多少結構,而非只看原始成對 φ。兩者都認為模型譜系是代理變數,而非實際變數:Zhou 的跨家族評審共享同一個吸引區,而 CIG 的跨家族配對也達到顯著
- Same-Model Review Blindness — 用更好的工具測量同一個設計變數。Greptile 的路由規則(「偵測作者,再轉給其他供應商」)假設家族成員身分會讓檢查者失明;本文測量底層數值後發現它會跨越供應商界線,因此「不同供應商」只是「已解除糾纏」的廉價代理,而像 Claude-4.6-Sonnet ↔ GPT-5 這類 CIG 配對便顯示它可能失效
- Agent Behavioral Homogeneity — 以虛無模型而非軼聞衡量相同屬性。該頁的證據來自單一實驗室對自家模型所做實驗的收斂次數;本文則測試來自六家供應商的 18 個模型是否符合條件獨立性,並採用 FDR 調整後的 q 值;這也是語料庫首次從異質性帳冊的效益面切入:跨開放/封閉權重界線混合模型,所產生的顯著糾纏配對少於同一層級內的混合
- Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus — 第三種 n_eff 工具,使用不同模型庫與 Kohli 的方法交叉驗證(10 個開放權重評審,n_eff = 3.51/10),並提出新的推論:相關投票會使合併與成對顯著性檢定的結論,在最多 28% 的重抽樣比較中翻轉。這也是語料庫首次對前沿模型依賴關係的特定機制做因果檢驗(GRPO 微調只會略微降低依賴,無法解釋它),並且是 Weak-Verifier Ensembling 中 CorrFilter/Bias-Cluster 同制度匹配篩選器的來源
- LLM-as-a-Judge — 兩篇論文共同界定的實務做法。Kohli 的結果是語料庫中最明確的表述:在全部三個 NLI 資料集和 RewardBench 上,最佳單一評審的表現與九人評審團相當或更佳;九次逐一移除中有六次會提高評審團準確率;評審團對自身一致判定項目的 90.9% 準確率,代表錯誤率為 9.1%,而獨立性模型預測的錯誤率約為 0.02%——因此「採用評審團」和「相信一致判定」買到的都是冗餘,而非可靠性
- Benchmark Score Redundancy — 同一事實在整體分數上的版本。如果模型在個別項目上的失敗彼此糾纏,模型 × 基準測試分數矩陣會因為從項目層級開始的因素而呈現低秩;而 Zhu 發現的發布日期混淆,正是本頁這組混合不同世代的名單所帶有、卻尚未檢驗的風險
- Multi-Agent Collective Intelligence — 以正式形式呈現的一般機制:增加寬度只能平均每個代理程式的獨立項,因此群體共有結構形成一個不會因規模擴大而降低的下限。BEI 測量的就是超出這個下限的共同失敗
- Item Response Theory for LLM Benchmarks — 本頁測量的依賴關係,在這裡未被建模:以數千個社群微調模型(源自少數幾個基礎模型)校準的 IRT 題庫,將它們視為彼此獨立的受試者,因此每個難度與鑑別度參數都是相對於糾纏的群體所定義,而只包含前沿模型的群體則會重新調整其尺度
開放問題#
- 論文報告使用三位評審,但 Spearman 的自由度顯示實際上是兩位(MMLU-Pro 上 n = 34 = 2 × 17,MATH-500 上 n = 26 = 2 × 13;若有三位評審,數值應為 51,p ≈ 1.4 × 10⁻⁴,而非報告的 0.002)。標題所述關聯分析中少了哪位評審?其方向是否相同?作者只要用一句話說明,或提供 ΔPrec 的逐評審分解,就能解決此問題。
- 當驗證者池夠大、冗餘開始產生影響時,糾纏懲罰是否有幫助?相較於僅按能力重新加權,+0.1pp 的結果是在
M_J = 3時測得,此時R_m只對另外兩位驗證者取平均,指數懲罰幾乎沒有可區分的空間。可證偽的檢驗方式是:在M_J= 5、7、9 時重新執行加權,並回報糾纏與能力加權的差值如何隨池大小變化——若曲線平坦,方法就失去立足點;若曲線上升,才是論文真正的結果。 - BEI 圖測量的是糾纏,還是模型世代差異?前 10 組配對全是 2023–2024 年的 Llama 和 Qwen 模型,完全沒有前沿模型配對;而且難度是從其他 16 個模型估計,因此一對能力都弱的模型,其擬合失敗機率在各處都偏高。將名單限制在單一發布時段(或如 Zhu 處理分數矩陣那樣,先對錯誤矩陣的發布日期效應取殘差),便能看出家族內訊號是否仍然存在。部分問題已由 Kohli 於 2026-09-22 從側面回答,而非正面檢驗。他的九位評審全是目前的前沿端點,沒有跨三個世代的差異;評審團仍呈現 φ̄ = 0.391,且相關性最高的三組配對全都跨家族(Claude × Gemini 0.603、GPT-4o × Claude 0.588、Mistral × DeepSeek 0.564),同家族額外相關性僅 +0.047。因此,在單一發布時段的名單中,依賴關係並未消失,也不依模型譜系形成組織,這項證據不支持將 BEI 家族內最高層解讀為世代差異。但這並非本項目要求的實驗:工具不同(原始判定層級 φ,而非難度條件化的超額共同失敗)、任務不同(NLI 分類,而非 MMLU-Pro),且評審團完全沒有開放權重層級——因此它能說明的是跨家族結果在限制世代後仍然成立,而非 BEI 的家族內排名會如何變化。Hossain、Yousefi 與 Lim 於 2026-09-25 再次提供佐證,採用第三種工具和第四份評審名單:GPT-5.6-sol、Claude Opus 5 和 Grok 4.5 全是目前的前沿端點,沒有世代差異;跨供應商平均錯誤相關性(0.42)在統計上與 Gemini 供應商內模型庫的相關性(0.40)無法區分,而且控制共同題目難度後差距仍然存在(0.465 → 0.467)。三個獨立團隊、三種工具(BEI/CIG 的難度條件化超額共同失敗、Kohli 的 Kish n_eff、本文的 Ledoit-Wolf ρ̄)、三份評審名單,方向一致:供應商界線無法預測前沿評審之間較低的錯誤相關性。直接回答原問題的實驗——在限制為單一發布時段的 Kuai 名單上重新執行 BEI——仍未進行。
資料來源#
- A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges — Chenchen Kuai、Jiwan Jiang(同等貢獻)、Zihao Zhu、Hao Wang、Keshu Wu、Zihao Li、Yunlong Zhang、Chenxi Liu、Zhengzhong Tu、Zhiwen Fan 與 Yang Zhou(通訊作者),A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges,arXiv 2604.07650 v2(2026-08-09),19 頁,獲 COLM 2026 接受;Texas A&M University (1)、Marquette University (2)、University of Utah (3)。
empirical,保留原等級。本文引用 §3.1(留一配對難度估計器、條件獨立虛無模型、易度加權 BEI 與 Proposition 1)、§3.2(以 add-one 平滑計算干擾項目吸引力、方向性虛無模型、surprisal 加權 CIG)、§3.3 與 §B.4(重新加權設計及其校準/評估切分)、§4.1(模型名單、兩組互不重疊的 1,000 題 MMLU-Pro 子集、三位評審、5-shot temperature-0 流程)、§4.2(Table 1、Table 2、糾纏圖解讀與因果免責聲明)、§4.3(Table 3)、§5(限制)、§B.1(18 個模型清單),以及 Appendix C(Tables C.1–C.4)。 - 證據處理。
empirical判定正確:以真實 API 端點測得的錯誤矩陣、明確說明的虛無模型、搭配 Benjamini–Hochberg FDR 控制的 Monte Carlo 推論、干擾模型的校準診斷,以及下游方法的校準/保留集切分。此等級須附帶兩項適用範圍限制。關聯性分析部分僅根據約 34 個(MMLU-Pro)與約 26 個(MATH-500)觀測值;論文未報告此數字,而本頁是從(ρ, p)配對反推而得——在此樣本數下,BEI/CIG 與基準指標間所有宣稱的差異都落在重疊的信賴區間內,只有方向、顯著性與跨基準測試遷移結果能成立。緩解方法部分的主要結果是拿錯基準比較:在 500 道保留題目上,準確率高於多數決 +3.5pp,換算成準確率校準後重新加權,只比上方一列報告的結果多 +0.1pp。COI:無法識別——學術團隊與供應商沒有關係,稽核 18 個第三方端點,包含四家供應商的前沿模型;目前擷取版本未見經費聲明。 - 解析註記。由 PDF 擷取(docling 2.126.0 / docling-mlx 0.1.1,19 頁、7 張表、4 張圖片、公式引擎 mlx、rapidocr)。匯入工作程式的
verify.py回報warn,並在確認表格調和前停止作業,因此七張表均在編譯時重新比對pdftotext -layout:Tables 1、2、3、C.1、C.2(10 列)、C.3(9 列)與 C.4(2 列)逐格一致,沒有漏列、位移或黏合。唯一標記的儲存格是 Table C.4 的7.6 × 10 - 5;兩種解析器都以相同方式拆開此科學記號數值,並非儲存格合併。兩項 PDF 層級瑕疵同時出現在兩份解析結果中,並非 docling 造成:Llama-3-70B 寫成Llama-3 1-70B,v2.5 的 DeepSeek 寫成DeepSeek-chat-v2 5(小數點遺失)。沒有AI→Al的 OCR 誤讀(唯一的Altoken 是參考文獻中的姓氏「Al-Dahle」)。Figure 2(兩張糾纏圖)在編譯時讀取,並以算術方式確認其 18 個節點符合 Appendix B.1 名單(4 個 GPT + 3 個 Claude + 3 個 Gemini + 4 個 Llama + 3 個 Qwen + 1 個 DeepSeek);Figure 3 的權重熱圖則用來檢視能力主導的觀察。值得留意的引用錯誤:Gemini-3.1-Pro 引用的是 Team 等人 2023 年的資料,GPT-5 引用的是 2025 年系統卡,因此參考文獻未能指出實際使用的端點。 - Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus — Elias Hossain、Niloofar Yousefi 與 Ser-Nam Lim,University of Central Florida,Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus,arXiv 2609.22512(2026-09-18),50 頁,未註明發表場域。
empirical,保留原等級。本文引用 §2.1(Ledoit-Wolf 收縮錯誤相關矩陣、n_eff 與特徵值有效秩)、§3(十位評審的開放權重模型庫,以及 RewardBench/UltraFeedback/PKU-SafeRLHF 校準集)、§4.1 與 Table 9(主要 ρ̄/n_eff 結果及合併與成對顯著性檢定、Figure 2)、§4.2 與 Tables 1、7、8(前沿模型庫相關性、跨供應商與供應商內的分解、7.7× 共同失敗提升、難度調整檢查)、§4.3 與 Table 2(GRPO/DPO 強制選擇比較)、App. F.3(73 個子模型庫的穩健性掃描),以及 App. M.4(標籤雜訊敏感度檢查)。 - 證據處理。
empirical判定正確;對三位作者的學術論文而言,證據格外完整:三個彼此獨立的偏好資料集上使用真實 API/本機推論評審投票、明確說明採用 Ledoit-Wolf 收縮估計器而非原始樣本相關性、全程使用項目層級(而非投票層級)自助法信賴區間、預先註冊的多樣性對比假設,且論文報告結果未達標(RewardBench 上,模型家族和提示風格對比都未達預先註冊的 Δ ≥ 0.10 門檻),並設有適用範圍條件章節,明確列出無法遷移的部分(App. M.1–M.3:整體/子群制度是受控介入,其自然發生率未知;深入評估的共同弱點只有位置偏差;ρ̄/n_eff 數值不應假設能遷移至組成不同的模型庫)。COI:無法識別——學術團隊未揭露與供應商的關係,評估的是由團隊本機執行的第三方開放權重模型,以及三個其不具競爭利害關係的專有前沿評審(GPT-5.6-sol、Claude Opus 5、Grok 4.5);匯入資料中未擷取到經費聲明。 - **解析註記。**由 PDF 擷取(docling 2.126.0 / docling-mlx 0.1.1,50 頁、30 張表、9 張圖片,版面與表格引擎
mlx、rapidocr、confidence_grade: excellent)。Table 3(§4.4,弱依賴/易受影響子群篩選器的精確率比較)儲存格遭合併:依編譯器提示詞所記錄的失敗模式,三列「Weak dependence」(5%/10%/20% 標籤反向)合併成一個格列,因此 Supermaj. 欄顯示0.980 0.956.901(.901前漏了一個0),CorrFilter 欄顯示0.976 0. 0.,而948和891被擱在後續列。已與 Table 15(§F.6,「在匹配保留率下弱依賴介入中的篩選精確率」)比對修正;該表以轉置且未合併的方式呈現相同實驗:5%/10%/20% 下 Naive/Supermajority = 0.980 / 0.956 / 0.901,CorrFilter (clean R) = 0.976 / 0.948 / 0.891——與合併儲存格片段完全一致,也符合正文的轉述(「CorrFilter 和 Bias-Cluster 的精確率都比超多數決低 0.4–1.8 個百分點」:5% 時分別低 0.4pt/0.7pt,10% 時低 0.8pt/1.1pt,20% 時低 1.0pt/1.8pt;與 Table 3 未合併的 Bias-Cluster 欄 0.973/0.945/0.883 相較,三欄結果彼此吻合,也符合正文)。以上其他引用表格均無需調和:Tables 1、2、7、8、9 和 14 均直接讀取,交叉引用(例如 Table 1 的 Open (all) n_eff = 3.75 與 Table 9 的 3.51——兩者採用不同子集,分別為 400 與 1,133 組配對,圖說均有說明)皆無需修正。 - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels — Guneet Kohli(單一作者,Apple),Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels,arXiv 2605.29800(2026-05-28),14 頁、12 張表、5 張圖,未註明發表場域。
empirical,保留原等級。本文引用 §3.1–3.2(ChaosNLI 抽樣及 9 位評審/7 個家族的名單)、§3.3(Kish 與特徵值 n_eff、自助法)、§3.4(考量項目的 Condorcet 虛無模型)、§3.5 與 §4.3(分層置換檢定)、§4.1–4.2(Table 2、Figure 1、落差及其難度分解)、§4.4(Table 8、擴展曲線與 1/φ̄ 漸近線)、§4.5(Table 3)、§4.6(Table 4、RewardBench、思維鏈)、§5.1–5.4(Tables 9、10、5 和 11;同家族/跨家族比較與 Figure 3)、§6(n_eff/k < 0.5 規則)、限制,以及 Appendices B、E、G、I、J 和 K。 - 證據處理。
empirical判定正確,且單一作者論文的證據支持格外完整:9 個真實 API 端點 × 4 個資料集 × 5 種條件、明確說明的虛無模型、保留各評審錯誤率與難度結構的分層置換檢定、自助法信賴區間、Condorcet 估計的分半交叉驗證(過度擬合比率 0.960–1.000)、樣本數收斂檢查,以及有文件記載的平手決勝穩健性檢查(將全部 28 個黃金標籤平手結果反轉,評審團準確率變動 ≤ 0.7pp,n_eff 變動 ≤ 1.3%)。此等級須附帶三項適用範圍限制。人類比較對象是模擬值:Table 3 的人類 n_eff 4.03–5.79,支撐論文「人類評審團的獨立性約高出兩倍」的主張;此數值是根據可交換性假設(論文自身的註腳),從整體 ChaosNLI 分布為每個項目抽取 10 個標籤而得,並非測量 100 位真實標註者——應將它視為參考線,而非實測值。自助法信賴區間涵蓋的是項目,而非評審(§3.3 明確說明):另一組九模型評審團可能得到不同結果,且沒有量化評審選擇的不確定性。四項任務全是分類或二元偏好判斷;作者指出開放式生成與程式碼審查尚未測試,而評審團恰恰常用於這些情況。COI:在支持此發現的方向上,無法識別利益衝突——Apple 沒有推出該評審團中的任何模型,而這項結果對所有有模型入選的供應商都不利,包括論文揭露使用的寫作輔助工具 Claude。 - **解析註記。**由 PDF 擷取(docling 2.126.0 / docling-mlx 0.1.1,14 頁、12 張表、5 張圖片,版面與表格引擎
mlx、啟用公式增補、rapidocr、confidence_grade: excellent)。兩次匯入驗證皆回報ok,真實(非退化)樣本的 canary-recall 為 14/14。匯入時已將全部 12 張表與pdftotext -layout比較,其中 11 張完全吻合;Table 3(跨資料集,p6)已原地修復——docling 將「Task type」與「n_eff (Kish)」列標籤黏合,並把 MNLI 欄拆到兩列;修復記錄於 raw 檔中的> [!note]區塊。本頁引用的每張表均已在編譯時獨立重新調和:Tables 1、2、4、5(第 4–8 頁)與 Tables 6、7、8、9、10、12(第 12–14 頁)逐格符合pdftotext -layout;修復後的 Table 3 也已重新對照第 6 頁和 Table 2 的 MNLI n_eff 驗證。列數算術檢查無誤:Table 6 有 11 列,圖說漏列一個n < 5的區間;Table 10 的分類加總為 1,000(476 + 359 + 165);Table 12 的三種分解各自加總為 51;Figure 1 的十根長條加總為 1,000(290 + 140 + 103 + 108 + 68 + 69 + 65 + 61 + 45 + 51)。沒有 en-dash 毀損、範圍黏合或AI→Al誤讀。依圖片雙階段規則讀取圖表:Figure 1(錯誤直方圖,轉錄並加總長條標籤)、Figure 2(擴展曲線——確認1/φ̄ = 2.6漸近線及最小值–最大值帶)、Figure 3(9×9 phi 矩陣——「0.46–0.60 的緊密五供應商區塊」解讀來源,正文未提及)、Figure 4(各區間 Condorcet 落差,與 Table 6 資訊重複)。Figure 5(樣本數收斂)已有 Appendix F 正文完整描述,無需另行使用。
Cited by 13
- Weak-Verifier Ensembling×8
Cross Model Error Entanglement — the dependence measured from the other side, with a null model and…
- LLM-Judge Validation×7
Finding C's reporting rule is a good rule with a missing half: it tells you to report a correlation…
- Agent Behavioral Homogeneity×6
Cross Model Error Entanglement — this page's property tested against a null instead of counted: 18…
- Reference-Free Judge Over-Crediting×4
A fourth measurement, on ordinary judging with no optimizer and no manufactured errors, lands on…
- Same-Model Review Blindness×4
Cross Model Error Entanglement — the variable this page's vendor-routing prescription is a proxy…
- Open Questions Backlog×2
Cross Model Error Entanglement ×2 (oldest 7d) — The paper reports three judges and its Spearman…
- Benchmark Score Redundancy
Cross Model Error Entanglement — the redundancy's microstructure, one level below the score matrix.…
- The Price of Mixing Agents, and the Principal Nobody Counted
Postscript, 2026-09-22: the benefit side is no longer empty, and the first coefficient is negative.…
- Item Response Theory for LLM Benchmarks
Cross Model Error Entanglement — the measurement of the assumption this page says nobody tests: IRT…
- LLM-as-a-Judge
The standard hedge against the judge-dependence property above is to stop picking one judge and…
- Evals & Benchmarks
Cross Model Error Entanglement — Three 2026 audits of whether LLM errors are independent, measuring…
- Multi-Agent Collective Intelligence
Cross Model Error Entanglement — Proposition 1's non-averaging term, measured on real models…
- Open Questions Dashboard
Cross Model Error Entanglement: Is the BEI graph measuring entanglement or vintage? Its top 10…
Related articles
- Weak-Verifier Ensembling
Weaver (Stanford, 2025): stop training a better verifier and combine the imperfect ones you have — normalize a heteroge…
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
- LLM-Judge Validation
UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…
- Reference-Free Judge Over-Crediting
Reference answers are a first-order determinant of LLM-judge verdicts: without one, judges systematically over-credit w…
- The Price of Mixing Agents, and the Principal Nobody Counted
Joint answer to two #oq/now items about what a population of agents does that no single agent does. (1) No variance-vs-…
