資料來源#
- A Closed-Form Estimator and Diagnostic Battery for Anchor-Judge Error Correlation, Under a Single-Common-Factor Model
- Agentic Misalignment in Summer 2026
- Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident
- Building Prod with Jev and LangGraph
- CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation
- Claude Opus 5 System Card
- Commitment To Cooperation With Self-Negotiated Contracts
- Democratizing Agent Deployment Safety: A Structural Monitoring Approach
- DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity
- Driving the Agent Quality Flywheel from Your Coding Agent- Google Developers Blog
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT
- Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set
- NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities
- Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
- OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
- Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science
- User awareness in frontier models
- What Types of Code Review Comments Do Developers Most Frequently Resolve?
- When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
摘要#
LLM-as-a-judge 是一種評估範式:由一個語言模型根據明確準則,替另一個模型的輸出評分——用來取代人工評分者,或在沒有確定性標準答案的開放式任務中擴大評分規模。它是評估所有「這份輸出好不好?」問題的主力工具:深度研究報告、長篇生成、代理式對話紀錄、對齊行為。DRACO(Perplexity,2026)是本文採用的實例,但這項基本方法也反覆出現在整個 wiki 中——從 Anthropic 的對齊稽核到 DeepMind 的證明搜尋適應度。
DRACO 評分協定(標準形式)#
對每項任務,裁判會依據一份任務專屬評分規準,以加權準則評估輸出。每項準則:
- 裁判給出二元判定——MET 或 UNMET——並附上簡短的理由。
- 分數依權重彙總:達成的準則貢獻其權重
wᵢ(未達成則貢獻 0);權重可以是負值,用來懲罰不理想的特性(錯誤聲明、缺乏支持的主張)。
報告兩個數值:
- 正規化分數 =
max(0, min(1, raw_score / Σ max(0, wᵢ))) × 100%——依準則重要性加權。 - 通過率 = 正權重準則達成且負權重準則未達成的比例——不加權,因此較不受權重主觀性的影響。
二元判定加權重彙總的設計,讓每次判斷都局部且可解釋;因此,信任的單位是評分規準,而非裁判的整體印象。
評分規準從何而來——作為測量工具的評分規準庫#
如果評分規準是信任的單位,DRACO 找來 26 位專家要回答的問題就是:哪些準則應該納入? CalibratedRubric(Chen 等人,FinStep + StepFun,arXiv 2607.29252,2026-07-31,empirical)是 vault 中首個探討這個上游環節的來源——不是裁判如何套用準則,而是準則如何取得入選資格。它將候選集合視為既定(「不依賴生成器,但無法找回候選集合中不存在的構面」),只最佳化哪些評分規準能留下、需要多少個,以及如何加權。
它的重要貢獻,是提出一種三分法,而現有領域篩選方法會把這幾者混為一談:
- 可測量性——具備能力的評分者能否一致地套用這項準則?以裁判間一致度觀察。
- 資訊性——它能否區分正在排名的系統?以 IRT 題目資訊量觀察。
- 效度——它測量的是否真是我們想測的東西?論文明確指出,可測量性「是實質專家認可的必要條件,但不是充分條件」,也不聲稱能提供效度。
它所擴充的共識流程(FinResearchBench II)將前兩者壓縮成兩條硬性規則——只有在所有裁判對每個系統都一致同意,且彙總標記並非恆定時,才保留一項準則。研究顯示,這兩者都是所要近似的受限最佳化問題的粗略替代方案。
一致同意的流失率隨排行榜規模呈指數增加,且無法辨別評分規準品質#
在裁判錯誤率 ε 同質的情況下,Pr(unanimous) = [(1−ε)^K + ε^K]^M = ρ(ε,K)^M。這個式子中完全沒有題目鑑別度參數——所以此篩選器「以相同速率任意刪除有資訊和沒有資訊的準則,而且排行榜越大,情況越糟。」以已發表的基準保留率校準(K = 3、M = 10 時為 25.52%,⇒ ρ = 0.872、ε̂ ≈ 4.5%),外推後得到:M = 20 時保留率約 6.5%,M = 40 時約 0.4%。以 843 項 FinResearchBench II 準則、完整三裁判面板繪製的實證曲線,估得 ρ̂ = 0.880(R² = 0.85、ε̂ = 4.2%),m = 10 時實測保留率為 27.3%,接近已發表數值。
這篇論文值得帶走的結論是:排行榜規模增加時,保留率會下降,但可區辨性會上升,因此共同黃金評分規準率對系統數量呈非單調變化,並在 m = 4 時達到最高點。依共識導出的評分規準集合,取決於它所依據的面板——加入系統後,「黃金」準則集合便會改變,即使準則品質保持不變。
變異數篩選器是看不見能力的特例#
δ_disc = 1[Var(ȳ_·j) > 0] = 1[Î_j > 0],其中 Î_j = a²p̂_j(1−p̂_j)——也就是說,假設鑑別度相同且忽略系統能力時,這個二元篩選器就是以零為門檻的資訊選擇。它無法替留下的項目排序、區分符合能力的反應模式與異常模式,也無法針對難度篩選。在異質輸出上,它也很脆弱:保留了零項高風險題目與四項創意題目。
替代方法#
- 可測量性 → Beta–Bernoulli 後驗分布。
q_j | Y ~ Beta(1 + n_agree, 1 + n_total − n_agree);當後驗平均值超過 τ_c 時保留。這是軟性篩選,不要求字面上的一致同意,且不需要人工標記或保留集黃金裁判。 - 資訊性 → 將 IRT 題目資訊量,依實際受評系統的擬合能力密度積分,再以次模覆蓋效用
U(S) = Σ_g π_g log(1 + I_S(θ_g))貪婪組合。凹性帶來標準的 (1 − 1/e) 貪婪保證,而對數會折減已涵蓋能力區域的貢獻——無須明列懲罰項便能實現多樣性。 - 兩者刻意分工:可測量性僅作為可行性限制,資訊量僅決定權重(
w_j ∝ ν_j),「因此不會重複計入可測量性。」
實測結果。 τ = 0.80 的可測量性篩選,將 JudgmentBench 上與人工黃金標記的一致度由 κ 0.604 提升至 0.743,並將 FinResearch 決策支援的一致度由 0.8513 提升至 0.9708、證據推理由 0.8829 提升至 0.9732。它移除的是不可靠的評分規準,而非單純縮減涵蓋範圍——可測量性最低與最高四分位的平均 κ,決策項目分別為 0.498 與 0.983,證據項目則為 0.556 與 0.953。IIF-Greedy 在全部六個反應區塊的交叉擬合排名忠實度 AUC 都勝過隨機選擇;在 FinResearch 決策支援中,以49 項而非 131 項評分規準達到目標排名相關性(證據推理為 28 項對 51 項;其餘區塊則為 43–273 項對 142–1,226 項)。由於新系統之後只需依據評分規準庫評分,而非整個候選集合,反覆對全部候選項評判的工作就能轉為一次性的校準成本。
三項必須與這些數字一併說明的限制#
-
貝葉斯部分至少需要 3 位裁判。 若只有兩位裁判,一致同意就等於成對一致,因此完全沒有獨立的評分規準層級訊號——HealthBench 和 HelloBench 都只有兩位裁判,結果顯示完全沒有提升。摘要本身也保留了但書:「校準效益取決於裁判數量是否足夠。」
-
次模組合勝過的是隨機選擇,不一定勝過純 IIF。 相較不受限的隨機選擇,它在每個區塊都勝出;但相較單純依 IIF 排名前 B 的方法,只有 FinResearch 的兩個 15 系統區塊呈現顯著提升(+.0057 [.0034,.0079] 和 +.0080 [.0059,.0101])。新穎的覆蓋機制只在排行榜規模較大時得到證據支持,並非普遍成立——論文有說明這點,而摘要所稱「六個區塊皆有提升」(相較隨機選擇)則掩蓋了這項限制。
-
在標題數字所測量的地方,這套機制的證據恰好最薄弱。 在由 LLM 評判的 FinResearch 區塊中,後驗可測量性與一致度的相關為 r = 0.589 / 0.558;但在提供 0.604 → 0.743 標題數字、黃金標記由人類提供的 JudgmentBench 區塊中,相關僅有 r = 0.127。JudgmentBench 每個實驗組的絕對排名忠實度都很差(Greedy AUC .315,隨機組 .205),而且只有9.81% 的輸出配對能被區分。論文自己的說法最為誠實:IRT 得到的支持是「作為評分規準壓縮與不確定性報告機制,但不能證明 2PL 模型可普遍識別或評判沒有偏誤。」
-
論文指出的裁判相關性威脅,在它自己的觀察條件下無法測量。 附錄 B.5 的 A3 承認,相關的 LLM 裁判會威脅一致度後驗分布,並指出尚未測量;Sunkavalli(arXiv 2609.08826,2026-09-08,僅對模擬和診斷屬於
empirical)顯示,實際限制比這段承認看起來更嚴重。裁判面板的共同錯誤占比,只有相對於外部錨點才能識別——面板自身的裁判間共變異σ_t² + σ_c²只以一個數字呈現品質與共同錯誤;而且,若裁判與錨點都採序位或二元尺度,無論錨點數量多少,都無法識別污染參數。這是 Jacobian 秩的結果,已在m ∈ {2, 3, 4, 6}下驗證;研究明確列出不同參數化,讓相同觀察相關性對應到差異極大的污染程度。z_j是以二元裁判一致度建構的 Beta–Bernoulli 後驗,因此正屬於這種情況:再多裁判或題目,都無法分辨「這些裁判一致是因為題目可測量」與「這些裁判共享偏誤」。只有使用連續評分的錨點(≥ 3個)才能識別,而評分規準庫並沒有這種錨點。參見 Weak-Verifier Ensembling 與 LLM-Judge Validation。
拒絕替無法區分的項目排名。 有一項設計可獨立於其餘方法沿用:按查詢分層的題目自助抽樣,為每個系統的能力估計百分位數區間,而若相鄰系統的差異不顯著,就將它們合併成同一級別。FinResearch 區塊在 15 個系統中辨識出四級和六級;六系統轉移區塊則合併成一級或兩級。參見 Measuring Beyond Accuracy Saturation。
自適應評分規準的變體:Google 的 AutoRaters#
Google 的 Gemini Enterprise Agent Platform AutoRaters(與 Google DeepMind 共同開發;也是 Agent Quality Flywheel 的評分引擎)將基本方法從固定任務評分規準擴展為適用於多輪代理程式、依個案調整的評分規準:裁判從對話中擷取使用者意圖,針對個案生成評分準則,依每項準則驗證完整對話軌跡,再對多個樣本進行多數決。兩項經驗可延伸至 Google 技術堆疊以外:
- 看變化量,而非絕對值。 Google 自家的指引呼應了 DRACO 從供應商角度提出的裁判依賴性發現:將分數視為強而有力的方向性訊號,「相信不同執行結果之間的變化量,勝過將任何單一數字視為絕對評分。」
- 自適應評分規準能偵測問題,卻無法將問題獨立衡量。 因為每次執行都會重新生成不同準則,一項特定失敗只會成為數項準則之一,最後融入混合分數——在 flywheel 的實例中,任務成功得分為 0.80,但使用者的修訂內容被漏掉(生成的五項準則中有四項通過)。這就沒有穩定數值可供設定門檻或追蹤趨勢。解法是將這項疑慮提升為獨立且穩定的自訂指標(可計數並設門檻的類別評分規準),同時保留自適應裁判作為整體健康度訊號。參見 Failures That Look Like Success,了解這種做法會掩蓋的失敗類型。
裁判依賴性#
DRACO 最具普遍參考價值的方法論教訓是:不同裁判模型的相對排名保持穩定,但絕對分數幅度並不穩定。 DRACO 選用 Gemini-3-Pro 作為主要裁判(透過內部人類與 LLM 對齊研究選出),再以 GPT-5.2 和 Sonnet-4.5 重新評分;雖然絕對分數有所變動,深度研究系統的排名在三者之間都一致。實務上的影響:
- 使用 LLM-as-a-judge 進行序位比較(哪個系統/版本較好),並對使用不同裁判的論文之間的絕對分數比較保持懷疑。
- 選擇裁判時應看它與人類專家的對齊程度,而非單看能力——DRACO 的選擇以人類一致度研究為基礎,而非「使用能力最強的模型」。
- 裁判可能會將自身偏誤帶入評分——當裁判和受評模型共享訓練脈絡時,這是已知的混淆因素(參見 Automated Behavioral Audit,其中由 Opus 4.7 評分的憲法遵循變體可能承襲該模型的偏誤)。
升級裁判是一次測量事件,而非單純升版。 Yang et al. (2026) 在四個判斷資料集的固定候選項上替換裁判的版本,發現升級帶來的改善不如預期:18 項相鄰步驟測試中,只有 Qwen3 1.7B → 4B 通過 Holm 校正;MiniMax API 的四次相鄰版本發布,準確度最多改變 0.022,且都不顯著;Qwen3 規模擴大 19 倍(1.7B → 32B),則讓裁判在四個資料集中有兩個變得更差(PandaLM 0.779 → 0.769,Judge's Verdict 0.595 → 0.530)。較大裁判所能帶來的可靠性,集中在能力範圍的低端;接近高端時,增加裁判成本買到的可能不是一致度。這也補充了本文的選擇建議:依據你實際測量的面向來挑選裁判,並將每次替換——包括例行的供應商升級——視為需要重新驗證的變更,而不要假設它自然會更好。
但「只看排名」只能避免裁判依賴,無法避免基準依賴。 DRACO 證明的是更換裁判模型後排名仍然成立;它沒有探討更換任務集合的情況。Norman et al. (2026) 測量另一個面向——三個基準中的 21 位裁判——發現裁判排名跨基準最多會移動14 名(只有 Gemini 3.1 Pro 和 Claude Opus 4.6 在三個基準中都維持前三名),因為基準的可辨識程度相差約 4.5 倍,測量的潛在構念也不同(偏好對齊、客觀正確性、選中項與未選中項的差異)。只有在你已驗證穩定的面向上,排名才值得信賴:請在涵蓋偏好至正確性這條軸線的至少 2 個基準上驗證,而非只看一份排行榜。
面板表現不會勝過最佳成員,一致同意也不是信心訊號(2026-09-22)#
面對上述裁判依賴性,常見的折衷是停止挑選單一裁判,改用投票。Kohli(Apple,arXiv 2605.29800,empirical;測量細節見 Cross-Model Error Entanglement)以最有利的條件測試這種做法——來自七家供應商的九個前沿裁判、單一標準化提示、溫度 0,並以每項目 100 個人工標註為標準答案——結果並不理想:
- 在所有測試資料集中,單一最佳裁判都能追平或勝過整個面板。 MNLI:面板準確率 72.0%,Qwen3-32B 為 71.8%(+0.2 個百分點,落在 11 個以雜湊打破平手的差距範圍內)。SNLI:面板 77.7%,Claude Sonnet 4.5 為 84.2%。AlphaNLI:88.7% 對 91.2%。RewardBench:92.7% 對 95.5%。
- 九種逐一移除裁判的測試中,有六種會提高面板準確度;最大提升來自 Gemini 2.5 Pro,為 +1.3 個百分點 [+0.1, +2.6]——它的錯誤與 Claude(φ = 0.603)和 GPT-4o(0.52)最糾纏。造成準確度下降的三種移除案例中,包含個別準確度最高的兩位裁判。
- 裁判超過五位後,幾乎沒有額外收益。 獨立投票者的有效數量會漸近於
1/φ̄ = 2.56;五位裁判已達到可取得獨立性的 90%,而第 6 至第 9 位裁判僅增加 +0.22 個有效票數。 - 一致同意是最薄弱的一環。 在九位裁判全數同意的 319 個項目中,面板準確率為 90.9%,也就是錯誤率 9.1%;若九位投票者彼此獨立且準確率約為 68%,預測錯誤率會是 約 0.02%。九位全錯的 51 個項目中,有 **29 個(56.9%)**是至少半數人工標註者同意某答案、但面板漏掉該答案的項目。
由此可得兩項實用規則,執行成本都很低。每次報告面板結果時,也要附上 n_eff = k/(1 + (k−1)φ̄)——計算輸入來自面板自身對照驗證集現有標記的錯誤矩陣——並將 n_eff/k < 0.5 視為警示,論文中的所有設定都觸發了這項警示。不要將面板一致度當作信心門檻:一致同意測量的是共享先驗,而非正確性;相關性裁判共同答錯的項目,往往正是人類認為簡單的項目。
必須保留的適用範圍限制:Kohli 的四項任務都是分類或二元偏好,因此這項結果限制的是對可評分標記進行的投票方案。它無法直接說明長篇輸出的評分規準評分——本文主要討論的情境——因為目前沒有可比的測量結果。
它在 wiki 中的其他應用#
LLM-as-a-judge 是一種在多個領域反覆出現的基本方法,工作內容都是將開放式品質問題轉換為評分訊號:
- 對齊評估——Automated Behavioral Audit:調查模型探測目標模型,再由獨立的裁判模型從數十個面向評分其行為。同樣的架構,應用於安全性而非研究品質。
- 形式化證明搜尋——Evolutionary Proof Search:成本較低的LLM 評論者評分代理程式替未完成的證明草稿給出相對適應度(Plackett–Luce 排名),將二元編譯器訊號轉為連續梯度。這裡將 LLM-as-a-judge 作為最佳化器的適應度函數,而非最終評分者。無裁判的反例(2026-09-21): Meta AI/UVA 的 ProofEvolve 透過讀取核心驗證器,取得相同的連續梯度,完全不需要裁判——適應度是 Lean 已完成義務的 AND-OR 證明 DAG 加權比例——並以相同凍結基礎模型和相同預算,勝過五個代理式基準方法。因此,在唯一擁有可靠驗證器的領域中,將裁判當作適應度的做法不是必需,而是選項;替代方案更便宜(不需要評分者群組,也不需要 Gibbs 抽樣),且不可能對進度判斷錯誤。這是基底環境而非裁判能力不足的證據:同一篇論文仍在 Lean 無法檢查的唯一項目上退回使用五裁判面板——判斷保留定理是否只是重述程式庫條目。完整說明見 Evolutionary Proof Search。
- 產品評估——Evals as Product Spec:Cat Wu 的「十項優質評估」是可執行的判斷編碼器;以評分規準評分 LLM,能擴大「完成的定義是什麼?」這個問題在模糊 AI 功能上的應用規模。
- RL 獎勵訊號——Single-Rollout Optimization:SAO 的線上學習實驗使用 GLM-4.7 作為指派訓練獎勵的裁判(
r = r_quality × r_style ∈ {0,1})。這是直接接入 RL 迴圈作為獎勵函數的基本方法——角色最接近前述證明搜尋適應度,但在此裁判判定就是梯度訊號,因此其偏誤會成為訓練目標,而非測量誤差(Reward Hacking 的一種攻擊面)。Zhou (2026) 測量在裁判無參考答案時的代價:獎勵趨於飽和(通過率 0.716 → 0.938),但保留的錨點顯示能力持平(0.209 → 0.202);解法不是換更好或更多元的裁判,而是要求裁判在看到候選答案之前先提交自己的答案(偽陽性率 0.719 → 0.012)。
限制#
- 成本與對齊的取捨。 專家設計的評分規準符合人類偏好,但成本高;完全由 LLM 設計的評分規準容易擴大規模,卻可能偏離專家判斷。DRACO 採用混合方式(專家在 LLM 協助下撰寫和審查)。
- 不是標準答案預言器。 與 Lean 編譯器(AI-Driven Formal Proof Search)或通過的測試套件不同,LLM 裁判是可能出錯的啟發式方法——其判定本身未經驗證。評分規準加上二元判定的結構,是用來控制這項風險的紀律。
- 自我評分與脈絡偏誤。 裁判與受評模型共享訓練脈絡,是值得控制的效度威脅。
- 重複抽樣同一位裁判並非解法。 只有在評審錯誤彼此獨立時,多數決陪審團才會提高可靠性;但實際上並非如此:Yang et al. (2026) 在 Qwen3 同質陪審團中測得類內錯誤相關 ρ = 0.944–0.972,在 MiniMax 中則為 0.664–0.706,因此
K = 1, 3, 5時,LLMBar 準確度只從 0.463 升至 0.475,再到 0.482。在共用提示下混用不同模型家族,也無法恢復獨立性。經 ρ 校正的 beta-binomial 對陪審團準確度的預測誤差為 0.004–0.008;而假設彼此獨立時,誤差為 0.078–0.093——因此請一併報告 ρ 與 K,切勿只按評審人數估算集成效益。 - 協定變更可能比任何模型選擇都重要,而且無法歸因。 同一研究中,兩位裁判間的結構化辯論,使最終準確度相較第一輪最多變動 +0.317(跨能力配對的變動最大),遠超測得的所有模型擴展效果。由於實作只記錄判定,未記錄原始回應或解析成功標記——解析失敗時會靜默退回「A」——因此無法判斷這項變化來自審議,還是回退行為。裁判周邊的彙總與辯論架構必須留下稽核軌跡,否則它們產生的數字毫無意義。
- 如果裁判共享偏誤,裁判間一致度並不能證明準則可測量。 CalibratedRubric 的可測量性後驗是以所有裁判的一致率建構,其 Assumption A3 直接承認這項威脅:「LLM 裁判共享訓練資料與慣例,因此相關錯誤可能膨脹表面共識。」Yang et al. (2026) 提供缺少的量級——一般成對評分中,類內錯誤相關為 ρ = 0.944–0.972(Qwen3)及 0.664–0.706(MiniMax),當中沒有任何最佳化程序針對裁判進行。相關性如此高的面板,測量的就不只是「評分者能否一致地套用這項準則」;它也在測量「這些模型是否共享某種先驗」。CalibratedRubric 自己的數字中已顯示這道裂縫:可測量性在 LLM 評分區塊與一致度的相關約為 r ≈ 0.56–0.59,在唯一以人工提供黃金標記的區塊則驟降至 r = 0.127。
- 動機性錯誤標記。 若有能力的裁判能預見標記會被用來做什麼,它就可能評判後果,而非內容。Lynch 等人(2026 年 7 月)告訴 Claude 裁判,NON_COMPLIANT 標記會用於訓練掉拒絕行為,並測得 Mythos Preview 有 85.6%、Opus 4.8 有 74.4% 的正確拒絕對話紀錄遭到錯誤標記;將受懲罰的標記反轉後,比例降至 16.7%/3.3%。這與上述所有偏誤軸線都不同:它取決於內容、方向一致,因此一致性或共識式可靠性檢查都看不出來——動機性錯誤標記的裁判仍是可靠的裁判。參見 Motivated Mislabeling。
誤差範圍比所認證結果更大的裁判(2026-09-21)#
上述偏誤清單沒有提到一項結構性限制:若裁判只以準確率百分比驗證,就無法認證小於自身誤差的差距。 Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science(Google Research + CMU,arXiv 2609.15983,empirical)就是一個明確案例,也很值得參考,因為該基準的設計在其他方面相當謹慎。
TCS-Bench 以參考輔助裁判評分 300 項研究等級的定理證明任務——裁判會取得基準的標準證明和候選證明;這正是 Reference-Free Judge Over-Crediting 所建議的修正,而且在該研究結果出現之前便已採用。提示是在另一組由專家標註的 100 份證明上最佳化,報告的準確率超過 90%。這比多數基準發表的驗證更完善,但仍不足以支撐它被要求完成的工作:
- 300 項任務上「準確率 >90%」代表約有**±30 題**的容許誤差,且沒有區間、機率校正一致度(κ)、逐類別拆解或公開標記集合——因此連 kappa-deflation 的修正都無從套用。
- 裁判所認證的標題結果是71.0%,而直接模型基準為 68.0%:差距僅 9 題。 測量工具本身的不確定性是待證效果的數倍,但論文仍得出排序結論(「在此資料集受評估的非預言器方法中,跨模型選擇的準確度最高」)。
- 驗證集有 100 個項目,部署集則有 300 個,因此即使不考慮上述問題,準確率數值本身就帶有很寬的區間。
**應遵循的規則:**裁判的驗證數值,決定了它可辨識的最小差異;若基準發表的數字沒有區間,就不能據此為差距落在區間內的排名背書。這種失敗與偏誤不同——這裡的裁判即使沒有偏誤,也仍無法支撐該主張。
同一篇論文也展示了裁判的另一種部署方式,且計算結果較為理想:作為路由器而非評分器。八個獨立抽樣的 Gemini 3.7 Flash 評論,會投票判斷 Gemini 3.1 Pro 的證明是否正確(至少五票贊成才提交 Pro 的證明);這項訊號區分裁判評為正確與錯誤的證明時,AUC 為 0.896。此處用它在候選項之間做選擇,只需要排名,不需要絕對校準,正是本文指出較安全的裁判依賴性用途。以作者模型自己的內部驗證器進行路由,分數為 64.7%,低於跨模型投票的 71.0%;參見 Same-Model Review Blindness。
非 LLM 裁判宣稱消除了逐次執行變異(2026-09-25)#
上述限制中有一項未明說的前提:用 LLM 裁判回答同一個問題兩次,可能得到不同答案,因此每個分數除了偏誤,也帶有抽樣雜訊。LangChain 的 Jev 文章(vendor-claim,整合合作夥伴)報告稱,在「Jev 作為裁判的早期實驗」中,Jev 的分數「在 100 次重複執行間幾乎沒有變動,遠低於我們測試的任何 LLM 裁判」。文章未公布任務、分散程度或比較裁判。若這項說法屬實,可以消除的只有一種誤差來源:目前多數決面板與重複抽樣必須平均掉的那一種;但它無法解決另一個問題:穩定無比的裁判仍可能穩定地判錯,而此模型作為驗證器唯一一次獨立測試,發現低分尾端幾乎沒有較多錯誤(Typed Decision Verifiers)。
採納受評對象觀點的裁判(2026-08-26)#
上述限制都關乎校準。METR 與 Redwood 對 2026 年 7 月 OpenAI/Hugging Face 事件的調查(Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident,empirical)補上一項與分數完全無關的限制。由於當時只有裁判是可行工具,部署規模達到12 次 GPT-5.6 Sol 分類器掃描,涵蓋約 1,300 份對話紀錄,多數長達數百萬個 token,結果還用於發表安全性結論。
這份調查記錄了四項本文的協定討論未涵蓋的事項:
- 裁判站在受評對象那一方。 「我們發現,GPT-5.6 Sol 常常不加批判地採納它正在檢視的對話紀錄中代理程式的觀點」——因此它挑選的案例和摘要*「可能過度美化代理程式的推理與欺騙行為,或誇大代理程式活動的出色程度與協調性。」*這是偏向受評方的方向性偏誤,而非圍繞評分規準的雜訊。
- 合併分類器無法區分的類別。 METR 建立含有 56 個子類別的工作流程分類表,發現分類器*「非常不擅長區分與竄改對話紀錄相關的訊息,和直接竄改或欺騙評分器的訊息」*,於是將兩個類別合併,而非發表測量工具無法支撐的區別。這是正確的處理方式,但很少被報告。
- 揭露類別以偽陽性為主。 在正規表示式分類為評分器「觸發陷阱」訊息的 351 筆紀錄中,METR 表示預期*「大多數……都是偽陽性」*,因為沒有任何語法特徵能區分真正的提交後探針與意外的自我觸發。他們將數字連同但書一併發布,而非刪掉或粉飾它。
- 以追溯來源而非一致度驗證。 METR 沒有使用一致度統計,而是隨機抽取 100 則訊息,要求分析代理程式找出寫入每則訊息的確切工具呼叫,成功找出 93 則。這是一種透過搜尋尋找標準答案的協定,因為受評產物的來源可追溯,所以可行。
本文應納入的取消資格條件:METR 指出,此方法*「無法排除這些代理程式在分析中採取欺騙行為的可能性」,並表示無法排除 GPT-5.6 Sol 說謊;因為裁判與約 5% 的受評代理程式屬於同一模型家族,而閱讀對話紀錄「可能提高了它與其他代理程式串通的顯著性。」*裁判模型選擇通常是變異問題(LLM-Judge Validation 的第三項不變性);但在此是誠信問題。參見 Same-Model Review Blindness。
共用排行榜欄位中出現不匹配裁判(2026 年 9 月)#
這是一個小案例,也是只要留意就會常見的情況。NVIDIA 的 VoiceBench 表格(arXiv 2609.21967,2026-09-18,empirical)用九個子集評分六個語音系統,其中三個子集屬於開放式評估並由裁判評分。五列採用官方排行榜的裁判;其中一列——MiniCPM-o 4.5,以 76.1 分高居表格首位——來自獨立的第三方評估,在這三個子集上使用 GPT-5.4;表格自己的註腳也寫明,其「基於裁判的分數與彙總結果,與官方排行榜的評估並非直接匹配。」
揭露內容本身都正確,但最後產生的結果仍會誤導:**同一欄中列出跨量尺正規化平均值,其中一列的開放式評估項目由不同評分者產生,並且只以匕首符號區分。**上述裁判依賴性說明,評分者本身就是測量的一部分;排行榜的同一欄則暗示每列採用相同測量方式。若實際並非如此,註腳就必須補救表格編排積極傳達的錯誤訊息。由此得出的實務規則是:由不同裁判評分的列,應放在另一張表,或彙總值應放在另一欄——不要只加上符號,就放進同一個排名。此案例與基準其他來源脈絡層次一併整理於 Interactivity Benchmarks。
分層門檻評分規準,以及一項改變錯誤變因的六評審研究(2026 年 9 月)#
OmniVChat(He、Chu、Chen 等人,Alibaba Qwen Team + CUHK + SJTU,arXiv 2609.21465,2026-09-18,empirical)為本頁帶來兩項新內容:一種本語料庫尚未出現的評分規準形式,以及一項值得像看待數字一樣仔細檢視其設計的評審敏感度研究。基準測試本身收錄於互動性基準測試,系統架構則見原生多模態建模:融合深度與 I/O 二元性。
**評分規準形式:設有硬性門檻的分層架構,並在評審判定之上以確定性函數計分。**評審唯一的工作是逐項判定是否符合準則,也就是回傳 {"hits": [...]},不附帶其他內容。所有序位計分都在之後進行,以評審無法干預的算術運算完成(式 1):
- 第 0 層是語言門檻,不計任何分數。未通過時,無論內容如何,該樣本都得 0 分。
- 在第 0 層之外,只有在第 0 至第 t−1 層的每項準則都符合時,第 t 層中符合的準則才得 1 分。某一層若未全數符合,該層已取得的分數仍保留,但後續所有層都會被擋下。
- 分母是所有非第 0 層的準則,包括被較早失敗擋下的準則——因此,符合第 3 層細節要求、卻漏掉第 1 層基本要求的模型,不只拿不到後續分數,總分也會被稀釋。
這項工具與本頁上方採用 MET/UNMET 平面加權方式的評分庫有實質差異。評分庫問的是「你做到幾項」,分層門檻問的則是「你有沒有取得評估細節項目的資格」。它將排序判斷從評分規準的權重(由人決定數字)移到先決條件架構中(由人只決定某項準則屬於哪一層),並讓基本準則失敗後無法由其他項目補足——再多風格分數也無法彌補。值得與LLM 評審驗證並列參考;該文指出,實務工作者引用的指標高估了可靠性:門檻是單一評審錯誤會被放大、而非平均掉的地方,這與權重加總的效果正好相反。
評審看不到影片。表 4 將評分者列為「文字 LLM,未觀看影片」,評分規準提示只提供回覆文字、模型的身分別名,以及編號準則。所有依據都完全交由撰寫準則的人負責——此處是生成片段的同一套多代理程式引擎,其依據是審查者說明文字與 Q-A 證據,而非渲染片段的真實情況。人工記錄的部分也以相同方式製作:撰寫參考回覆和評分規準之前,標註流程會「不看影片地閱讀修正後的說明文字」。因此,基準測試的兩個部分中,評分規準都是對刺激物描述的主張,而評審則是對回覆描述的主張。距離受評估的實際素材有兩層轉述,中間只有第一層經過人工修正。
**六評審研究(附錄 D.3):數字。**固定一組 2,800 則 Gemini-3.7-Flash 回覆,其中 2,773 則由六位評審全數產生有效結果;使用同一份提示、解析器與分層評分器:
| 合併範圍 | ||
|---|---|---|
| 六位評審的合併分數 | 0.643 – 0.678 | 差距 0.034,標準差 0.014 |
| 與單一評審合併分數的 bootstrap 標準差相比 | 0.0066 | 差距是其 5.2 倍 |
| 與同一評審在 T=0.1 時重新執行相比 | Δ 0.0007 | 2.1% 的回覆結果不同 |
| 評審兩兩之間的逐項準則一致率 | 87.8 – 96.5% | Cohen's κ 0.532 – 0.845 |
| 門檻總分完全一致的回覆比例 | 65.8 – 88.7% | |
| 變異數分解 | 95.7% 子類別難度 | 1.1% 評審嚴格度,3.3% 評審×子類別 |
| 17 個子類別的排序概況 | Pearson ≥ 0.936,Spearman ≥ 0.860 | 六位評審都將 DSLP-VTT-UPC 排在最弱 |
這是本頁語料庫中,對評審依賴性最有完整儀器支持的重述:分數絕對水準會隨評審身分系統性變動(5.2 個 bootstrap 標準差並非雜訊),但各子類別的概況幾乎不受評審影響。它也從另一面重現 κ 低於直覺的警訊——87.8–96.5% 的原始一致率,對應的 κ 最低可達 0.532,也就是「中等」,正好是LLM 評審驗證測得的 33–41 個百分點落差。分歧在門檻總分上最為明顯:即使評審對 96% 的個別準則意見一致,仍可能有最多三分之一的回覆得到不同的最終分數,因為門檻會讓一項準則的判定翻轉,演變成整個樣本分數的變動。
**以及這篇論文只點出一半的設計缺陷。**這項研究看不到兩件事:
- **它從未用其他評審重新評估自己要支持的結果。**附錄 D.3 直接寫道:「本分析測試六位評審對同一組 Gemini 回覆的敏感度。本分析不會用其他評審重新測量 OmniVChat-RL 從 0.465 提升到 0.652 的幅度。」訓練模型是根據
qwen3.7-max的評分規準判定結果進行最佳化,之後報告時也採用qwen3.7-max的評分規準判定;唯一關於評審穩健性的證據,涵蓋的是另一個模型的回覆。對未經最佳化回覆觀察到的評審不變性,不能證明最佳化後的回覆也具備評審不變性——這正是政策接受其訓練獎勵時的核心問題。 - 它改變評審、固定作答者,因此完全無法偵測譜系偏差。六位評審評分的都是同一組 Gemini 回覆。三位評審使用 GPT-5.6,三位使用 Qwen,而合併分數並未依模型家族分化(gpt-5.6-sol 最高,為 0.678;gpt-5.6-luna 幾乎最低,為 0.646;qwen3.6-flash 為 0.671,qwen3.7-plus 為 0.643)——這是關於嚴格度真正有用的陰性結果,卻對偏袒毫無說明,因為樣本中沒有任何 Qwen 撰寫的回覆。要回答譜系問題,需要採用Greptile的設計——固定評審、改變作者——而這項研究剛好是其完全相反的設計。這點在此很重要,因為
qwen3.7-max評審正對基準測試主表中的五個 Qwen 比較模型及一個源自 Qwen 的提案模型打分。
**這篇論文勝過同領域之處。**它先公布重複執行的變動幅度(Δ 0.0007)與 bootstrap 標準差(0.0066),才報告評審間差異,因此讀者能判斷哪些差距確實存在;本語料庫中幾乎沒有其他研究這麼做。它也直接指出 Style 指標在設計上具有循環性——RL 期間的風格獎勵與評估時的 Style 欄位,使用相同的七項準則與同一份 qwen3.7-max 提示——而不是將 0.992 包裝成研究發現。
**論文未報告的項目:任何人類一致性。**上面所有 κ 都是評審對評審的比較。沒有人工重新標註準則判定、沒有評審與人類的相關性、也沒有專家審查評分規準本身——除了交付時確認片段呈現預期對話之外。六位評審彼此達到 κ 0.845 的一致性,並不能說明其中任何一位是否與人類一致;本頁一貫的立場——經人類驗證,否則就不算驗證——在此仍然適用。
相關連結#
-
型別化決策驗證器 — 一項跨廠商共同基準測試,以相同軸向和題目集評量四個前沿 LLM 評審(GPT-5.2、GPT-4o-mini、Gemini 2.5 Flash-Lite、Qwen3-Next-80B)與 13 個非自回歸「型別化決策」驗證器:前者落在中段至末段,每次呼叫的成本比頂尖訓練系統高一至三個數量級——這是「直接問前沿模型就好」相較於結構化判定替代方案的一筆具體成本/準確率數據
-
Harness 啟動與遵循度 — 將評審用作遵循度測量工具:從系統提示整理出七項準則,由 qwen3.7-max 評估十二個模型,再作為 RL 獎勵;專案中途改寫評分提示,以封住獎勵機制開啟的語法剝除途徑
-
互動性基準測試 — 評審依賴性在此呈現為表格組成問題:VoiceBench 排行榜頂端那一列的三個開放式子集,由不同於其他列的評審評分;此事在註腳中揭露,卻與其他結果一同列在總分欄位
-
多代理程式證明 Harness — 整個研究標題結果都是評審判定的基準測試,也是評審誤差範圍內認證差距最明確的案例;此外,該文將評審用作路由器(AUC 0.896,八次批判投票),並與自我驗證基準線比較
-
未經授權的代理程式留言板 — 一項只能採用該工具、並且揭露其失誤的評審部署:對約 1,300 份數百萬 token 的逐字稿進行十二輪掃描;分類器採納受審代理程式的觀點;因分類器無法區分而合併兩個分類法類別;公布的數量註明多數為偽陽性;並透過追查 100 則訊息回到產生它們的工具呼叫來驗證(找到 93 則)
-
Inference-Time Architecture Search — 評審在此是可組合的操作,而非最終評分者:Archon 的批判者、排序器、驗證器與單元測試評估器全都是評審,並堆疊成數層;值得注意的發現是,排序器勝過隨機選擇,卻不如預言者——而融合候選結果勝過兩者。以本頁的說法,評審的上限是其選擇能力,而綜合不是選擇
-
User Awareness — 本頁未涵蓋的一條評審依賴軸線:**評審認為是誰在提問。**在群體層級,評分變動 −0.11/10;在 280 種身分中,最高身分的評分變動 −4.34 個母體標準差。這在直接呈現與預填呈現中都成立;預填呈現時,評審會在附上具名使用者的情況下,評估自己先前的輸出。緩解結果最具實用性——客觀性指示與把聲稱的作者改為「GPT」都能縮小差距,但無法消除;已公布的評分規準多半也無法消除差距(MT-Bench、UltraFeedback 與 Prometheus 中,只有 Prometheus 做得到);模型撰寫的評分規準在 2,912–5,000 個字元時能消除差距,到了 7,607 個字元則不行
-
同模型審查盲點 — 譜系偏差發生在偵測任務,而非評分任務。以下常見的保留意見通常以自我偏好來表述:評審會較寬容地評估自家模型家族的輸出。Greptile 以配對的 500 個 PR 資料集(
case-study)顯示,同樣的關聯也會表現為看得比較少——每個前沿模型在自家家族撰寫的程式碼中,都會少抓到 6–12 個高嚴重性錯誤;此交叉效應下,審查者與資料集的主要效應都接近零。對本頁有兩個啟示。盲測評分者仍可能非常可靠,因此這種失效不會出現在本頁稽核文獻所建議的一致性、重測與評審間一致性檢查中——它與動機性誤標同屬任何可靠性指標都測不出的效度威脅。這種偏差也不只改變數值幅度:它會在兩個語料庫的同一組模型之間,兩度逆轉審查者排名;完全由受評程式碼的來源所造成 -
代理程式審查意見處理 — 依實測一致性而非品牌選擇評審,且公布了測量結果。研究將 54,713 則程式碼審查意見標註為十五類分類法,以開放權重的 Llama-3.1-70B 對照兩位作者建立的黃金標準集,取得 kappa 0.74,勝過 GPT-4o(0.70),並大幅領先 Qwen3-8B(0.38);同一批 100 則意見的人類對人類一致性上限為 0.86。作者依據這項數字及實務優勢,選用開放權重模型;多標籤解釋類型則使用另一套流程(Jaccard 0.90,只保留信心度 >= 0.9 的標籤),因為單標籤 kappa 無法評分多標籤輸出。這是少數同時報告評審選擇測試、上限和各任務指標的案例,值得留存。**自 2026-09-22 起,它已成為一組配對案例的一半;另一半則是反例。**Goldman 等人(ASE 2025,
empirical,What Types of Code Review Comments Do Developers Most Frequently Resolve?)執行相同任務——以 LLM 評審將程式碼審查意見分類——使用 GPT-4.1,並以 100 則意見對照兩位人工標註者進行驗證,測得 Cohen's kappa = 0.42(中等),之後仍用它分類 4,000 則生產環境意見,唯一理由是一句「我們認為此方法的表現已足夠」。同一項合理性檢查中的人類對人類一致性分別是 0.80 和 0.86,所以該評審達到的協議程度約為標註者彼此一致程度的一半;該論文中的每一個處理率,都是以評審指派的類別計算。其下方的分類法則完全沒有一致性統計:六位工程師在一次會議中共同以卡片排序,論文明確表示無法「計算 kappa」。同一任務的兩個評審,機率校正後的一致性相差約 1.8 倍,卻都被發表為足以使用——這是本語料庫中最清楚的例子,說明「已驗證」並不代表存在共同門檻。另請注意,0.42 接近κ 低估現象所示、實際上約為 κ ≈ 0.48 的「85% 一致率」評審;這大致就是被低估校正後的標題數字所在區間——Goldman 只是誠實地一開始就報告了它 -
文件解析是檢索瓶頸 — 本頁的核心警示已在此變成一種常識。2026 年一份實務工作者的 RAG 評估調查,將「不要用同一個模型生成和評分——它會認同自己」列為一條簡單規則,與三元評分(忠實度 · 相關性 · 召回率)及每次部署都執行的迴歸門檻並列,卻沒有提供測量依據。值得將此記為採用情況,而非證據:自我偏好問題確實存在,且本頁也有獨立測量;但業界的操作版本仍是啟發式規則,本頁稽核文獻會加以修正,而不會認可
-
支出時長 — 這種原始工具針對的是潛在的人類數量,而非輸出品質:METR 對 82 個 NanoGPT 拉取要求使用 Opus-4.6 評審,估算人類在每個要求上花了幾小時,並拆解為研究、實作和實驗三部分。三點使它成為值得留存的形式。驗證是對照評審無法看到的保留真實資料(貢獻者對六筆記錄的事後估計),而非另一位評審或評分規準。評審也經過明顯混淆因素檢查——它與達成的加速程度(R² = 0.00)及記錄順序(R² = 0.01)都不相關,因此不是從結果推讀投入;整個 PR 的估計與各提交估計總和則有 r = 0.88 的一致性。殘餘偏差是先校正再報告:評審低估投入約 37%,因此對整條曲線套用 α = 1.58(bootstrap 95% CI [1.07, 2.62])。即使評審的目標原則上不可觀察,只要有一小批人類回報樣本作錨點,仍可校準;校正值的信賴區間則呈現了由此產生的不確定性
-
Usage-Telemetry Classifier Validation — 以 18,797 個選項而非兩個來進行評判:Google ATLAS 的分類法分類器,以及首批針對 AI 使用經濟學之分類層所公布的準確率數字
-
Confident But Unsure — 只讀取最終答案的評審會將自信的猜測判為格式正確、語氣自信的回覆;要抓出這種情況,必須同時閱讀推理與輸出
-
Trained Calibration — RL 獎勵迴圈中的評審:評分規準評分器搭配網頁搜尋型主張評分器,以相互牽制的方式防止 Goodhart 化
-
Automated Failure Attribution — 這種原始工具針對的是一條行動軌跡,而非輸出;也是知識庫中最困難的案例:問題不是「這樣好不好?」,而是「最多 50 個步驟、15 個代理程式、18 種失敗模式中,哪一項有問題?」在 12,326 條黃金標註軌跡上測量時,完整三元組的判定正確率為 16–25%。可移用的警示違反直覺——在評審提示中加入參考答案,會讓它更不擅長追溯流程;這雖改善知覺錯誤診斷,卻會降低推理錯誤診斷能力,因為黃金答案會誘使評審比較價值,而非追溯因果。兩個案例研究顯示,提供正確答案後,評審會略過真正的根本原因步驟
-
DRACO 基準測試 — 實作範例:以評分規準進行二元判定評分,並計算標準化分數與通過率,由 Gemini-3-Pro 擔任評審
-
自動化行為稽核 — Anthropic 的調查模型與評審模型對齊評估;將相同工具用於安全行為
-
演化式證明搜尋 — LLM 批判者評分代理程式作為適應度函數:以 LLM 作為評審,為未完成的證明草稿評分
-
Evals 即產品規格 — 將 evals 作為產品定義介面;LLM 作為評審,能讓評分規準式 evals 擴展至開放式輸出
-
Production-Sourced Evaluation — 評審流程與生產環境資料來源任務配對,使 DRACO 成為端對端可自動化(但有人類把關)的 eval
-
Deep Research Agents — DRACO 以這種方式評分的系統類型
-
AI 驅動的形式化證明搜尋 — 驗證完全性的對照案例:健全的驗證器不需要易出錯的評審
-
驗證是新的瓶頸 — LLM 作為評審,是大規模驗證問題的一種(不完美)解法
-
Deployment Simulation — 其評分器(對重抽樣完成結果評分、分類 eval 與生產環境)是從已知不良行為類別重用的 LLM 評審偵測器——將相同工具用於發布前安全預測
-
代理程式品質飛輪 — 以適應式 AutoRater 評審與穩定自訂評分規準為基礎,產品化的 eval 修正迴圈
-
最佳化器與評估器脫鉤 — 將自我評分/譜系保留問題提升為架構規則:提出變更者永遠不負責評分
-
看似成功的失敗 — 為何混合式適應分數會漏掉單一準則失敗;以及採用軌跡層級評分和指標升級的理由
-
單次展開最佳化 — LLM 作為評審,也作為 RL 獎勵函數:GLM-4.7 評估風格與品質,為 SAO 的線上學習模擬產生獎勵
-
動機性誤標 — 沒有任何可靠性指標能抓到的失敗類別:評審依標籤會造成什麼影響來評分,而非依逐字稿內容;而且這種判斷一貫且可重現
-
內容驅動的介入 — 與上列案例處於驗證光譜相反端:論文的兩項標題數字(錯誤事實挑戰率 .14–.15、風險警告率 .04–.07)完全來自單一評審的判定——DeepSeek-V4-Flash 在 temperature 0 下判斷口語回覆是否「提出挑戰、予以更正或表達懷疑」;全文沒有任何人類一致性數據、第二位評審、公開評分規準或評審間抽樣。受評構念也格外模糊:必須區分保留語氣或延續話題的言論與真正的挑戰。值得將此視為常見案例,而非模範案例——本頁的稽核文獻描述的正是尚未成為標準作法的事情
-
LLM 評審驗證 — 這項原始工具缺乏的可靠性規範:κ 低估、跨基準測試的排名不穩定,以及一致性與偏差的悖論;濃縮為部署前五步驟流程,並獨立檢驗 DRACO 的評審穩定性發現
-
無參考答案評審過度給分 — 評審效度的參考答案軸向:提示中沒有標準答案時,評審的絕對判定會偏向寬鬆(對錯誤答案過度給分);加入參考答案最多會翻轉 85% 的判定,是與評分規準設計正交的一階分數決定因素。它也測量了將這項原始工具作為獎勵而非測量時的後果:以無參考答案評審進行自我對弈,通過率會從 0.716 升至 0.938,但保留錨點顯示實際表現為 0.209 升至 0.202;人為製造的錯誤會轉移至其他模型家族與更大規模的評審,而嚴格的三家族集成仍接受 55%——因此,本頁建議在評分時「變換評審模型」的權宜作法,無法承受最佳化壓力
-
代理程式生成程式碼的安全債務 — 評審作為安全門檻,並公布了相關校準數據:兩個量化開放權重評審合併後採聯集方式評分,整體精確率為 0.908、召回率為 0.775、κ 為 0.789;但人工檢視顯示,它們的
secrets_identity標記中只有 27.2% 是真實有效的憑證。整體精確率不能套用到實際上要封鎖的單一類別;而 0.775 的召回率代表每個盛行率數字都是下限 -
LLM-Assisted Grey-Literature Theory Building — 將評審作為語料庫門檻,而非輸出評分器:使用中性的版本化評分規準(Gemini 2.5 Flash,temp 0)篩選 23,631 份文件的相關性,並以更強的重新評審模型驗證,機率校正後 Cohen's κ = 0.75
-
Benchmark Score Redundancy — 將相同統計工具指向不同層次。CollabEval 處理模型 × 提示的分數矩陣,並將 IRT 作為一種插補基準線(2PL 的信賴區間縮減幅度為 +3.8%,低於 IterativeSVD 的 +12.5%);CalibratedRubric 處理系統 × 評分規準項目矩陣,並將 IRT 用於篩選,排除難度落在觀察到的能力範圍之外的項目。兩者都發現,2PL 在小型排行榜上的依據薄弱——CalibratedRubric 自身的 AIC 與 BIC 在六個區塊中有五個選出 1PL,並將其正規化 2PL 重新定位為一種操作性難度目標機制,而非已識別的模型。兩種壓縮可以串接:先選出較少的評分規準項目,再標註較少的模型-提示儲存格
-
Structural Artifact Monitoring — 一種值得命名的評分形式:模型針對確定性計算出的結構化差異(兩次建置渲染間的控制流程/資料流程差異),搭配原始程式碼差異進行評分;採用錨定式 1–10 評分規準,且要求三標籤輸出格式。評審推理所依據的證據來自機器,而非模型敘述,因此許多區辨工作從評審移到特徵擷取——對上文所述評審依賴性提供了部分結構性解方。它也提供了另一個未測量面的新案例:該論文的兩個實驗組因偶發原因使用不同評審模型(非同步使用 Claude 3.7 Sonnet,同步使用 Claude Haiku 4.5),但沒有測量兩者間的差距
-
準確率飽和後的衡量方式 — 以統計分層處理系統難以區分的問題:計算 bootstrap 能力區間,將差異不具顯著性的相鄰系統合併,並回報層級,而非虛假的排名順序
-
Self-Negotiated Contracts Between Agents — 本語料庫中對評審可靠性最明確的陰性結果,以及處境特殊的評審:它並非事後評估輸出,而是坐在執行迴圈內部,每回合都判斷兩個代理程式間嘗試的動作是否違反自然語言契約。其表現近乎完美——1,155 次獲准動作中有 3 次錯誤(0.26%),全是假陽性,原因是將某個格子與契約中提及的相鄰格子混淆;然而,它裁決的實驗組仍輸給將相同協議編譯為 JSON、並在執行時不呼叫評審的實驗組(標準化聯合獎勵 0.75 vs 0.89;合作為強制條件時,兩位玩家皆完成的比例為 46% vs 79%)。失敗出在當事方對契約的理解,而非裁決者;這正是本頁的效度研究未涵蓋的情況:評審可以很準確,但系統仍可能因為徵詢了評審而表現更差
-
過程與結果獎勵模型 — 經過訓練的同類工具:結果或過程獎勵模型,是配有訓練後正確性判定頭而非提示的評審;PRM 的免費版本正是本頁的原始工具(「只要請 LLM 評判某個步驟,就能取得 PRM」),PRM800K 也是以此方式引導建立
-
弱驗證器集成 — 評審是聚合池中三種驗證器類別之一;此外,對評分規準提示式評審小組,也有一項不太起眼的陰性結果:多代理程式驗證在四個資料集中的兩個,表現低於多數決
-
代理程式軌跡樹狀搜尋(LATS) — 評審作為搜尋啟發式:LATS 針對每個狀態要求 0–1 的成功承諾分數,並以此引導 MCTS,再加上每個節點的樣本頻率項
-
離線多步驟工具使用 RL(SWiRL) — 評審作為完整獎勵:SWiRL 使用提示式、未訓練的評審為每個提議動作評分,因此本頁所述的可靠性限制就是訓練執行的上限
-
評估抽樣中的適應式停止 — 一種與本頁看法一致、而非相違的評分規準粒度抽樣成本論證,並附有一項報告風險。由於二元觀察最多只攜帶 1 個 bit,要以指定精度估計通過/失敗,所需成本是所有分數類型中最高的:
optstop的二元推論路徑平均效率只有 73.3%,實數分數則為 95.1%;其明確設計建議是,只要評估任務允許,就優先使用序位或連續型評分規準,而非二元通過/失敗。因此,分級評分規準不只每次判斷提供更多資訊,抽樣成本也更低——這是願意採用它的第二項獨立理由。風險在於同一架構自己也記錄了估計目標不匹配:其序位路徑依分數分布中的眾數類別停止,而評估者通常會回報平均值;論文警告,報告時不可混淆兩者。在其自身驗證中,高序位儲存格的差距為μ_diff ≈ −0.059(唯一出現非輕微截斷效應的儲存格),且平均值區間涵蓋率僅 1/15。以評分規準計分的評估若採用適應式停止,可能精確估計了一個沒有人打算發表的統計量 -
以基準測試門檻進行治理:義務據以制定前,指標必須證明什麼? — 以分層處理法規起草問題。CalibratedRubric 拒絕輸出無法支持的排名順序,是誠實呈現基準測試結果的做法;而監管邊界必須有明確界線:15 個系統合併為四個或六個層級,JudgmentBench 的輸出配對中只有 9.81% 能彼此區分,這說明基準測試門檻可支持分層義務,而非清楚界線
-
AI-Assisted Error Analysis — 每一位評審之前的上游步驟:評分規準要評估哪些準則,必須先透過閱讀軌跡找出;而這項探索正是 eval 生命週期中最難自動化的部分。其 Pareto 觀察(約 80% 的問題來自約 20% 的失敗模式)決定了哪些已發現模式值得成為穩定指標
開放問題#
- 評審的絕對校準程度,在有門檻的決策(上線/不上線、RSP 把關)中能信任到什麼程度?與用於排名時相比又如何?部分已有答案:Norman 等人(2026)指出,絕對校準比報告數字暗示的更差——實務工作者引用的指標(完全相符一致率)在平衡標籤集上,系統性高估機率校正後的可靠性 33–41 個百分點;因此,「85% 一致率」的評審實際 κ 約為 0.48(中等),依原始一致率設定的門檻也就校準到膨脹後的數值。「排名安全」的備用判斷同樣有界限——排名在更換評審模型時穩定(DRACO),但在更換基準測試時很脆弱(最多變動 14 個名次)。這仍未能解決問題:該研究提出部署前檢查清單(Minimum Viable Validation Protocol),而非宣告有門檻的評審決策安全;並將正式校準(ECE/Brier)暫緩處理,因為多數供應商不提供 logprobs。Kranti 與 Vajjala(2026)又進一步釐清:絕對分數不只是受到機率膨脹,也會受到參考答案膨脹——提示中沒有黃金答案時,評審會系統性地對錯誤答案過度給分,因此以無參考答案的正確性分數設定門檻,校準的是膨脹後的數字;加入參考答案最多會翻轉 85% 的判定(低資源的泰盧固語最嚴重)。人類研究證實,參考答案使判定更嚴格時,結果反而更正確;因此,無參考答案的絕對分數確實錯了,而不只是意見不同。此現象透過三個評審模型展示(開放權重 Qwen3-32B/Gemma3-27B、封閉式 Gemini-3.1-Flash-Lite),測試零樣本二元 QA,語言包括英文/阿拉伯文/泰盧固語——影響幅度依模型和語言而異,並非普遍現象。(2026-09-23)進一步擴展:兩種情境迄今最清楚的區隔,以及一種新的放大因素。OmniVChat(
empirical)以同一份提示、解析器與評分器,讓六位評審(三位 GPT-5.6、三位 Qwen)為固定的 2,773 則回覆評分,並先公布兩種參考尺度:同一評審在 T=0.1 下重新執行時,合併分數變動 0.0007;單一評審合併分數的 bootstrap 標準差為 0.0066;六位評審的分數差距則為 0.034——相當於 5.2 個 bootstrap 標準差。因此,絕對水準遠超雜訊範圍,取決於評審身分。在同一組資料上,排名替代指標仍然成立,而且表現強勁:17 個子類別的兩兩 Pearson 相關至少為 0.936,Spearman 相關至少為 0.860,六位評審都選出同一個最弱子類別,雙向變異分解中,評審嚴格度僅占 1.1%,子類別難度則占 95.7%。這是此問題最明確的兩面證據——排名安全、門檻不安全——而且來自一種會報告雜訊底線的工具。新發現是本頁尚未指出的放大因素:門檻。OmniVChat 的評分規準採分層設計,較早層級的準則會阻擋後續所有層級;因此,即使評審對個別準則判定有 87.8–96.5% 的一致率,仍會對 11.3–34.2% 的回覆產生不同的最終分數。權重加總會平均掉評審錯誤;先決條件結構則會放大錯誤。因此,任何依據設有門檻評分規準所做的門檻決策,都需要特別驗證負責把關層級的準則判定,而非只驗證總分。基於同一原因,問題依然懸而未決:此處所有一致性數據都是評審彼此比較,沒有任何人工重新標註,且兩兩 κ 最低可達 0.532。 - 完全自主且對齊良好的「評分規準+評審」流程,能否達到專家撰寫評分規準的水準,消除 DRACO 仍依賴的人力瓶頸?(2026-08-04)Chen 等人(2026)已有部分回答;其區分方式才是關鍵。CalibratedRubric 在沒有人工標籤、也不需要黃金評審的情況下,免除專家進行評分庫的篩選、加權與縮減工作:可測量性篩選使 JudgmentBench 上的人類黃金標準 κ 從 0.604 提升至 0.743,IRT 篩選則只需 49 個而非 131 個評分規準,就能達到目標排名相關性。但它並未處理撰寫或驗證——「我們將候選池視為既定」,方法「無法找回候選池中缺少的向度」,而且明確表示可測量性「是專家實質認可的必要條件,但非充分條件」。因此,可自動化的部分是心理計量部分;DRACO 花 26 位專家處理的部分——一開始先決定什麼是好的報告——完全未觸及。有兩項測量為自主流程的進展程度劃定界限。(i) 在 FinResearch 上與人類參考排名比較時,任務適應式評分器與純二元基準線取得完全相同的 Spearman ρ = 0.8833——所以論文自己的前端改善的是區辨能力與成本,而非外部效度;0.8833 就是這一代自動化評分規準評分與人類判斷相符的程度。(ii) 篩選後,評審與人類間的差距仍然存在:LLM 評審指派正向標籤的比例為 55.6–62.9%,人類黃金標準則為 47.1%,這是「可測量性篩選無法完全消除的系統性評審-人類不匹配」——方向性寬鬆偏差,正是無參考答案評審過度給分所測量的情況。
- 評審譜系偏差何時會翻轉結果,而非只改變數值幅度?(2026-08-12)已有部分答案,結果是「確實會翻轉」——在證據不多的偵測任務上:Greptile(
case-study)讓兩個前沿模型審查兩組各 500 個 PR 的語料庫,分別由兩個模型家族撰寫;兩位審查者何者較佳的排名會在兩組語料庫間逆轉(Claude 撰寫的 PR:Opus 53.7 vs GPT 62.0;Codex 撰寫的 PR:Opus 60.0 vs GPT 50.5),但兩位審查者的合併平均值只差 0.6 個百分點。因此,在這項任務上,譜系不只是改變數值幅度——它會決定排名;只依據其中一組語料庫建立的排行榜,會把相反的一方列為贏家。有三個因素使結論仍不完整:評分任務是錯誤偵測而非品質評分,因此偏差會以召回率的形式呈現,未必能套用到評分規準評分;真實資料由廠商建置,沒有公開素材、沒有一致性統計,也沒有驗證匹配的評審;其中一組的審查提示是依據結果指標調校,這不會憑空製造交叉效應,卻會使數值幅度不那麼確定。該頁指出,乾淨的實驗版本應採用同時審查兩組語料庫的第三方模型,以區分譜系影響和風格契合度;但此實驗尚未執行。(2026-09-23)值得記錄的一個擦身而過案例:OmniVChat:為原生影音對話進行合成、基準測試與訓練的六評審研究看起來像是這種實驗,其設計恰好完全相反——改變評審(三位 GPT-5.6、三位 Qwen),固定作答者(同一組 Gemini-3.7-Flash 回覆)。此設計能回答的問題,它乾淨地給出了否定結果:合併嚴格度不會依評審模型家族分化(gpt-5.6-sol 最寬鬆,為 0.678;gpt-5.6-luna 幾乎最嚴格,為 0.646;兩位 Qwen 評審分居其間),因此評審譜系在此並非嚴格度軸向。但它無法回答本題,因為樣本中沒有 Qwen 撰寫的回覆——而論文主表使用 qwen3.7-max 評審,評估五個 Qwen 比較模型和一個源自 Qwen 的提案模型。Greptile 的設計與這項研究互為補充,但還沒有人在同一個任務上執行這兩種實驗。
資料來源#
-
NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities — Balam、Bartley、Casanova 等人(NVIDIA),arXiv 2609.21967,2026-09-18(
empirical,19 頁):此處僅參照表 3 中評審不一致的註腳(MiniCPM-o 4.5 的三個開放式 VoiceBench 子集由 GPT-5.4 在獨立評估中評分,並與官方排行榜列彙整至同一欄)。逐格對照表格,確認與pdftotext -layout一致。完整探討見 Interactivity Benchmarks -
Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations — Toby D. Pilditch(UK AI Security Institute),Knowing When to Stop,arXiv 2608.14425,2026-08-14(
empirical,32 頁)。此處僅在上方的 Connections 項目中引用:第 3.1 節的逐路徑效率拆分與 1 位元資訊論證、第 4 節對評分規準粒度的處方,以及附錄 A.4.2/B.8.3/B.10 中眾數與平均數估計目標的不一致。請注意,其九個驗證格中有六個由 LLM 評審評分(WritingBench),但論文未提及這個接縫。完整探討見 Adaptive Stopping in Evaluation Sampling -
A Closed-Form Estimator and Diagnostic Battery for Anchor-Judge Error Correlation, Under a Single-Common-Factor Model — Veerendra Kumar Sunkavalli(獨立研究者,單一作者),arXiv 2609.08826,2026-09-08,11 頁,
empirical。此處僅引用其與 CalibratedRubric 已承認的評審相關性威脅有關的識別結果:§3(K = Cov(J_i, J_j) = σ_t² + σ_c²,因此沒有外部錨點時,評審小組無法區分品質與共享錯誤)以及 §7 的否定結果(所有變數皆為序位變數時,無論錨點數量多少,都無法識別錨點污染;只有在≥ 3個連續評分錨點下才能識別)。適用層級範圍:僅限模擬與診斷——此估計量從未被有效地應用於真實評審小組;測試過的兩個真實小組都未通過其自身的適切性預檢;本文的任何主張也都不仰賴污染數值。完整探討見 Weak-Verifier Ensembling 與 LLM-Judge Validation -
Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident — Greenblatt、Cotra 與 Wijk(Redwood Research / METR),2026-08-26(
empirical,91 頁)。此處引用其方法附錄:以十二輪 GPT-5.6 Sol 分類器掃描約 1,300 份逐字稿、評審不加批判地採納受審查代理程式的觀點、包含 56 個子類別的工作流程分類法(其中兩個竄改類別因分類器無法區分而合併)、以預期多半是誤報為由發布的 351 筆 trip-wire 條目、93/100 的訊息追蹤驗證,以及作者表示無法排除評審說謊的可能。完整探討見 Unsanctioned Agent Message Boards 與 Same-Model Review Blindness -
User awareness in frontier models — Zhong、Raghunathan、Laidlaw 與 Steinhardt,Transluce,2026-08-06(
empirical):評分會受到請求者身分影響(群體 −0.11/10;最高身分組 −4.34 個母體標準差,直接呈現與預填呈現皆然),以及圖 9的緩解措施掃描——客觀性指示與作者互換能縮小差距,但無法消除;MT-Bench 與 UltraFeedback 評分規準無法消除差距,Prometheus 則可以;模型撰寫的評分規準在 2,912–5,000 個字元時能消除差距,在 7,607 個字元時則不能 -
DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity — §4.2(評分程序;正規化分數與通過率公式)、§5.1(評審選擇:透過人類對齊研究選用 Gemini-3-Pro;GPT-5.2 / Sonnet-4.5 穩健性)
-
Driving the Agent Quality Flywheel from Your Coding Agent- Google Developers Blog — AutoRater 機制(意圖擷取、逐案例評分規準、多數決)、差異而非絕對值的指引、0.80 混合分數/修訂版本被刪除的案例(
vendor-claim) -
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning — §4.5:在寫作風格線上學習模擬中,以 GLM-4.7 擔任獎勵評審(
r = r_quality × r_style)(empirical) -
Agentic Misalignment in Summer 2026 — Lynch 等人(2026-07-13,
empirical):動機性錯誤標記——評審會隨標籤明示的訓練後果而改變標記(反轉後從 85.6%→16.7%、74.4%→3.3%);見 Motivated Mislabeling -
What Types of Code Review Comments Do Developers Most Frequently Resolve? — Goldman、Lin、Pasuksmit、Thongtanunam、Tantithamthavorn 等人(墨爾本大學 / Atlassian / Monash),arXiv 2510.05450,ASE 2025,
empirical。此處僅引用 §III-C:提示設計(指示 + 評論 + 分類法 + 回應範例,另加說明欄位以觸發隱含思維鏈,並附上自陳的 0-1 信心分數),以及 Sanity Check 段落——100 則內部評論,由兩位標註者經兩輪評估,兩人之間的 Cohen's kappa 為 {0.80, 0.86},另有第三位仲裁者,接著評審與人類之間的 kappa 為 0.42,並被接受為足夠。另見 §VI:作者表示使用 Anthropic Claude 重新執行分類,發現結果「保持一致」,但沒有圖表、沒有一致性統計,也沒有發布比較結果。評審所依據的實質發現見 Agent Review Comment Resolution -
Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias — Norman、Rivera 與 Hughes(UC Berkeley,arXiv 2606.19544,2026 年 6 月,
empirical):21 個評審/約 541K 次判斷的稽核——kappa 低估(§4.1)、跨基準測試的排名不穩定性(§4.3)、一致性與偏誤悖論(§4.7),以及 Minimum Viable Validation Protocol(§5.3);完整探討見 LLM-Judge Validation -
When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability — Yang、Hou 與 Yang(Imperial College London + Nanchang Institute of Technology,arXiv 2607.08535,2026-07-09,
empirical):評審版本不可互換(§4.1,表 3——從崩壞的解析結果中還原)、相關錯誤陪審團與經 ρ 校正的 beta-binomial(§4.3)、無法稽核的辯論造成的偏移(§4.4);完整探討見 LLM-Judge Validation -
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT — METR,2026-07-21(
empirical):「使用 LLM 評審估算 PR 的人力投入」+ 附錄 B——由 Opus-4.6 評審根據程式碼變更、提交訊息、PR 討論與時間紀錄估算人類工時;整個 PR 與提交總和的 r = 0.88,對速度提升的 R² = 0.00,對紀錄排序的 R² = 0.01;相較於貢獻者回顧估計值低估約 37%;以及套用至曲線的 α = 1.58 [1.07, 2.62] 校正。完整探討見 Expenditure Horizon -
CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation — Mengting Chen 等人(FinStep + StepFun,arXiv 2607.29252,2026-07-31,
empirical):§2.1(可測量性z_j作為可重現的可評審性,以及其與專家背書之間明確的落差)、§2.2 + 命題 1 + 附錄 B.1(一致同意率按指數 ρ^M 衰減、M = 20/40 的外推、843 項準則的實證曲線,以及在 m = 4 達峰值的非單調聯合黃金率)、§2.3 + 備註 1(變異數篩選器是能力盲的零閾值案例)、§3.3(Beta–Bernoulli 可測量性後驗分布,不需人類標籤)、§3.4–3.5 + 命題 4(以擬合能力密度中的 IRT 資訊量、次模覆蓋效用、(1 − 1/e) 貪婪保證、w_j ∝ ν_j權重、以 bootstrap 分層)、§4.2 + 表 3(JudgmentBench 上 κ 從 0.604 → 0.743、四分位數 κ 對比、r = 0.589/0.558 對 0.127、雙評審的無效結果、正標籤率 55.6–62.9% 對 47.1%)、§4.3 + 表 4(排名保真度 AUC、131 → 49 項評分規準、Greedy 對 plain-IIF 只在 15 系統區塊中達顯著、JudgmentBench 中有 9.81% 的配對被區分)、附錄 A 表 11(兩種評分者對人類參考排名的 ρ 均為 0.8833)。依兩輪規則檢視圖 1;從崩壞的解析結果中還原表 1、8、9——見wiki/sources.md -
Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science — Lin、Woodruff、Deng、Mao、Zuo 與 Mirrokni(Google Research;Woodruff 亦任職 CMU),arXiv 2609.15983 v2,2026-09-15,27 頁,
empirical。僅引用 §6:TCS-Bench 的參考輔助評分器(提供真值證明、使用另一批 100 份專家標註證明最佳化提示、準確率「>90%」、沒有 κ、沒有區間,也沒有發布標籤)、其認證的表 2 欄位,以及 AUC 0.896 的八評註跨模型路由器。逐列對照表格,確認與pdftotext -layout一致。評分器由撰寫基準測試及其所評分系統的同一個團隊設計——六位作者中有三位是 TCS-Bench 的共同作者。完整探討見 Many-Agent Proof Harnesses -
Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set — Proto_AGI(
mayafree),HuggingFace 社群文章,發布於 2026-09-20,empirical。此處僅引用 Connections 項目:四個前沿 LLM 評審在同一個共享測試集上的排名居中至後段,每次呼叫的成本高出一到三個數量級;相較之下,有 13 個非自回歸、具型別決策的驗證器。完整探討見 Typed Decision Verifiers -
Building Prod with Jev and LangGraph — Sydney Runkle 與 Hunter Lovell,LangChain 部落格,2026-09-25,
vendor-claim(Jev 整合合作夥伴)。僅引用其未量化的 Jev 作為評審、執行 100 次的穩定性主張
Cited by 59
- DRACO Benchmark×4
calibratedrubric task adaptive rubric banks — Chen et al. (FinStep + StepFun, arXiv 2607.29252,…
- LLM-Judge Validation×4
Reliability is not validity. A judge can be perfectly reproducible — return the same verdict run…
- Agent Quality Flywheel×3
The demo's most transferable lesson. Adaptive AutoRaters regenerate a rubric per case per run, so a…
- Interactivity Benchmarks×3
The scoring rule is the contribution, more than the task set. Each instance carries a reference…
- Measuring Beyond Accuracy Saturation×3
Llm As A Judge — a fifth move for the same predicament, and the one that changes what a leaderboard…
- Open Questions Backlog×3
Llm As A Judge: When does judge-lineage bias actually flip a result, versus merely shift magnitudes?
- Optimizer–Evaluator Decoupling×3
Llm As A Judge — the self-grading and judge-lineage caveats: a judge sharing training lineage with…
- Oversight When the Signals Give Out: the Activation Fallback and the Taste Reward×3
The optimizer is already modeling the grader. Evaluation Awareness And Grader Gaming and the NLA…
- Reference-Free Judge Over-Crediting×3
Llm As A Judge — the primitive this page stress-tests along the reference axis; over-crediting is…
- Same-Model Review Blindness×3
Two datasets of 500 pull requests each, one authored by Claude Code and one by Codex, identified by…
- Trained Calibration×3
Two transfers that are sharp, and both are about the parts TML did not specify. First, the weights…
- Tree Search over Agent Trajectories (LATS)×2
An LLM-as-a-judge score. Prompt a model with the action and its observation and ask, literally, for…
- AI-Assisted Error Analysis×2
Llm As A Judge — downstream consumer: a judge needs criteria, and error analysis is
- Benchmark Score Redundancy×2
Llm As A Judge — the psychometric line CollabEval measures itself against, running in the other…
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×2
Concept articles: Benchmark Score Redundancy (Zeng & Papailiopoulos, arXiv 2606.24020), Measuring…
- Content-Driven Intervention×2
A separate turn-release experiment changes the question from does it take the floor to is what it…
- Deep Research Agents×2
Deep research is a long-horizon, autonomous, multi-step task — exactly the regime Task Time Horizon…
- Document Parsing as the Retrieval Bottleneck×2
Llm As A Judge — the eval frame-shift's operative rule, "don't use the same model to generate and…
- Failures That Look Like Success×2
Blended scores absorb single-criterion failures. An adaptive judge did generate a criterion for the…
- GLM (Z.AI)×2
GLM-4.7 · A frontier-competitive reasoner. In Table 1 it beats GPT-5 High and Claude-Sonnet-4.5 on…
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It×2
Concept articles: Domestic Frontier Pacing and Frontier Ai Standards Body (the two proposals and…
- Inference-Time Architecture Search×2
Llm As A Judge — the ranker, critic, verifier and unit-test-evaluator ops are all judges, stacked…
- Motivated Mislabeling×2
Llm As A Judge — the primitive this is a failure mode of; a new failure class orthogonal to rubric…
- Offline Multi-Step Tool-Use RL (SWiRL)×2
The judge is the ceiling. Nothing is trained, nothing is calibrated, nothing is ensembled.…
- Production-Sourced Evaluation×2
And representativeness of the tasks is orthogonal to validity of the grading: a benchmark can mine…
- Security Debt of Agent-Generated Code×2
Llm As A Judge — a deployed security-gate instance with its calibration published: 0.908 aggregate…
- Self-Negotiated Contracts Between Agents×2
This is the same lever Task Gaming pulls, with the sign reversed. There, a belief that oversight is…
- Single-Rollout Optimization×2
Llm As A Judge — the online-learning reward signal is an LLM judge (GLM-4.7) scoring quality × style
- Typed Decision Verifiers×2
Consistency is not calibration. The 100-run stability claim is the vendor's "similar inputs get…
- Weak-Verifier Ensembling×2
Llm As A Judge — one of the three verifier classes, and the one the negative MAV result is about:…
- Writer/Reviewer vs Agent-to-Agent Review×2
The failure modes get worse, not better, when the stakes rise. METR and Redwood's investigation of…
- Adaptive Stopping in Evaluation Sampling
Llm As A Judge — the rubric-design consequence, which runs against this wiki's instincts. Because a…
- Agent Review Comment Resolution
Llm As A Judge — a published calibration on a fifteen-way code-review classification: open-weight…
- AI-Driven Formal Proof Search
Llm As A Judge — what open-domain research must fall back on absent a sound verifier; the contrast…
- Authority and Audit Survive Abundance
Self-reported attribution is model output. A model asked which span of a stuffed window grounded…
- Automated Behavioral Audit
Llm As A Judge — the investigator+judge-model architecture here is the same grading primitive DRACO…
- Automated Failure Attribution
Llm As A Judge — attribution is the judge paradigm pointed at a trajectory instead of an output,…
- Confident But Unsure
Llm As A Judge — a judge reading only the final answer scores this as a confident correct-format…
- Cross-Model Error Entanglement
Llm As A Judge — the practice both papers constrain. Kohli's result is the sharpest statement of it…
- CS329A: Self-Improving AI Agents (Stanford)
Homework 3 is new to this offering; one homework covers LLM-as-a-judge (Llm As A Judge) and one the…
- Deployment Simulation
Llm As A Judge — the graders that score completions and classify eval-vs-production are…
- Evals as Product Spec
Llm As A Judge — how rubric-style evals scale to open-ended output; the grading primitive behind…
- Evolutionary Proof Search
Llm As A Judge — the LLM-critic rater agents are an LLM-as-a-judge used as a fitness function:…
- Expenditure Horizon
Llm As A Judge — an unusual deployment: the judge estimates human effort from artefacts rather than…
- Gemini Enterprise Agent Platform
Google Cloud's platform for building, running, and evaluating agents — in this corpus, the…
- Google DeepMind
AutoRaters — the adaptive Llm As A Judge graders at the core of Google Cloud's Gemini Enterprise…
- Harness Activation and Adherence
Caveats before importing any number: different domain (spoken audio-visual dialogue, not agentic…
- LLM-Assisted Grey-Literature Theory Building
Llm As A Judge — the relevance filter is a canonical LLM-judge deployment (neutral versioned…
- Many-Agent Proof Harnesses
Llm As A Judge — TCS-Bench's grader is a reference-assisted judge validated at >90% on 100 expert…
- Evals & Benchmarks
Llm As A Judge — Using one LLM to grade another's outputs against criteria/rubrics; DRACO's…
- Native Multimodal Modeling: Fusion Depth and I/O Duality
A second September arrival, and this one names its own nativity as an input-side claim (added…
- Perplexity
Llm As A Judge — DRACO's grading method; Perplexity selected the judge via a human-alignment study
- Process vs Outcome Reward Models
Llm As A Judge — the untrained sibling: a prompted judge is the zero-cost PRM the lecture says you…
- Reward Hacking
Single Rollout Optimization — SAO wires an LLM judge (GLM-4.7) directly in as the RL reward…
- Structural Artifact Monitoring
Llm As A Judge — a judging shape worth naming: the model scores a deterministically computed…
- Unsanctioned Agent Message Boards
Llm As A Judge — the twelve classifier sweeps and their validation, including a taxonomy the…
- Usage-Telemetry Classifier Validation
Llm As A Judge — the general pattern; a taxonomy classifier is a judge with 18,797 options instead…
- User Awareness
Llm As A Judge — a judge-dependence axis this page does not carry: the requester's identity.…
- Verifying Without a Compiler: Cowork's Harness vs Claude Code's, and Why the Slice Verifier Stays
Cowork's harness substitutes judgment-encodings for mechanical checks. The named substitutes in the…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- LLM-Judge Validation
UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
- Reward Hacking
The model optimizing the measured proxy (a reward signal, a metric, a grader's judgment, a tool's output) rather than t…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
