H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

無參考答案評審過度給分

PublishedJuly 16, 2026FiledConceptDomainEvals & BenchmarksTagsEvaluationLLM As A JudgeBenchmarksReliabilityMultilingualReading10 minSourceAI-synthesised

Kranti & Vajjala (arXiv 2607.12885):提示中參考答案的存在與位置,是 LLM 評審做出正確/錯誤判定的第一階決定因素——在無參考設定中,評審會系統性地對錯誤答案過度給分,而加入參考答案會翻轉最多 85% 的判定(多數 NR→RV 翻轉是 CORRECT→INCORRECT 的過度給分撤回);這項效應存在於英語/阿拉伯語/泰盧固語,但在低資源泰盧固語中嚴重得多;兩階段校準(C1 對 C2:評審能否分辨對錯)+敏感度(NR/RV/RC:參考答案的存在是否翻轉判定)pipeline,可在無參考部署前診斷評審是否適用;而人類標註確認,由參考答案驅動的更嚴格判定更符合人類(Gemma 的 NR→RV 一致性約從 0.34→0.85 跳升),因此無參考絕對分數確實遭到膨脹,而不只是不同——這是與 Norman et al. 的結果正交的「有可靠性但無效度」案例,研究對象是在溫度 0 下進行二元 QA 的三個開放/開放權重評審模型

無參考答案評審過度給分的插圖

資料來源#

摘要#

LLM judge 在提示中沒有真值參考答案的情況下評分開放式答案時,往往會過度寬容——接受一些若能看到標準答案便會拒絕的錯誤答案。Kranti & Vajjala(arXiv 2607.12885,2026 年 7 月)將參考答案的存在與位置設為受控變數,並證明這是判定的第一階決定因素:在某些設定中,加入參考答案會翻轉評審對最多 85% 題目的正確/錯誤判定,而幾乎所有翻轉都是評審撤回在無參考設定中給出的分數。這項效應存在於英語、阿拉伯語和泰盧固語,但在低資源泰盧固語中大得多。人類研究確認,由參考答案驅動的更嚴格判定是更正確,而不只是更嚴格——因此無參考絕對分數確實遭到膨脹,而不只是不同。

這項工作的貢獻是診斷方法論,不是新的評審:一條兩階段 pipeline,能在部署評審進行無參考評分前,告訴你該評審對特定任務是否值得信任。它是 Norman et al.'s MVVP 的多語言、參考答案軸向對應物——第二個彼此正交的有可靠性但無效度案例。

兩階段 pipeline(校準 → 敏感度)#

評審對每個項目執行固定 pipeline:先從(通常冗長的)模型回應中擷取核心答案,再輸出 JSON 判定——extracted_answerexplanationverdict ∈ {CORRECT, INCORRECT}。兩組實驗會改變評審能看到的內容:

  • 校準——評審根本知道這項任務嗎? 一道問題+一個候選答案,只標記為「Generated Answer」(不提供正確性提示)。C1 提供正確的標準答案(期望接受率 ≈ 100%);C2 提供從同一類別另一組 QA 中取出的合理錯誤答案(期望接受率 ≈ 0%)。分離度 CGP = C1 − C2 衡量任務能力。不需要生成器模型——這是純粹的評審探測。
  • 敏感度——可以信任這個評審進行無參考評分嗎? 評審在三種參考條件下,為真實生成器模型的回應評分:NR(無參考)、RV(提示中可見參考答案,但未標示要使用)、RC(提示中明確指示要與參考答案比較)。不同設定間的判定翻轉率,量化參考答案在多大程度上移動判定;值得信任的無參考評審應該只有很少翻轉。

設定。 兩個資料集——TyDiQA(EN 445/AR 951/TE 669 道可回答問題;三個語言家族、三種文字)與 MATA(TE,540 道開放式問題,涵蓋事實與語言推理類別)。四個生成器模型(Gemini 3.1-Pro、Qwen3-32B,以及針對泰盧固語最佳化的 Sarvam-105B 與針對阿拉伯語的 Fanar-C-2-27B)× 三個評審模型——兩個開放權重模型(Qwen3-32BGemma3-27B)與一個封閉模型(Gemini-3.1-Flash-Lite-Preview)。全部採零樣本、溫度 0(因此每個評審基本上都是決定性的——可完美重現),在 Inspect framework 下執行。回應生成器/評審重疊(同一個模型 Qwen3-32B;同一個家族 Gemini/Gemma)是刻意安排,用來探測自我與同家族效應。

發現 1——校準:評審對錯誤答案過度給分,低資源語言最嚴重#

英語和阿拉伯語而言,評審能清楚分離:C1 接近 100,C2 接近 0,CGP 79–96。對泰盧固語而言,差距縮小——所有評審的 C2 都 > 0(接受一些錯誤答案),最糟的案例是MATA 上的 Gemma3-27B,C2 ≈ 60%,CGP 只有 33。解讀是:評審在高資源語言中看似校準良好,卻可能在同一任務的低資源語言中不適用。在一小組有標準答案標註的資料上執行這個低成本 C1/C2 探測,是在信任候選評審前篩選它的建議方法。

發現 2——敏感度:參考答案翻轉最多 85% 的判定,而可見性完成大部分工作#

在三種語言中,正確性分數在 NR 最高,並沿著 NR → RV → RC 單調下降——這正是隨著參考資訊出現,過度給分被撤回的特徵。兩個鮮明事實:

  • 最大的變化是 NR → RV,而不是 RV → RC。 NR→RV 翻轉率範圍為 0.09–0.85;RV→RC 僅 0.01–0.24。僅僅讓參考答案可見就會改變判定,即使提示從未要求評審與它比較。明確要求比較所增加的變化相對很少。
  • 低資源放大效應。 NR→RC 翻轉在英語為 0.29–0.37阿拉伯語為 0.36–0.60泰盧固語為 0.69–0.85。Qwen3-32B 是對參考答案最敏感的評審,在自我評估 Qwen3-32B 回應時最糟;最突出的單一儲存格是Qwen3-32B 在 Telugu-TyDiQA 上評估 Qwen3-32B:NR 0.96 → RV 0.11(翻轉率 0.85)——一旦顯示標準答案,原本看似很高的無參考分數幾乎完全崩潰。(結果表中的每個「delta」都是翻轉率——修改所佔的比例——因此按定義全都非負。)

發現 3——方向與機制:過度給分占主導,而且同一個答案會被判定得不同#

將翻轉分解為過度給分(CORRECT→INCORRECT,評審撤回分數)與低度給分(INCORRECT→CORRECT,評審給予分數):

  • 多數 NR→RV 翻轉都是過度給分(C→I)——確認 NR 分數遭到膨脹。唯一例外是 Qwen3-32B 評估 MATA 上的 Gemini3.1-Pro,兩者幾乎平均分布(0.53 C→I/0.47 I→C)。
  • RV→RC 是雙向的。 對非英語語言和多數評審而言,低度給分(I→C)占 RV→RC 翻轉的 30–70%——因此明確比較不只會讓評審更嚴格,也會挽救它們原本錯誤拒絕的答案。參考答案的呈現方式同時改變判定的頻率與方向。
  • 翻轉為何發生。 對不同設定中的評審 extracted_answer 進行精確匹配分析顯示:對英語/阿拉伯語而言,大約一半的判定變化與評審擷取出不同答案同時發生;對泰盧固語而言,即使擷取出的答案相同,判定也會改變——也就是說,在低資源案例中,參考答案改變的是如何評估同一個答案,而不是辨識出哪個答案

發現 4——人類標註:參考答案驅動的判定更正確,而不只是更嚴格#

在 400 個 MATA 回應上(事實知識+推理,是翻轉率最高的類別),兩位泰盧固語母語標註者對正確性進行標註,標註者間 Cohen's κ 為 0.96–0.99。評審與人類的一致百分比在出現參考答案後大幅上升,最大跳升發生於 NR → RV:Gemma3-27B 0.34 → 0.85Qwen3-32B 0.42 → 0.90Gemini-3.1-Flash-Lite 0.74 → 0.96;最高一致性為 0.98(Gemini-3.1-Flash-Lite 評估 Gemma3-27B 回應,RC)。RC 相較 RV 的增益較小、取決於設定且並非一致為正——這與 RV→RC 翻轉方向混合的結果一致。使這成為真正效度結果的重點是:參考答案的存取權是與人類一致的主要驅動因素,所以慷慨的無參考判定確實是錯的,而不只是另一種但同樣有效的意見。

與 Norman et al. 的關係——有可靠性但無效度,第二個案例#

這與 Norman et al. (2026) 的核心教訓相同,只是從不同方向得出。Norman 固定評審 protocol,改變benchmark(英語、純文字、停用思考),發現可重現的評審可能掩蓋位置偏差——高重測信度不一定代表有效度。這裡的評審同樣完全可重現(temp 0),卻在無參考條件下系統性地無效,而且直到加入參考答案才看得出無效。因此,這篇論文對 Norman 的開放問題——「高重測信度是否也會掩蓋位置偏差以外的偏差?」——給出肯定答案:存在一個具體且巨大的偏差——參考答案存在敏感度(最多 85% 翻轉);同時也把證據延伸到 Norman 明確缺少的多語言、低資源情境。兩篇論文都導向同一項建議:沒有外部驗證流程,絕不要信任可重現評審的絕對判定——Norman 透過機會校正+偏差稽核+跨 benchmark(MVVP);本文則透過一小組標準答案樣本,在無參考部署前執行校準+敏感度。

範圍注意事項(不要過度推論):三個特定評審模型(兩個開放權重、一個封閉)、零樣本二元 CORRECT/INCORRECT QA、三種語言、純文字。方法論不依賴特定模型與任務,但幅度並非普遍定律。

相關連結#

  • LLM-as-a-Judge——本頁沿參考答案軸向壓力測試的基本元件;過度給分是該元件絕對分數在無參考情境下的失效模式
  • LLM-Judge Validation——相鄰的部署前驗證規範(Norman et al.'s MVVP);本頁提供 Norman「位置偏差以外」開放問題所要求的參考答案存在偏差,並補充多語言證據
  • DRACO Benchmark——DRACO 在沒有單一標準答案的情況下評估開放式深度研究報告(類似無參考設定),並發現事實正確性是普遍薄弱的軸向;過度給分正是造成該弱點的機制
  • How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?——群集綜合:無參考過度給分是四通道腐化分類法中第二種評審層級無效度,而校準+敏感度 pipeline 與 MVVP 一起,成為替代方案組合中「驗證評審」的做法

開放問題#

  • 兩階段 pipeline 能否超越二元 QA? 校準+敏感度是在二元正確/錯誤事實 QA 上展示的。相同探測是否能診斷評分規範、長篇生成或多輪 agent 逐字稿中的參考答案敏感度——在那些情況下,「參考答案」是規範,而不是標準答案?
  • 過度給分是知識缺口,還是慷慨先驗? 在低資源泰盧固語中,參考答案出現後,評審會翻轉同一個擷取答案——NR 的慷慨是由任務知識不足(校準失敗)驅動,還是由參考答案能覆寫的預設傾向 CORRECT 驅動?兩者需要不同修正方式(更好的評審 vs. 一律提供參考答案)。
  • 自我/同家族重疊的貢獻有多大? 設計刻意讓生成器與評審重疊(Qwen3-32B 自我評估;Gemini/Gemma 家族),而 Qwen 自我評估對參考答案最敏感;但論文沒有將自我偏好效應與低資源效應分離。評審—生成器的 lineage 何時會放大無參考過度給分?
  • 更強或啟用思考的評審是否會減弱這項效應? 所有評審在溫度 0 且沒有推理 channel 的情況下,能力都至多屬於中階。前沿推理評審在 NR 中會較少過度給分,還是只會以不同速率翻轉?

資料來源#

  • LLM Judges Can Be Too Generous When There Is No Reference Answer——Chalamalasetti Kranti & Sowmya Vajjala(U. Potsdam / NRC Canada,arXiv 2607.12885,2026-07-14),empirical。§3(兩階段 pipeline:extract→verdict;C1/C2 校準;NR/RV/RC 敏感度)、§4(設定:TyDiQA+MATA,4 個生成器 × 3 個評審,零樣本 temp 0,Inspect)、§5.1+圖 4(校準;EN/AR 的 CGP 79–96,Telugu-MATA 上 Gemma3-27B 的 C2≈60%/CGP 33)、§5.2+表 1(NR→RV 翻轉 0.09–0.85,RV→RC 0.01–0.24;Q3/Q3 Telugu NR 0.96→RV 0.11,翻轉 0.85;NR→RC:EN 0.29–0.37/AR 0.36–0.60/TE 0.69–0.85)、圖 5(翻轉方向;過度給分主導 NR→RV,I→C 占 RV→RC 的 30–70%)、圖 6(擷取答案與判定穩定性;泰盧固語在擷取答案相同時判定仍翻轉)、§5.3+表 2(人類一致性;Gemma 的 NR→RV 從 0.34→0.85、Qwen 從 0.42→0.90、Gemini-FL 從 0.74→0.96;峰值 0.98;標註者間 κ 0.96–0.99)
§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 15
Related articles
  • LLM-as-a-Judge

    Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…

  • LLM-Judge Validation

    UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…

  • Optimizer–Evaluator Decoupling

    The architectural rule in eval-fix loops that whatever proposes a fix (coding agent, automated optimizer, human) never…

  • Open Questions Backlog

    _456 actionable open questions across 205 pages · 107 predictions · 9 notes · 147 in progress · 69 watching (entities),…

  • Failures That Look Like Success

    The quiet agent-failure class where everything reads fine — confident answer, plausible plan, even correct internal sta…