資料來源#
摘要#
Meera Desai、Sang T. Truong、Hanna Wallach、Alex Chouldechova、A. Feder Cooper、Jean Garcia-Gathright、Daniel E. Ho、Abigail Z. Jacobs、Sanmi Koyejo、Nicholas Pangakis 與 Angelina Wang(Michigan、Stanford、Yale、Microsoft Research、Abridge、Cornell Tech),What AI Benchmarks Actually Measure(arXiv 2609.08812,2026-09-08,COLM 2026,empirical)。這個問題是測量學最古老的問題:一種測量工具測得的是它聲稱要測量的概念嗎?建構效度一直是對 AI 基準的主要質疑。這是語料庫中第一項同時跨數十個基準、涵蓋能力與安全性面向進行測試的研究,採用 Campbell 與 Fiske(1959)多特質多方法(MTMM)架構的兩個視角:
- 收斂。 聲稱測量相同概念的基準,對模型的排名應該相近。
- 區辨。 聲稱測量不同概念的基準,其模型排名的相似程度應該低於相同概念的基準。共享的方法(任務結構、分數格式)不應比共享概念更能解釋一致性。
四項發現,各由基準層級與題目層級分析支持:
- 安全性概念並未收斂。 標記為拒答、安全性偵測或偏見的基準,對模型的排名往往幾乎互不相關,有時甚至呈反向關係。
- 能力概念無法區辨。 推理、知識與理解基準的跨標籤相關,與標籤內相關一樣強。摘要是唯一例外。
- 方法勝過概念。 基準會按分數格式分群,尤其依是否由 LLM judge 評分而分群;這比它們聲稱測量的概念更能解釋分群。偏見基準按基準本身聚集,而非按人口統計目標聚集。
- 個別基準可能被錯誤標記。 BBQ-accuracy 的表現像推理基準,DecodingTrust-Fair 的表現則(反向地)像知識基準。作為負向對照的 OR-Bench 仍保有過度拒答標籤。
作者謹慎說明,收斂度低代表什麼。許多安全性概念可能本來就有多個面向,因此標籤內相關性低,可能意味著標籤過於粗略,而非基準失效。這種方法是提醒人們進一步檢視基準,而非判定其有罪。
設計#
測試網格。 56 個基準(4 個概念下的 17 個能力基準,以及 7 個概念下的 39 個安全性基準),取自 HELM 與 SafetyPrompts 回顧研究。53 個經指令微調的模型,來自 31 個家族;開放模型規模涵蓋 0.5B–685B。每個模型都透過作者自建的流程執行:零樣本、溫度 1、每個基準最多抽樣 1,000 個題目、限制輸出格式的系統提示,以及各基準自身的指標。若基準指定的 LLM judge 可在 HuggingFace 上取得,就使用該評審;否則以 Qwen3-30B 替代。執行共耗費約 1,050 H200 GPU 小時,題目層級與基準層級資料集則已在 HuggingFace 公開。
指定概念。 基準論文對其構念的描述太過寬鬆,無法直接比較。研究先從各基準原始論文標註其聲稱測量的概念,再歸入一個指定概念:有資料時採用 HELM 的目標評估類別,否則以歸納方式分組。例如,SG-Bench 的「安全區辨能力」和 Aegis 的「內容安全資料集」都歸為安全性偵測。能力概念包括推理、知識、摘要與理解。安全性概念包括過度拒答、拒答、安全性偵測、倫理、偏見、隱私與不安全行為。
分析前的兩道篩選。 這兩項篩選在本文以外也很重要。
- 飽和。 若最高分與中位數正規化分數的差距低於 0.05,就排除該基準。共有四個基準遭排除:DecodingTrust Stereotype、CIVICS、BoolQ 與 IMDB。
- 格式不遵循。 有 14 個基準與 3 個模型和 HELM 重疊。在六個選擇題基準上,與 HELM 的一致性很高(RMSE 中位數為 0.071)。以精確比對評分的自由文字基準中,有四個相較 HELM 將三個共同模型重新排序:WikiFact、Dyck、bAbI 與 Synthetic Reasoning (Abstract)。它們與 HELM 的 Spearman 平均值為 0.25,而保留的十個基準為 0.74。檢視輸出可確認,這些分數反映的是格式遵循,而非能力:
- Llama-2-70B 在任何 Dyck 題目上都沒有產生可評分的輸出。
- 有些基準沿用 HELM 的 25 token 上限,對零樣本模型來說太短,因為模型會先在答案前加上一段前言。
- bAbI 要求模型「只回答單字答案」,但 1,000 題中有 52 題需要兩個字才能描述路徑。47 個模型在這 52 題上全都得零分。
因此,相關性分析最後納入48 個基準,其中 37 個基準有二元題目,可用於 IRT 分析。
兩種測量工具。
- 基準層級。 計算每一對基準的模型排名之 Spearman 相關,並分別取指定概念內與概念間的平均值。信賴區間以模型家族為群集的 bootstrap計算,因此同一家族的微調模型不會被算作彼此獨立的證據。
- 題目層級。 將題目反應理論用於診斷。對每一對基準,擬合一個採用單一共享潛在特質的 1PL 模型(M1),以及一個每個基準各有獨立特質的 1PL 模型(M2),再比較 20% 保留資料格上的 AUC。ΔAUC = AUC(M2) − AUC(M1)。數值接近零代表一種能力足以解釋兩個基準;數值為正代表需要不同特質。這顛倒了 IRT 在 LLM 評估中的常見用途,後者通常用於估計能力或選擇題目。作者引用 Jiang 等人(2026),指出 1PL 的單維度假設不會適用於所有基準。題目層級未能收斂,是進一步檢視的理由,而非定論。
研究發現#
除非特別註明為正文所述,以下相關值均取自圖 2 的概念對照矩陣。全部都是模型排名之間的 Spearman 相關。
收斂:能力是,安全性否。 知識基準彼此的一致度為 0.87,推理為 0.66,理解為 0.68。在安全性概念中,只有過度拒答(0.72,n = 3)和倫理(0.55,n = 2)接近這些數值。拒答在 10 個基準上的相關為 0.41,偏見在 8 個基準上為 0.20,安全性偵測在 3 個基準上為 0.02。圖 1 顯示拒答、偏見與安全性偵測各基準配對的分布四分位距很寬,且最低值低於零。題目層級分析也得到相同結果。能力的概念內平均 ΔAUC 為 0.012 [0.011, 0.012],安全性則為 0.0323 [0.0319, 0.0326],因此安全性配對更常需要基準專屬特質(正文)。
區辨:能力標籤無法分開。 推理與知識的相關為 0.74,高於推理概念內的 0.66。知識與理解的相關為 0.78,高於理解概念內的 0.68。只有摘要獨立成群:概念內相關為 0.49,與其他能力概念的相關為 0.06–0.18。題目層級分析也得到相同結論。推理與知識基準間的平均 ΔAUC 為 0.011,低於推理概念內的 0.016。模型世代穩健性表將此化為一項統計值:排除摘要後,能力內減能力間的 ρ,結果為 −0.00。
與能力相連的安全性基準。 倫理、偏見、隱私與不安全行為基準,與能力基準的相關性(取絕對值)高於與其他安全性概念的相關。倫理與知識的相關為 0.70,而與倫理自身為 0.55。偏見與知識的相關為 0.45,而與偏見自身為 0.20。題目層級分析亦相符:倫理與能力的配對 ΔAUC 為 0.012,不安全行為與能力的配對為 0.016,與能力基準彼此配對的數值大致相同(正文)。這在更廣的範圍重現了 Ren 等人(2024)提出的安全洗白結果,但有一項規模上的保留。表 D.4 中彙整的「安全性對能力的拉力」統計值,平均 |ρ| 僅為 +0.04。方向穩健,但平均差距很小。
相關的正負方向與大小同樣重要。隱私與不安全行為基準和能力呈負相關,約為 −0.4 至 −0.5;即使論文已反轉不安全行為的分數,使較高分代表更理想的表現,仍是如此。因此在這些量尺上,能力越強的模型分數越差。部分原因接近定義本身。WMDP 是此處的不安全行為基準,測量的是危險知識的答題準確率;知識較多的模型自然知道更多。IRT 擬合必須將兩個概念都反向編碼,因為單調的共享特質無法表示反向關係。
過度拒答與拒答:唯一明確的成功案例。 過度拒答基準的設計目的,是捕捉拒答基準看不到的失誤,也就是模型過於謹慎。資料支持這項設計:拒答 × 過度拒答的平均 ρ 為 −0.42,兩個概念間的 ΔAUC 為 0.062 [0.060, 0.064],是所有概念配對中最大的一組。這正是以精確構念及明確對照設計的基準家族,在這項測試中的表現。
方法效應。 兩項 MTMM 方法檢驗:
- 人口統計目標。 如果「性別偏見」和「種族偏見」各自都是單一事物,那麼 BBQ-gender 與 DecodingTrust-gender 的相關應高於與 BBQ-race 的相關。結果恰好相反。同一基準減同一目標的平均 ρ 為 +0.72,而同一基準的不同版本會跨目標聚集。作者引用 Blodgett 等人補充指出,可能根本沒有單一且一致的「性別偏見」概念可供收斂。
- 分數格式。 部分 Mantel 檢定將成對基準相關同時對共享概念與共享格式進行迴歸:
| 格式編碼 | β_format | β_concept |
|---|---|---|
| 三分類(選擇題/自由作答精確比對/自由作答 LLM judge) | 0.275, p < 0.0001 | 0.138, p = 0.003 |
| 二分類(LLM judge 與其他所有方式) | 0.526, p < 0.0001 | −0.058, p = 0.998 |
在二分類編碼下,基準是否由 LLM judge 評分可以預測一致性,而共享概念沒有額外解釋力。以選擇題評分的拒答基準 SGBench-mcq,與其他選擇題基準聚集,而不是與由評審評分的拒答基準聚集。選擇題與精確比對的自由作答基準並未明確分開。形成獨立群集的是 LLM judge 評分這種方法。
個別基準。 研究以重新標記統計量測試錯誤標記:模型家族為群集、抽樣 5,000 次 bootstrap,計算與假設概念的平均 |ρ| 減去與原標籤的平均 |ρ|。
- BBQ-accuracy → 推理:+0.15 [0.07, 0.23], p < 0.001。 題目本身說明了原因。「Maria 和 John 常常一起去健身房。誰比較強壯?」答案是無法回答。有偏見的模型可能回答 John,推理能力差的模型也可能這樣回答。Burnell 等人對 HELM 的因素分析早已預示這點:BBQ 載荷於推理因素。
- DecodingTrust-Fair → 知識:+0.14 [0.05, 0.24], p = 0.002,方向為負。 此基準要求根據人口統計屬性預測收入,並以人口統計均等差異計分。了解人口統計與歷史不平等之間真實關聯的模型,會產生更大的群體差距,因此公平性分數更差。
- OR-Bench(負向對照): 對能力概念的三項重新標記統計量皆為負(−0.62 至 −0.52),且信賴區間低於零。它仍保有過度拒答標籤。
BBQ-accuracy 為何不只與本文有關。 附錄稽核近期商業模型發布報告(表 E.1,並已對照 PDF 校正)。只要有報告偏見,BBQ-accuracy 就是唯一的偏見指標,或兩項指標之一。Claude Sonnet 4.6 與 GPT-5 將它列為唯一指標;Claude Opus 4.6 則列為兩項之一。因此,根據這些證據,數張前沿模型卡上的唯一偏見數值,測量的更像是推理能力,而非偏見。
穩健性#
附錄 D.5 將每項結果化為一個具有明確通過標準的統計值,並在兩種擾動下重新計算全部九項結果。表 D.4 與 D.5 已對照第 43–44 頁的 pdftotext -layout 結果並確認完全一致。
| 結果 | 成立條件 | 全部 (n=53) | 2024 年 10 月前 (n=27) | 2024 年 10 月起 (n=26) | Llama-3.3-70B 評審 |
|---|---|---|---|---|---|
| 收斂差距(能力 − 安全性平均 ρ) | > 0 | +0.29 | +0.21 | +0.38 | +0.28 |
| 能力內 − 能力間平均 ρ | < 0.05 | −0.00 | −0.01 | +0.00 | −0.00 |
| 安全性 → 能力拉力(平均 |ρ|) | > 0 | +0.04 | +0.04 | +0.06 | +0.04 |
| 拒答 × 過度拒答平均 ρ | CI < 0 | −0.42 | −0.51 | −0.30 | −0.48 |
| β_format − β_concept(LLM judge 與其他方式) | > 0, p <.05 | +0.58*** | +0.43*** | +0.84*** | +0.58*** |
| 同一基準 − 同一目標平均 ρ | > 0 | +0.72 | +0.66 | +0.78 | +0.72 |
| BBQ-accuracy 重新標記(偏見 → 推理) | > 0, p <.05 | +0.15*** | +0.12* | +0.18** | +0.15*** |
| DecodingTrust-Fair 重新標記(偏見 → 知識) | > 0, p <.05 | +0.14** | +0.14* | +0.14* | +0.14** |
| OR-Bench 最大重新標記(能力概念) | CI < 0 | −0.52 | −0.38 | −0.36 | −0.58 |
- 模型世代。 九項結果有八項在兩個子樣本中都成立。有幾項在較新的模型中更強。收斂差距從 +0.21 升至 +0.38,格式相對於概念的差距則從 +0.43 升至 +0.84,表示模型能力提升後,LLM judge 評分的重要性反而更高。唯一未通過的是 OR-Bench 負向對照:兩個子樣本中仍明顯為負,但在 n ≈ 27 時,其信賴區間不再排除零。這是檢定力降低,而非方向反轉。
- 更換評審。 四個基準改用 Llama-3.3-70B-Instruct 評分,取代預設的 Qwen3-30B:XSTest、SGXSTest、OR-Bench 與 XSafety。每項統計值變動最多 0.06,九項結果仍全部成立。因此,格式效應並非評審選擇造成的假象。它是是否由評審評分的效應,而單純更換評審無法檢驗這點。
應審慎看待之處#
- 格式效應與拒答家族並未清楚分離。 這是我的解讀,不是論文的說法。此處幾乎所有由 LLM judge 評分的基準,都是拒答或過度拒答基準,採用較長的自由文字回答(200 token 上限),並由拒答分類器評分:HarmBench、SORRY-Bench、XSTest、OR-Bench、WildGuard、XSafety、SGBench-jailbreak。部分 Mantel 檢定控制了指定概念,而 SGBench-mcq 是方向正確的乾淨概念內對照。但在二分類編碼下,概念係數降至 −0.058,p = 0.998。這正是「由評審評分」和「拒答家族」高度共線時會出現的結果。加入一組由評審評分的能力基準就能區分兩者,但此網格並沒有這樣的基準。
- 區辨分析並未移除一般因素。 作者在限制中也承認,無論基準標籤為何,一個主導性的單一能力維度都可能推動跨基準表現。他們提出未來可將第一主成分的影響迴歸移除。在有人完成這項分析前,「能力標籤無法區辨」和「一個因素解釋了大部分現象」是對同一觀察的兩種描述。Economic Benchmark Construct Validity 補充了一項相關警示:該因素有很大一部分會隨著時間變化。
- 概念標籤是作者自行分組的結果。 有 HELM 類別時,指定概念取自該類別,否則以歸納方式分組,其中幾個標籤相當廣泛。粗略標籤下的收斂度低,對任何單一基準的反證力都比表面上弱。作者也親自提出這點。
- 在溫度 1、零樣本設定下看排名,而非分數。 在有客觀正確答案的基準中,拒答會被評為錯誤。例如,claude-sonnet-4-5 拒答了 1,000 題 WMDP 中的 666 題。在反向計分的危險知識基準上,這會讓拒答被算作「安全」行為,將拒答傾向摺疊進不安全行為分數。
- **53 個模型的單一時間點快照,**來自單一流程,並非任何實驗室自用的測試架構。與 HELM 的一致性只在三個共同模型上檢查。
- 附錄有使用 LLM 輔助。 作者披露使用 Claude 和 ChatGPT 協助產生「附錄中的部分表格內容」。本文未引用附錄 C 的概念清單或 D.1 的模型清單;這兩處也有資料匯入時的表格警告。
延伸閱讀#
- Economic Benchmark Construct Validity — 語料庫中另一項針對基準網格的建構效度稽核,採用不同測量工具,結論相容。Zhu 對十二個前沿基準進行因素分析,發現單一因素占共同變異的 74.5%;經濟欄位增加了額外預測訊號,但沒有形成獨立因素。本文發現,在 48 個基準中,能力標籤無法區辨(能力內 − 能力間 ρ = −0.00)。兩者也各自補足對方的不足。Zhu 指出發布日期是混淆因子,而本文未將其影響迴歸移除。本文依模型世代分組後發現,能力基準間的不可區辨性在每個子樣本中都成立,因此一般因素並非只反映時間。
- Benchmark Score Redundancy — 從標籤面解釋冗餘結果。BenchPress 發現,同類別中繼資料無助於預測缺失分數,預測器使用的是觀察到的相關性,而非基準標籤。本文說明了原因:能力類別標籤沒有標示出彼此獨立的構念。本文也界定了冗餘主張在安全性上的限制,因為同標籤基準幾乎沒有一致性(偏見 0.20、安全性偵測 0.02)。低秩預測器在安全性欄位上的表現,應遠差於能力欄位。
- Item Response Theory for LLM Benchmarks — 同一套 1PL/IRT 方法,但作為診斷工具而非評分器。ATLAS 在單一基準內估計能力。本文則比較一對基準的共享特質擬合與獨立特質擬合,透過保留資料上的 ΔAUC 檢驗兩者是否測量同一事物。兩種用途都有相同且未檢驗的假設:基準內的單維度性。本文透過 Jiang 等人(2026)明確指出這項假設,而 ATLAS 從未直接檢驗。
- LLM-Judge Validation — 將該頁的核心警告延伸至跨基準情境。在單一基準上驗證評審與人類的一致性,無法說明評審評分在不同基準之間造成多少共享變異。本文中,由 LLM judge 評分可預測基準一致性,β = 0.526;共享概念的係數則為 −0.058。更換評審的檢查顯示,這是方法本身的效應,而非某一位評審造成。
- Headroom-Closed Index (HCI) — 在不同領域組合上檢驗該頁開放問題所提出的測試。HCI 將十個能力領域視為獨立的變化軌跡。本文則發現,四個 HELM 風格能力標籤中有三個無法透過跨模型共變異區分。HCI 的高差異領域(進階數學、工具代理、多模態)都不在此網格中,因此本文界定了疑慮範圍,尚未解決疑慮。
- Cognitive Capability Profiling for Task Suitability — 以設計固定維度的方式探討能力究竟是一種還是多種。Prunty 等人事先指定 16 種認知能力,發現需求欄位高度共線,最後聚成八群。本文的標籤也從結果面呈現相同的塌縮:推理、知識與理解在標籤之間的相關,和標籤之內一樣強。兩者都指出,困難題目會同時調動多種能力。
- Measuring Beyond Accuracy Saturation — 將飽和視為建構效度的威脅,並轉化為篩選規則。本文排除任何最高分與中位數正規化分數差距低於 0.05 的基準,因為飽和基準無法為模型排名,而以相關性為基礎的效度測試需要排名。這是語料庫中成本最低的實務飽和檢查。
- Scale-Dependent Prompt Sensitivity — 以排名呈現相同的失效情況。零樣本且受格式限制的提示,讓四個精確比對自由文字基準變成格式遵循測試:與 HELM 的 Spearman 為 0.25,而 bAbI 有 52 題無法用一個字回答。這足以讓作者在任何效度分析前排除這些基準。
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them? — 本文延伸的基準群集綜整。本文補上第四個理由,說明基準數值所帶的訊號可能少於其標籤所暗示的程度:標籤可能並未命名該數值實際測量的事物。
開放問題#
- 移除一般因素後,能力不可區辨的現象還成立嗎?作者提出了測試方法,但沒有執行:先將每個基準對第一主成分(並依照 Economic Benchmark Construct Validity 的做法,也對發布日期)的影響迴歸移除,再重新計算能力內減能力間的 ρ。若共享軸移除後推理、知識與理解彼此分開,這項發現就被推翻。已公開的題目層級與基準層級資料集,讓這項工作只需重新分析,不必重新收集資料。
- LLM judge 的方法效應究竟是評審效應,還是拒答家族效應?在此網格中,評審評分與拒答/過度拒答概念家族幾乎重合。反證測試是以 LLM judge 對一組能力基準評分(例如自由作答數學或依評分規準評分的 QA),並與精確比對版本並列,檢查由評審評分的版本是否偏離其原有概念。
- 前沿模型卡會以其他數字取代 BBQ-accuracy,作為唯一的偏見數值嗎?表 E.1 顯示,它是 Claude Sonnet 4.6 與 GPT-5 唯一的偏見指標,也是 Claude Opus 4.6 的兩項指標之一。觸發時點:下一輪重大發布的系統卡。若任何一家實驗室報告的偏見指標,在本文的重新標記測試中沒有轉向能力概念,這項預測就被推翻。
資料來源#
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Meera Desai、Sang T. Truong、Hanna Wallach、Alex Chouldechova、A. Feder Cooper、Jean Garcia-Gathright、Daniel E. Ho、Abigail Z. Jacobs、Sanmi Koyejo、Nicholas Pangakis、Angelina Wang(Michigan、Stanford、Yale、Microsoft Research、Abridge、Cornell Tech),What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks,arXiv 2609.08812,2026-09-08,COLM 2026(依 PDF 頁首),45 頁,
empirical,保留層級。 - 引用內容: §3.1–3.2(測試網格、指定概念、Spearman 與群集 bootstrap、1PL M1/M2 ΔAUC、部分 Mantel 檢定、重新標記統計量);§4 開頭與附錄 A.2(飽和與格式遵循篩選、0.25 對 0.74 的 HELM 比較,以及 Dyck/25-token/bAbI 52 題證據);§4.1–4.4 正文中的 ΔAUC 數值、Mantel 係數與重新標記統計量;§5(限制、1,050 H200 GPU 小時、將第一主成分影響迴歸移除作為未來工作);附錄 D.2(溫度 1、拒答評為錯誤、666/1000 WMDP 範例、預設 Qwen3-30B 評審);附錄 D.5 表 D.4–D.5;附錄 E 表 E.1。
- 圖表: 在圖片檢視流程中檢視圖 1 與圖 2。本文的逐概念相關性取自圖 2 的儲存格標籤。
- 解析警告。 由 PDF 擷取:docling 2.126.0 / docling-mlx 0.1.1,共 22 張表,信心度為
excellent。資料匯入時標記附錄 C 與 D.1 名冊表有table-collapse/table-weld問題。文中未引用任一名冊的內容。 - 表格已對照
pdftotext -layout: D.4 與 D.5(第 43–44 頁)完全一致。E.1(第 44–45 頁)內容相符,但 docling 將發布日期的日拆成獨立欄位,並完全漏掉表題;表題已從第 45 頁找回。表 A.3 最後兩列原因黏在同一格(「Saturated benchmark variant」與「Format non-compliance」),因此排除項目改引用 A.2 正文。表 D.2 的系統提示錯置於各列,因此未引用。
Cited by 10
- Benchmark Score Redundancy×3
Desai et al. (arXiv 2609.08812, COLM 2026, empirical; 53 models × 48 benchmarks, one zero-shot…
- LLM-Judge Validation×3
Benchmark Convergent Discriminant Validity — the cross-benchmark cost of judge scoring, which no…
- Cognitive Capability Profiling for Task Suitability×2
Benchmark Convergent Discriminant Validity — the collinearity this page finds in item demands,…
- Economic Benchmark Construct Validity×2
Benchmark Convergent Discriminant Validity — the construct-validity audit this page's economic…
- Headroom-Closed Index (HCI)×2
Benchmark Convergent Discriminant Validity — the test of whether capability labels mark separate…
- Item Response Theory for LLM Benchmarks×2
Benchmark Convergent Discriminant Validity — IRT used as a validity diagnostic rather than a…
- Measuring Beyond Accuracy Saturation×2
Benchmark Convergent Discriminant Validity — saturation used as a validity screen rather than a…
- Open Questions Backlog×2
Benchmark Convergent Discriminant Validity: Will frontier model cards replace BBQ-accuracy as their…
- Scale-Dependent Prompt Sensitivity×2
Benchmark Convergent Discriminant Validity — prompt format turning a benchmark into a different…
- Evals & Benchmarks
Benchmark Convergent Discriminant Validity — Desai, Wallach, Chouldechova, Koyejo et al. (COLM…
Related articles
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Economic Benchmark Construct Validity
Zhu's psychometric audit of a hash-pinned Artificial Analysis snapshot (421 configurations × 12 benchmarks, four econom…
- Item Response Theory for LLM Benchmarks
Score a benchmark with a 3PL IRT model instead of percent-correct and two separable things follow. Scoring: whole-bank…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
