資料來源#
- Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
摘要#
項目反應理論是標準化測驗背後的測量模型:每個試題都有自己的難度 b、鑑別度 a 與下漸近線 c,每位受試者則有一個潛在的能力 θ,其量尺不受實際施測了哪些試題影響。Li、Tang、Chen、Cheng、Metoyer、Hua 與 Chawla(Notre Dame、ATLAS,arXiv 2511.04689,ICML 2026,empirical)首次將此方法應用於如此大規模的 LLM 基準測驗——在五項基準測驗(WinoGrande、TruthfulQA、HellaSwag、GSM8K、ARC)中,每項都對 3,467–4,680 個 HuggingFace Open LLM Leaderboard 模型進行 3PL 校準——並提出兩項常被合併報導、但最好分開看待的發現:
- 計分主張。 以整個題庫的
θ̂取代答對率,會重新排列排行榜,而且新的排序比原排序更穩定。這使用了整個題庫,與自適應測驗無關。 - 施測主張。 依 Fisher 資訊量選題,並在
SE(θ̂) ≤ τ時停止,可用 30–89 題重現整個題庫的θ̂。這是關於必須施測多少題的效率結果,並未說明θ是否為合適的量尺。
把兩者分開很重要,因為摘要主打的是第二項(「最多減少 90% 的題數」),而第一項才會改變基準測驗分數的意義。
計分主張:準確率相同,能力不同#
其原理正是 IRT 的設計初衷。答對一道困難且鑑別力高的題目,是能力高的有力證據;答對一道容易的題目則理所當然,幾乎不提供額外資訊。答對率卻給兩者相同權重。因此,兩個模型的準確率可能相同,θ 卻能將它們區分開來:
- WinoGrande(圖 2): 兩個模型的準確率同為 0.833,但
θ̂ = 1.2與θ̂ = 0.6。模型 A 答對的題目集中在難度帶 D6–D9,模型 B 則集中在 D1–D4。 - ARC(圖 7):
mera-mix-4x7B的準確率為 0.713,整個題庫的能力排名為 270;LLaMAntino-3-ANITA-8B-Inst-DPO-ITA的準確率為 0.714,排名卻是 2,612。準確率只差 0.001,能力排名相差 2,342 位。 - HellaSwag(圖 8): 兩個模型的準確率同為 0.853,能力排名卻分別是 347 與 3,074。
在整體模型群體中(圖 3):準確率與能力值在 GSM8K 的 Spearman 相關為 0.99,在 HellaSwag 為 0.96(Kendall 相關為 0.92 / 0.84);然而,GSM8K 有 23%、HellaSwag 有 31% 的模型名次移動超過 10 位。這個組合正是重點——在約 4,000 個模型中,排名相關高達 0.99,仍有四分之一的模型名次偏差超過十位,因為排名相關主要受廣泛的能力範圍支配,而歧異集中在密集的中段與兩端。
在極端區域,準確率會徹底失靈。低表現區的準確率擠在 0.10–0.15 範圍內,而 θ 約從 −3 到 −1;高端則因天花板效應使準確率壓縮,θ 卻仍能在 1.5 到 2.5 之間分辨差異。這是將準確率飽和問題表述為測量特性,而非基準測驗生命週期問題——參見超越準確率飽和的測量。
重新排序反映訊號還是雜訊?#
最直接的質疑是,θ̂ 只是增加估計變異,並打亂平手結果。論文用兩種方式回應,第二種證據遠強於第一種(表 4,並已對照 pdftotext 核對):
| 測試 | 原始準確率 | 能力 θ̂ | Δ |
|---|---|---|---|
| 半份題庫排名穩定性,WinoGrande | 0.943 | 0.981 | +0.038 |
| …TruthfulQA | 0.981 | 0.992 | +0.011 |
| …GSM8K | 0.985 | 0.993 | +0.008 |
| …ARC | 0.968 | 0.977 | +0.008 |
| …HellaSwag | 0.994 | 0.996 | +0.002 |
| GSM8K ↔ MMLU 國小數學 | 0.504 | 0.738 | +0.234 |
| MMLU 大學化學 ↔ MMLU 高中化學 | 0.439 | 0.904 | +0.465 |
半份題庫測試(將題目隨機分成 10 份,計算兩個半題庫排名的 Spearman 相關)除了微幅提升外,整體都有改善;但幅度不大,而且準確率基準本來就 ≥ 0.94——這項測試主要表明 θ̂ 沒有更差。真正關鍵的是跨基準測驗的結果:兩個理應測量近乎相同能力的 MMLU 化學科目,原始準確率排名的相關為 0.439,能力排名則為 0.904。這是外部聚合效度,而非內部一致性,也是本文唯一顯示重新排序追蹤到真實特質、而非另一種任意量尺的證據。
施測主張:Fisher 資訊量與以精確度為基礎的停止規則#
ATLAS 這套演算法是教科書式的電腦化自適應測驗(CAT),並針對 LLM 做了幾項調整:
- 校準。 每項基準測驗各自校準 3PL 模型,並先排除反應標準差 < 1%、平均準確率 > 95%,或點二系列相關
r_pb < 0.1的試題。進入測量之前,飽和且缺乏鑑別力的試題就會直接剔除——面對飽和基準測驗,心理計量學的做法是刪除失效題目,而不是退役整項基準測驗。 - 分區並連結。 一次對 5,600 題的題庫擬合 3PL,複雜度為
O(|I|³);因此改將題庫分成K個互不重疊、各至少 100 題的子集(K= 6–50),分別校準,再透過平均數-標準差轉換,以共同受試者連結對齊暫定量尺。每個模型都回答每一道題,所以模型群體本身就是錨定集合——人類測驗沒有這種選項(沒有疲勞、練習效應或時間限制)。複雜度降為O(K · maxₖ|Iₖ|³)。 - 自適應施測。 從
θ̂₀ = 0開始;每次作答後,計算所有未施測題目的 Fisher 資訊量,再從最高的 5 題中隨機抽選(randomesque 選題,以免某一類題目曝光過度);以 EAP 更新θ̂;當SE(θ̂) ≤ τ時停止,其中τ ∈ {0.1, 0.2, 0.3},最低 30 題、最高 500 題。
以保留模型上的整個題庫 θ̂ 為基準評估(表 2 與表 9,均已核對):
| 基準測驗(題庫大小) | ATLAS 最佳能力 MAE | 題數 | 隨機抽 100 題 MAE | 最佳靜態基準方法 |
|---|---|---|---|---|
| WinoGrande (1,045) | 0.155 | 70 | 0.167 | MetaBench-P 0.152 @ 133 |
| TruthfulQA (627) | 0.064 | 48 | 0.103 | MetaBench-S 0.072 @ 136 |
| HellaSwag (5,600) | 0.157 | 41 | 0.240 | TinyBenchmarks 0.198 @ 97 |
| GSM8K (1,306) | 0.150 | 70 | 0.150 | MetaBench-S 0.096 @ 249 |
| ARC (839) | 0.084 | 89 | 0.183 | MetaBench-P/S 0.134 @ 145/100 |
誠實的解讀是:ATLAS 在每單位誤差所需題數方面明顯勝出——它在每項基準測驗上的資訊效率分數最低(IES = (MAE_method/MAE_random) × (Items/100)),介於 0.193–0.655。它在誤差方面則沒有全面勝出。在 GSM8K 上,它最佳的能力 MAE 與隨機抽 100 題的基準完全相同(0.150),且不如 MetaBench-Secondary(0.096,但用 249 題);在 WinoGrande 上則幾乎與 MetaBench-Primary 打平。能成立的主張是*「精確度相同,所需題數大幅減少」,而不是「更準確」*。
在準確率量尺上,表現更弱。 以 p-IRT 估計器從 θ̂ 還原答對率(表 3 與表 10),所有基準測驗的 MAE 都低於 5%——論文以此證明 θ 保留了整體表現結構——但 ATLAS 並非最佳還原方法。在 GSM8K 上,它的 MAE 為 0.039,高於隨機抽 100 題的 0.026 與 MetaBench-S 的 0.020,且其 IES 超過 1(1.055):若目標是估計準確率,用 70 題的 ATLAS 比隨機抽樣還沒效率。自適應機制是為能力估計最佳化;準確率還原只是它尚可處理的副產品。
「最多減少 90%」實際指什麼#
摘要所說的「所需題數最多減少 90%」不是實測出的減幅,而是以最多 500 題的上限,對照最大題庫所做的算術推算(「此上限控制計算成本,並使測驗長度相較於完整基準測驗約減少 90%」)。實測減幅更大,而且會依模型而異,因為測驗長度是停止規則的輸出,而非預先設定的參數:HellaSwag 的 5,600 題中只需 41 題,減幅為 99.3%;在 τ = 0.3 時,每項基準測驗都只需 30–32 題(95–99.5% 的題庫未使用)。有兩點值得記住:
- 減幅是在固定精確度下達成(潛在量尺上的
SE(θ̂) ≤ τ),而非在與完整測驗分數維持固定相關的條件下達成。相對於整個題庫的 MAE 數字,是對精確度目標所做的事後驗證,並非目標本身。若讀者想知道「題數減少 90%,同時與已發表排行榜的相關仍 ≥ 0.99」,這套設計並未回答此問題。 - 題庫已先經過篩選。上述分母(627–5,600)是篩選後的數字;篩選前的題數從未報告,因此相較於實際發布的基準測驗,減幅更大但無從量化。
執行時間是這套方法能實用的原因:每個模型端對端需 9.4–75.5 秒(表 11),並隨題庫大小變動。兩個模型的題目序列重疊率為 11.3–23.7%,平均題目曝光率低於 12%,因此自適應題池確實持續輪替——41 題測驗的污染面並非固定的 41 題。
心理計量學上的嚴謹作法及其界線#
論文最突出的方法學貢獻不是 ATLAS,而是指出先前以 IRT 減少基準測驗題數的研究從未報告模型適配度,而實際計算後發現結果不佳。使用 TinyBenchmarks 與 MetaBench 公開的 IRT 程式碼計算 M₂/RMSEA(表 1):
- TinyBenchmarks:五項基準測驗全都嚴重不適配——原因是只用 395 個模型,卻估計多達 15 個潛在特質。(印出的儲存格在標為「RMSEA」的欄標下顯示 364.24 / 371.49 / 646.82 / 506.60 / 369.89;RMSEA 的定義上限有限,因此這些實際上是被印在錯誤欄位中的 M₂ 統計量。已對照
pdftotext核實——錯誤在論文本身,而非解析結果。引用時應採用質性判斷「Poor」,而非這些數字。) - MetaBench:RMSEA 為 0.0423–0.1389;HellaSwag 與 GSM8K 適配良好,ARC 勉強可接受,TruthfulQA 適配不佳。
- ATLAS:RMSEA 為 0.0438–0.0690;五項基準測驗全都適配良好或可接受。
因此,基準測驗子集即使能很好預測完整基準測驗的準確率,背後的 IRT 擬合仍可能不足以支持它產生的能力估計。凡使用 IRT 縮減基準測驗題數,都應將適配度診斷列為必要報告項目。
實際檢驗了哪些假設。 局部獨立性有檢驗:Yen 的 Q₃ 殘差相關(表 8)顯示,非對角線 Q₃ 平均值為 0.002–0.011,調整後 Q₃ 的第 99 百分位為 0.144–0.257,超過 0.20 門檻的題目配對占 0.2–2.1%(TruthfulQA 最差,為 2.1%)——程度輕微,可能由範本或主題造成,並非廣泛違反假設。單向度則沒有檢驗——沒有平行分析、碎石圖或雙因子模型比較;唯一間接依據是單向度 3PL 達到可接受的整體適配度。3PL 形式本身假設了單調性。參數不變性僅透過下文的遷移實驗間接檢驗。
沒有人檢驗的假設關於受試者,而非試題。 IRT 校準將受試者視為來自某個母體的可交換抽樣。Open LLM Leaderboard 上有數千個社群微調版與少數基礎模型的合併版本——這個群體內部依存程度極高,「受試者」的作答絕非彼此獨立。此處每個難度與鑑別度參數都是相對於該群體定義的,因此 b 表示「對 2023–2024 年開放權重微調生態系來說很難」,並非絕對的「難」;若只用前沿模型作為母體,題庫量尺就會重新縮放。研究也沒有報告受試者適配度統計量——這點尤其重要,因為異常作答模式(答錯簡單題、答對難題,或反過來)正是污染的特徵,而圖 8 中能力偏低的雙胞模型名稱就是 contaminated_proof_7b_v1.0。
超越校準分布的遷移#
ARC 上的兩項保留測試(表 5——docling 將每種方法的三個 Setting 列合併成單一儲存格;原始資料另有手動拆開的版本,並已逐格對照第 9 頁重新核實):
- 架構家族保留測試。 校準時排除全部 321 個 Mixtral 家族(MoE)模型。能力 MAE 0.084–0.120 → 0.091–0.109——大致持平,在較寬鬆的門檻下還稍好。準確率還原 MAE 0.032–0.034 → 0.044–0.045。
- 時間保留測試。 以 2024-05-01 前發布的 2,998 個模型校準,並測試 322 個較晚發布的模型(844 個因缺少發布日期而剔除)。能力 MAE 0.084–0.117 → 0.126–0.162——約退步 50%,是兩種變化中較大的。準確率還原同樣只變為 0.044–0.045。
時間漂移的影響大於架構新穎性。若試題難度是相對於母體定義,這正是預期結果:新模型不是不同類型的受試者,而是在依舊模型校準的題庫上,能力分布發生了位移。題庫需要依發布節奏重新校準,但沒有人測量所需頻率。
兩項尚未定論、卻看似明確的設計選擇#
- 3PL 並非處處優於 2PL(表 12)。只有 TruthfulQA 明確由 3PL 勝出。其他地方,2PL 的能力 MAE 常略低,但需要長得多的測驗(WinoGrande
τ=0.1:2PL 用 198 題達到 0.121,3PL 用 70 題達到 0.155),而 3PL 通常能較好還原準確率。論文坦承,對 LLM 而言,c參數不應解讀為「猜測」;它可能吸收答案先驗、提示慣例、解碼行為或記憶內容。 - 參照估計量會改變主要結果。 ATLAS 的整個題庫參照值使用 WLE;改用 EAP(表 13)後,HellaSwag 的關鍵 MAE 從 0.157 降至 0.087,WinoGrande 則從 0.155 降至 0.136;ARC 與 TruthfulQA 大致不變。無論採哪種估計量,「ATLAS 能追蹤整個題庫的能力」這項結論都成立,但本文引用的任何特定 MAE,都取決於埋在附錄 G.4 中的估計量選擇。
這如何改變排行榜的解讀方式#
- 排行榜上打平,不代表證據也打平。兩個模型即使答對率相同,在一個經題目重抽樣後更穩定、且在關聯基準測驗間一致性高得多的量尺上,排名仍可能相差數千位。
- 基準測驗飽和部分是計分造成的假象。排行榜頂端被壓縮,是答對率的特性,不是題庫的特性;而且約有三分之一的題目在測量開始前,就能因缺乏資訊而剔除。
- 低成本評估與正確評估在此是兩種不同的投入。自適應選題帶來前者;IRT 計分帶來後者;兩者可以擇一採用。
延伸閱讀#
- 超越準確率飽和的測量——從基準測驗生命週期的角度看同一問題。該文主張保留已飽和的基準測驗,並增加面向(可靠性、成本、輔助架構貢獻、人類提升幅度);本文保留單一面向,改變量尺,成本較低——不必新增儀器,只要使用基準測驗已產生的反應矩陣——但能找回的資訊較少。兩者共同界定了「退役並替換」問題的答案:重新加上測量項目,或重新計分。
- 評估抽樣中的自適應停止——另一條正交軸上的同類停止規則。OptStop 在每個項目累積到足夠窄的 Bayesian 可信區間後停止抽樣回合;ATLAS 則在
SE(θ̂)足夠小時,停止為每個模型施測試題。兩者都以精確度為目標,而非以準確率為目標;都以固定預算基準衡量節省幅度(試驗的 57.2–97.3%,題目的 89–99%);也都尚未彼此結合——同時沿兩軸停止的評估,顯然還沒有人做出來。 - 生產環境代理程式的定期評估——同一套 Rasch/2PL/Fisher 資訊量方法,應用在不同對象上。ATLAS 在靜態排行榜母體上校準一次題庫;She 與 Lin 則以單一持續演進的生產代理程式、按時間排序的執行紀錄校準,並額外比較自適應測驗、歷史快取與固定子集,因營運考量而採用固定子集,不採用他們 MAE 最佳的方法(多維 2PL 自適應測驗)。十個校準窗口都取自單一系統自身的歷史紀錄——至於 1 天與 4 週結果打平究竟能說明或不能說明什麼,請見下方關於過時速度的開放問題。
- Benchmark Score Redundancy——上一層級的冗餘結果,以及一項尚未解決的張力。該文使用 84 模型 × 133 基準測驗的分數矩陣,有效秩為 2;CollabEval 則發現,題目層級矩陣需要約 16 個成分,而非 2。單向度 3PL 在五個題目層級題庫上的 RMSEA 為 0.044–0.069,提供了相反方向的證據。兩者並非嚴格矛盾——CollabEval 衡量模型 × 提示的重建成分,IRT 衡量單一基準測驗內潛在特質模型的適配度——但任何主張基準測驗題目維度數量的人都應釐清兩者的關係。
- 經濟基準測驗的構念效度——以不同工具稽核排行榜心理計量特性,結論相容但方向相反。Zhu 對模型 × 基準測驗進行因子分析,發現一個因子解釋共同變異的 74.5%,且與發布日期相關,R² = 0.505;ATLAS 則在單一基準測驗內,對模型 × 試題擬合潛在特質。兩者都認為主要分數無法妥善估計構念;Zhu 發現的日曆混淆因素,類似 ATLAS 中相對於母體的難度量尺。
- Machine Self-Report Psychometrics——從另一個方向,將心理計量學用於模型。該文發現人類問卷用於模型時會失效,因此需要專門設計的工具;本文則發現人類方法(3PL、Fisher 資訊量、共同受試者連結、Yen 的 Q₃)大致可以直接移用,因為基準測驗題目確實是測驗題,模型也確實有作答模式。此遷移對試題有效,但對受試者檢驗最少——排行榜充滿同一基礎模型的合併版本,明顯違反了可交換性假設。
- 頭間距封閉指數(HCI)——另一種重新縮放飽和準確率分數的方法。HCI 以基準測驗發布當年的第 90 百分位前沿模型重新標準化,因此取決於發布時間;
θ則以試題難度重新標準化,因此取決於校準時使用的模型母體。兩者都將絕對分數換成相對分數;差別在於參照基準。 - 認知能力剖析與任務適配性——同一測量家族,但難度參數的來源方向相反,也是檢驗本文「相對於母體」疑慮最直接的現有方法。ATLAS 從約 4,000 個 Open LLM Leaderboard 模型估計 3PL 難度
b,因此b表示「對 2023–2024 年微調生態系來說很難」,校準年份改變後,能力 MAE 約退步 50%。Prunty 等人的 Measurement Layouts 則由 LLM 評審依據專家撰寫的評分準則,為每題標註需求(δ_jk = e^(λD_jk),λ = 1),因此試題難度不涉及反應矩陣,題庫也不會相對於模型母體過時。代價並未消失,只是轉移:其能力層級只能透過所有擬合目錄共用的截距來識別,因此新增或移除系統會移動參照點,不同目錄的層級也無法比較;但無論截距如何處理,能力輪廓形狀都可識別(復原 r = 0.92;自由截距時層級 r = 0.12)。兩種方法都沒有產生絕對能力量尺,只產生兩種不同的相對量尺。此方法也在六個系統的目錄中重現本文的重新排序效應:GPT-4o-mini 依原始題組準確率(48.7%)在六個系統中排最後,依推斷能力則排第四。 - 跨模型錯誤糾纏——測量本文所稱無人檢驗假設的方法:IRT 將受試者視為可交換;該文以難度為條件的虛無模型發現,過量共同失敗集中在同一家族內的微調模型配對,而這正是校準題庫所用 Open LLM Leaderboard 群體的組成方式。
- 基準測驗的聚合效度與區辨效度——將 IRT 用作效度診斷,而非計分工具。Desai 等人對每一對 37 項二元題目基準測驗,分別擬合一個共享特質的 1PL,以及每項基準測驗各有一種特質的 1PL,並以保留資料上的 ΔAUC 作為鑑別測試。ΔAUC 接近零表示同一種能力足以解釋兩者;推理-知識配對為 0.011,拒絕-過度拒絕配對為 0.062。ATLAS 用來將模型放置於單一基準測驗量尺上的同一套方法,在該文中用來檢驗兩項基準測驗是否共用同一量尺。兩種用途都仰賴本文指出尚未檢驗的假設:基準測驗內的單向度。該文直接點出這個問題(引述 Jiang 等人 2026 年的「Can we trust item response theory for AI evaluation?」),並將題目層級的不聚合視為警訊,而非定論。
開放問題#
-
能力排名能否預測準確率無法預測的下游結果?本文的效度證據全都來自內部穩定性與聚合效度——半份題庫穩定性,以及關聯基準測驗之間的一致性。沒有人檢驗
θ̂是否比答對率更能預測外部結果(保留基準測驗上的表現、人類偏好、部署成功)。可以直接證偽或支持的測試是:依θ̂與依基準測驗 A 的準確率分別排列模型,再比較何者更能預測基準測驗 B——這比本文報告的跨基準測驗排名相關更嚴格。 -
校準好的題庫多久會過時?時間保留測試是論文中退步幅度最大的一項(只跨約 1 年界線,能力 MAE 就從 0.084–0.117 升至 0.126–0.162),但只在單一基準測驗、單一切點上測量,而且 4,164 個模型中有 844 個因缺少發布日期而剔除。題庫所需的重新校準頻率尚未測量;這決定了 IRT 計分是常設工具,還是一次性分析。相關證據(2026-09-25)從同一問題的另一個面向提供,來自 She 與 Lin(
empirical)。他們將依難度分層的子集套用於單一生產代理程式的執行紀錄,以十個巢狀校準窗口重新擬合(287 次執行逐步減至 14 次,且全部在同一天結束),結果顯示窗口縮短時,保真度並未單調下降——1 天窗口(14 次執行)在 k=200 時達到 1.41pp MAE,與完整 4 週窗口的 1.40pp 無法區分。但這沒有回答本條問題:它測量的是單一系統歷史中校準窗口必須回溯多遠,而非模型母體漂移後,校準結果能向前維持多久有效;後者才是 ATLAS 約 1 年時間保留測試所測量的內容。兩者可能同時成立——擬合難度排序所需的回溯資料不多,但系統變化後仍會逐漸失效——而作者自己也提醒,其代理程式處於「相對成熟的開發階段」,日常變化有限,因此即使較窄的主張,在快速變化的系統上也尚未驗證。參見生產環境代理程式的定期評估。 -
校準能否適用於並非由少數基礎模型合併而成的數千個模型母體?此處每個試題參數都是在 Open LLM Leaderboard 上估計;其「受試者」高度不獨立,而且沒有報告受試者適配度統計量。可證偽的測試是:在去重後或僅含前沿模型的集合上重新校準,並檢查試題難度排名是否保留——若
b重新排序,這個量尺描述的就是 2023–2024 年微調生態系,而非試題本身。部分問題已有解答(2026-09-23),但回答的是能否免除這種依賴,而非依賴程度有多大。Prunty 等人(empirical)在 19,535 題上執行一套可運作的 Bayesian IRT 流程,當中試題難度完全不由反應矩陣估計——而是由兩位 LLM 標註者讀取專家撰寫的評分準則,標為各能力需求層級,以固定 λ 的δ_jk = e^(λD_jk)納入模型。因此可以建構一套不依賴受試者母體的難度量尺,上文所述的過時機制也隨之消失。這項建構顯示,相對性只是轉移而非消失:由於其彙整規則只取決於c_k − λD_jk,各代理程式若有獨立截距,整體能力層級便無法識別(復原 r = 0.12);必須估計一個由所有擬合目錄共用的截距才能找回層級(r = 0.98)——此後層級便錨定於該目錄的成員,論文禁止跨不同擬合目錄比較層級。無論如何處理截距,能力輪廓形狀都能以 r = 0.92 復原,因此形狀是不依賴母體的量,而層級則不是。本文提出的測試仍未解答:沒有人在去重或僅含前沿模型的集合上重新校準 ATLAS 的b,而評分準則路線也沒有測量 ATLAS 數字會移動多少。參見認知能力剖析頁面。
資料來源#
-
Efficient Benchmarking in Production: A Study of an Evolving LLM Agent — Yining She(CMU,研究在 Meta 完成)與 Lei Lin(Meta),arXiv 2609.21267,2026-09-18,28 頁,
empirical。本文僅引用其校準窗口註記(§6.2、表 12、圖 7)。完整討論見生產環境代理程式的定期評估。 -
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Desai 等人,arXiv 2609.08812,2026-09-08,COLM 2026,
empirical。本文僅在上方延伸閱讀中引用:§3.2 與附錄 D.3(M1 共享特質與 M2 各基準測驗特質的 1PL 配對、20% 保留儲存格、含題目自助抽樣的 ΔAUC),以及 §4.2 文字(推理-知識 0.011;拒絕-過度拒絕 0.062)。完整討論見基準測驗的聚合效度與區辨效度。 -
Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks — Peiyu Li、Xiuxiu Tang(共同貢獻)、Si Chen、Ying Cheng、Ronald Metoyer、Ting Hua 與 Nitesh V. Chawla(University of Notre Dame),Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks,arXiv 2511.04689,2025-10-26,ICML 2026(PMLR 306),24 頁,
empirical。本文引用 §3(3PL 校準、分區與共同受試者連結、WLE/EAP、randomesque 前五題選取、30/500 上下限)、§4.2–4.6 與表 1–5,以及附錄 C(篩選與 Q₃)、G.1(表 9–10)、G.2(表 11)、G.3(表 12)、G.4(表 13);圖 2、3、7、8 依照圖片雙重核對規則閱讀。**解析警告,但本文所有引用資料都對本論文有利:**原始資料取自 docling(2.126.0 / docling-mlx 0.1.1,confidence_grade: excellent),匯入程序回報warn,且table-collapse標記 312 個儲存格後,匯入工作程序就停止,未核對任何儲存格。編譯時已將全部十三個非 MMLU 表格(1–13)逐格對照pdftotext -layout重新核對(第 5–9、12–14、17–19 頁),結果完全相符;表 5 在匯入時已修復合併錯誤,並再次對照第 9 頁核實。**表 14(MMLU 各科目結果,第 20–22 頁)嚴重錯位且被拆分,未經核對——本文及 wiki 任何地方都未引用其中數字。**編譯時另記錄兩項原始解析缺漏:docling 本文完全缺少圖 8 說明(已從pdftotext -layout -f 24補回),表 7 說明則出現在表格下方而非上方。論文本身有一處尚未解決的算術矛盾:家族保留測試文字稱排除 321 個 Mixtral 模型後,試題參數以「其餘 3,296 個模型」校準,但此數字與 ARC 的 3,747 個校準模型或總數 4,164 均無法吻合(時間切分的 2,998 + 322 + 844 = 4,164 則吻合)。本文將其視為empirical——保留原級別。
Cited by 13
- Cognitive Capability Profiling for Task Suitability×5
Irt For Llm Benchmarks changes the scale; this one changes the unit of measurement — it reorganises
- Measuring Beyond Accuracy Saturation×4
Cognitive Capability Profiling — the third answer to "an aggregate score tells you little," and the…
- Recurring Production Agent Evaluation×3
Irt For Llm Benchmarks — shares the Rasch/2PL/Fisher-information machinery (ATLAS also fits an IRT…
- Benchmark Convergent and Discriminant Validity×2
Item level. A diagnostic use of item response theory. For each benchmark pair, fit a 1PL model with…
- Open Questions Backlog×2
Irt For Llm Benchmarks: Does calibration survive a population that is not thousands of merges of a…
- Adaptive Stopping in Evaluation Sampling
Irt For Llm Benchmarks — the sibling stopping rule on the orthogonal axis, and the one that stops…
- Benchmark Score Redundancy
Irt For Llm Benchmarks — the same redundancy claim at the item level, reached from psychometrics…
- Cross-Model Error Entanglement
Irt For Llm Benchmarks — where the dependence this page measures goes unmodelled: an IRT bank…
- Economic Benchmark Construct Validity
Irt For Llm Benchmarks — the same psychometric audit one level down, with a compatible verdict and…
- Headroom-Closed Index (HCI)
Irt For Llm Benchmarks — the third rescaling of a saturating accuracy number, and the one whose…
- Machine Self-Report Psychometrics
Irt For Llm Benchmarks — human psychometrics pointed at models a second time, and it transfers…
- Evals & Benchmarks
Irt For Llm Benchmarks — Score a benchmark with a 3PL IRT model instead of percent-correct and two…
- Open Questions Dashboard
Irt For Llm Benchmarks: Does the ability ranking predict anything downstream that accuracy does…
Related articles
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Economic Benchmark Construct Validity
Zhu's psychometric audit of a hash-pinned Artificial Analysis snapshot (421 configurations × 12 benchmarks, four econom…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Cognitive Capability Profiling for Task Suitability
Prunty et al. (Cambridge CFI) put AI systems and workplace tasks in one cognitive space: rubric-annotate 19,535 benchma…
- Benchmark Convergent and Discriminant Validity
Desai, Wallach, Chouldechova, Koyejo et al. (COLM 2026) borrow the multitrait-multimethod test from social science and…
