資料來源#
- One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
摘要#
Louis Yiven Zhu,One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation(Oxford Internet Institute,arXiv 2608.29420,2026-08-29,empirical,單一作者、未經同儕審查的預印本)。排行榜如今列出經濟欄位——GDPval、τ-Bench 系列、終端/代理式程式碼套件——而這些欄位會影響採購、監管與勞動力預測。一直沒有人問過的問題是:它衡量的是有別於一般應試能力的能力,還是只重新表達了模型進步時所有基準都會上升的那條軸線?
答案不落在兩種簡單選項的任何一種:
- 一條主導軸線。在完整案例網格上以最大概似法進行 EFA,第一因素涵蓋74.5% 的共同變異(第一主成分占總分數變異的 79.4%——這是不同的量,也是通常被含糊引用的那個數字)。Horn 平行分析只保留一個因素:第一個觀察特徵值為 9.53,高於隨機資料第 95 百分位的 1.79;第二個為 0.91,低於 1.57。
- **這條軸線很大程度上是日曆因素。**第一因素的分數與模型發布日期的關聯達 logistic R² = 0.505(OLS 0.477),也是三個因素中與日期關聯最強的。將每項基準對發布日期迴歸並重新配適後,第一因素占比從 74.5% 降至 59.6%,下降 14.9 個百分點。
- 按預先指定的規則,沒有獨立的經濟因素。在日期調整後的資料上,平行分析仍只保留單一因素,因此沒有第二組因素可供區隔。H3 的報告結果是未按原定規格獲得支持。
- **但經濟欄位在樣本外預測中仍有價值。**在逐一留出基準(LOBO)預測中,每折內都重新估計因素,k 因素表示法相較於單一平均分數指數,合併 ΔMSE = +0.037,95% bootstrap CI [+0.019, +0.055],且四項經濟目標中有三項個別勝出。
論文自己的一句話結論是:「經濟基準衡量的既不是一種能力,也不是多種能力。它們記錄的大部分內容,是一個主要反映發布日期趨勢的單一一般因素;剩下的部分則是小但真實的經濟成分。」
研究設計,以及樣本看起來比實際大多少#
主要資料是 Artificial Analysis 模型排行榜的快照,於 2026-07-06 直接從公開頁面擷取,並以 SHA-256 固定(6f19f8f0…,記錄於隨附清單)。Data API 拒絕未經驗證的請求,因此作者改為儲存公開頁面的原始位元組。Epoch AI 的 Notable AI Models 集合僅提供訓練算力,用於規模穩健性檢查。兩份快照都已固定;分析是一份由上而下執行的單一筆記本,不會呼叫即時網路。
基準被視為題項,模型配置則被視為受試者——這與一般閱讀排行榜的心理計量學視角正好相反。
預先固定的涵蓋規則(基準至少在 60 個模型上有分數才保留;模型須涵蓋 13 項涵蓋度足夠的基準中至少 8 項才保留),將 548 種原始配置縮減為 421 種配置 × 12 項基準。APEX-Agents 因資料稀疏而剔除(26 個模型);MMMU-Pro 則降為僅供敏感度分析使用。
最重要的數字不是 421。由於經濟基準的評分模型數遠少於學術核心,論文使用兩種網格,而所有假設都以 n = 96 的完整案例網格檢驗,這 96 個模型都在全部十二項基準上有分數。409 個模型的密集網格(九項幾乎普遍涵蓋的基準)只用於佐證性分群。任何將因素結構或 ΔMSE 引述為「421 個模型」的說法,都用了錯誤的分母——涵蓋度表說明了原因:GDPval 評分涵蓋 117 種配置(保留 112 種),Terminal-Bench v2.1 涵蓋 121 種,τ³-Banking 涵蓋 112 種;相較之下,GPQA Diamond 涵蓋 513 種,HLE 涵蓋 509 種。
依照論文的分類,十二項基準如下:經濟——GDPval (Elo)、Terminal-Bench v2.1、τ³-Banking、τ²-Bench;學術——GPQA Diamond、HLE、AA-Omniscience;科學程式設計——SciCode、CritPt、Terminal-Bench Hard;長上下文/指令——AA-LCR、IFBench。十二項中有三項(AA-Omniscience、AA-LCR、Terminal-Bench Hard)由排行榜營運方自行建構或選取子集,而十二項全由同一營運方透過單一測試框架執行——這項特性使此網格與廠商自報資料在本質上不同。
依據一般門檻,這個網格適合做因素分析:KMO = 0.933(門檻 0.8),Bartlett 球形檢定遭到明確拒絕。即使尚未建模,整組基準已近乎共線:非對角線 Spearman ρ 平均值 = 0.79,每一對皆為正值;經濟基準與學術核心的相關程度,幾乎和彼此之間一樣高,正向共同變異比 Ilić 與 Gignac 在 591 個模型、十二項測驗中報告的 0.73 還強。
發布日期混淆因素#
這是影響範圍最廣的發現,也是超越經濟議題後仍然成立的結果。
先前對模型分數的心理計量研究會控制規模——Kearns 會先將每項分數對配適的縮放定律取殘差;Ilić 與 Gignac 發現一般因素與參數數量的相關約為 0.6;Ruan 等人則依觀察到的縮放建立能力空間。但在前沿模型快照中,日曆因素取代了這個角色:
| 規格 | 日期調整後第一因素占比的下降 | 是否超過預設的 15 個百分點門檻? |
|---|---|---|
| 配置層級,n = 96(主要分析) | 74.5% → 59.6% = 14.9 個百分點(bootstrap CI [−5.3, +32.7]) | 否 |
| 每個基礎模型一列,n = 89(預定檢查 R1) | 24.1 個百分點(調整前占比升至 90.2%) | 是 |
| 已知算力子樣本,n = 58,僅調整日期 | 16.5 個百分點 | 是 |
| 已知算力子樣本,日期加上 log-compute 聯合調整 | 9.3 個百分點 | — |
這張表有兩點值得留意。
**第一,作者將主要結果報告為未達標。**H2(ii) 預先設定的門檻是十五個百分點;主要規格得到 14.9,而論文不願將會達標的去重網格提升為主要分析,「避免看到結果後才移動門檻」。三種規格有兩種達標,因此混淆因素確實存在的說法有充分支持,但修正幅度尚未定論。主要 bootstrap 區間 [−5.3, +32.7] 既無法與零區分,也無法與門檻區分;這是解讀 96 列網格時應有的審慎態度。
**第二,加入算力後,修正幅度變小而非變大。**在同一批 58 個模型中,單獨調整日期會移除 16.5 個百分點;同時調整日期與 log-compute 則移除 9.3 個百分點——可能是因為較晚發布的模型通常規模也較大,兩個預測變數分攤了共同變異。對 Compute-Controlled Benchmarking 而言,實務上的意涵是:在前沿模型橫斷面中,控制算力大致等同於用較吵雜的測量工具控制日曆因素;研究若控制規模卻忽略發布日期,就沒有移除它自以為已移除的混淆因素。
日期調整不只是縮小 F1,也重新分配了變異。圖 2c 的共同變異占比從 F1 74 → 60、F2 22 → 35、F3 3 → 5:學術因素吸收了一般因素放棄的大部分占比。
經濟區塊:只有過度萃取時才會分開#
依照論文事先固定的維度規則,沒有其他結果可報告——只有一個因素,沒有區塊。只有在強行指定三個因素時才會出現區隔,但沒有任何準則選出三個因素,因此論文始終將它標示為探索性結果。
日期調整後的三因素 oblimin 負荷量(表 3,逐格與 pdftotext -layout 核對;經濟基準以粗體標示):
| 基準 | F1(代理式/貼近實際工作的任務) | F2(學術知識) | F3(物理/高難度推理) |
|---|---|---|---|
| GDPval (Elo) | 0.84 | 0.13 | −0.04 |
| Terminal-Bench v2.1 | 1.01 | −0.12 | 0.03 |
| τ³-Banking | 0.54 | 0.04 | 0.38 |
| τ²-Bench | 0.50 | 0.31 | −0.13 |
| GPQA Diamond | 0.01 | 0.95 | 0.04 |
| HLE | 0.32 | 0.28 | 0.49 |
| AA-Omniscience | 0.69 | 0.12 | 0.14 |
| SciCode | 0.26 | 0.61 | 0.20 |
| CritPt | 0.02 | −0.00 | 0.99 |
| Terminal-Bench Hard | 0.82 | 0.10 | 0.10 |
| AA-LCR | 0.34 | 0.67 | −0.12 |
| IFBench | −0.13 | 0.86 | 0.02 |
四項經濟基準在 F1 上的負荷量都超過 0.40,且高於它們在其他因素上的交叉負荷量(經濟基準中最大的交叉負荷量為 τ³-Banking 在 F3 上的 0.38)。經濟區塊的平均絕對 F1 負荷量為 0.72,其他基準則為 0.32。
作者提出四個理由,認為這項結果應審慎看待:
- **F1 不是經濟因素,而是代理式因素。**分類上屬於非經濟的兩項基準,與經濟基準同樣強烈地落在此因素上——Terminal-Bench Hard 為 0.82,AA-Omniscience 為 0.69。論文坦承,原先計畫曾將 Terminal-Bench Hard 和 Terminal-Bench v2.1 一起歸為經濟基準,且這項分類「確實有爭議」。無論 F1 衡量什麼,它衡量的是使用工具完成多步驟任務,而不是有償工作本身。
- 因素之間高度相關——F1 與 F3 為 0.67,F2 與 F3 為 0.72——所以這種區隔看起來更像是對一條主導軸線的次要細分,而非三種能力。
- **負荷量估計相當寬鬆。**τ²-Bench 的 bootstrap 區間為 [0.10, 0.78],GDPval 則為 [0.44, 0.99]:兩者都不包含零,但彼此重疊,因此區塊內部的排序沒有資訊價值。
- 獨立分群也顯示結構薄弱。依相關距離對基準進行階層式分群,會將十二項中的十項——包括四項經濟基準中的三項——歸為同一區塊,只有 τ²-Bench 和 IFBench 分支出去。對模型分群(密集網格,n = 409),三種演算法都以輪廓係數選出 k = 2(k-means 0.480、agglomerative 0.499、GMM 0.467);兩群代表同一軸線上的能力層級:302 個較舊、分數較低的模型(發布日期中位數 2025-09,平均 Intelligence Index 13.7),以及 107 個較新、分數較高的模型(中位數 2026-03,平均指數 37.1)。這再次顯示日期軸線,而且沒有用到因素模型。
預測測試,以及失敗的那一階#
任務 2 將區辨性轉化為預測:完整留出一項經濟基準,用其餘十一項的表示法來預測,再比較哪種表示法勝出。因素會在每個訓練折內重新估計,留出折則透過訓練折的 Thurstone 權重投影——如果先用全部資料配適,就會讓目標資料洩漏到預測所用的權重中。超參數取自巢狀於外層五折切分之內的內層五折網格搜尋;外層切分提供報告的誤差。
預測器階梯,經濟區塊(每一階採用表現最佳的學習器):
| 階段 | 學習器 | 訓練 RMSE | 測試 RMSE | 折外 R² |
|---|---|---|---|---|
| (i) 僅時間/規模 | random forest | 0.521 | 0.741 | 0.459 |
| (ii) 平均分數指數 | ridge | 0.463 | 0.474 | 0.771 |
| (iii) 僅第一因素 | elastic net | 0.933 | 0.950 | 0.110 |
| (iv) k 因素(k = 3) | ridge | 0.410 | 0.433 | 0.808 |
| (v) k 因素加共變項 | ridge | 0.391 | 0.438 | 0.800 |
ΔMSE = MSE(平均指數)− MSE(k 因素),配對 bootstrap,B = 2000:
| 目標 | ΔMSE | 95% CI |
|---|---|---|
| GDPval (Elo) | +0.026 | [+0.010, +0.044] |
| Terminal-Bench v2.1 | +0.028 | [+0.001, +0.056] |
| τ³-Banking | +0.056 | [+0.008, +0.103] |
| τ²-Bench | +0.038 | [−0.011, +0.086] |
| 經濟項目合併 | +0.037 | [+0.019, +0.055] |
H4 符合事先固定的規則。增益在去重至 89 個不同基礎模型後依然存在(+0.038, [+0.020, +0.056]),因此不是把同一模型的推理力度變體當成彼此獨立的抽樣所造成的假象;改變因素數目後也仍成立:k ∈ {2,3,4,5} 的測試分別得到 +0.021 / +0.037 / +0.058 / +0.059,合併測試 R² 從 0.79 升至 0.83,因此論文採用的 k = 3,相較於準則選出的 k = 4,是較保守的選擇。
第 (iii) 階是最值得帶到其他分析中的結果,但論文只用一句話帶過。涵蓋 74.5% 共同變異的單一因素,對留出的經濟分數預測得很差——RMSE 0.950,R² 0.110——而對其餘十一項分數取簡單平均,R² 就達到 0.771。因此,因素占主導地位,不代表因素本身足以勝任預測:因素分數投影恰好丟掉了粗略平均仍保留的水準資訊。任何關於「分數矩陣實際上是 rank-k」的主張(Benchmark Score Redundancy),都應納入這種區別來理解——秩的說法描述的是共變異幾何,而有用的預測器未必是其中的首要成分。
單看 GDPval,k 因素 ridge 的折外 R² = 0.88;在配對的 gradient-boosting 學習器上,SHAP 歸因的排名是先 F1,再推理標記,然後 F3,而 log-params 和 open-weights 狀態的貢獻很小。因此,先前研究報告的規模訊號,是透過因素抵達 GDPval,而非與因素並行。最大的殘差可以解釋,並非診斷性異常:Grok 4.3 Non-reasoning 的經濟分數比預測值高 +1.14 個 z 單位,符合 GDPval 對代理式行為的獎勵,而其他基準只間接捕捉這種行為。
誰該相信經濟排行榜,以及相信哪些部分#
論文在此說得格外明確,而三類受眾得到三種不同答案。
- **買家。**單一智慧指數足以涵蓋模型之間大部分差異,因此排行榜仍是判斷整體進展的可靠指南。不過,剩餘的經濟訊號仍是最切合專業價值主張的部分,因此將經濟欄位獨立呈現有其道理——基準已能解釋經濟區塊 77% 變異,而在此基礎上增加 0.037 的增益雖屬增量,卻經得起重視遷移能力並懲罰記憶的驗證。
- 監管者,以及任何解讀模型差距的人。「比較相隔數月發布模型的排行榜,主要是在按發布日期排序。」具體建議是:在將同期模型間的小差距解讀為能力差異前,先按日期調整分數,或將比較限制在同一個發布窗口內。若根據未調整的跨模型差距設定採購或監管門檻,實際上衡量的就是日曆因素。
- 勞動經濟學家。幾乎沒有,論文也明言如此。研究範圍限定於內部效度——單一橫斷面上彙總分數的相關與預測結構。題項層級的回答、採用率或營收等外部經濟影響,以及飽和動態,都明確排除在外。本文證明 GDPval 帶有一般指數沒有的資訊;但沒有證明 GDPval 能預測任何勞動市場上的事物。
基準建構者可採用一套雙重測試流程,它源自本研究設計,且可直接用排行榜已公布的資料執行(各模型在新基準與既有基準組合上的分數,以及發布日期)。第一步是結構測試:將每項基準對發布日期迴歸,對殘差配適斜交因素模型,再檢查新基準的負荷量是否與一般因素分開。第二步是預測測試:留出新基準,使用其他基準的 k 因素表示法進行預測,每折都重新估計因素,並檢查其表現是否勝過單一平均分數指數,且 bootstrap 區間不包含零。「同時通過兩項測試的基準新增了一個構念,兩項都未通過的則只是在重新測量進展趨勢。」作者建議營運方在每個新增分數旁一併公布這兩項統計量。
應持保留態度之處#
- **單一作者、arXiv 預印本、未經同儕審查。**致謝只提到一位評論者。本文未經同儕審查,而論文自己最有力的幾項結果,恰好是它報告為未通過的結果。
- **「預先指定」確實發揮了作用,但資料存放是事後完成。**分析計畫是在事後存入 OSF(
10.17605/OSF.IO/VD34J),並附註記錄時間線與「該證據的限制」。論文的做法看得出其嚴謹性——兩個未通過的假設都如實報告、列出五項偏離、承認門檻是根據對 Kearns 的錯誤解讀校準,卻依然不更動——但預先登錄本身並未獨立加上時間戳記。 - **n = 96。**所有主要結果都建立在 96 個完整案例(89 個去重後的基礎模型)之上,而原計畫目標為 180–220。各處寬廣的區間就是代價。
- **單一營運方、單一日期,十二項基準中有三項由該營運方建構。**單一測試框架的特性,有助於抵禦廠商報告偏誤,是研究的一大優勢;它同時也是最大的外部效度限制:目前沒有第二個排行榜的複現,而論文第四項限制也承認,結果「描述的是單一日期的單一排行榜」。
- 經濟因素是過度萃取的結果,作者將它列為四項限制中的第一項:它應被視為待獨立快照之驗證性因素模型檢驗的假設,而非已確立的結構。
- 四項預定的穩健性檢查沒有執行(FIML/MICE 缺失資料敏感度、單因素對照複現、將推理力度變體作為第二條規模軸線,以及分類替換測試)——最後兩項直接涉及論文承認有爭議的兩處偏離。
- **究竟是哪個 GDPval-AA 排行榜?**快照的 GDPval 欄位採用 Artificial Analysis Elo 榜;Artificial Analysis 記錄指出,該榜曾在未公告的情況下由 v1 改為 v2 評分,兩者不可比較。論文沒有標明版本。對快照內的共變異分析而言無妨;但若有人想把這些 GDPval 數字與廠商資料卡對照,就會有問題。
延伸閱讀#
- Benchmark Score Redundancy — 在消除該篇文章無法排除之混淆因素的網格上,衡量同一種冗餘。BenchPress 的 84 × 133 矩陣約有 80% 是廠商自行回報,其範圍限制也提醒,共同回報偏誤可能人為製造相關性;這裡使用的是單一營運方、單一測試框架的跨基準網格,冗餘反而更強(兩兩相關 ρ 平均值 = 0.79,第一主成分占總變異的 79.4%)。本文另外帶來兩項新發現:其一,冗餘文獻中沒有人控制的混淆因素是發布日期,它在不同世代間承載了規模所承載的資訊;其二是上文的第 (iii) 階區別——即使主導因素占比壓倒性地高,它仍是糟糕的預測器,因此低秩不代表可以只根據首要成分來預測
- Headroom-Closed Index (HCI) — 語料中的表面矛盾,實際上可以清楚化解。HCI 報告十個能力領域大幅分歧(到 2026 年,高階數學為 86.4,工具代理為 39.9;收斂速率的方向也相反);本文則報告一個因素支配十二項基準 74.5% 的共同變異。兩者可以同時成立,因為測量的對象不同:HCI 衡量各領域隨時間變化的正規化水準與速率,本文衡量單一時間點各模型之間的共變異。基準的絕對水準可以差異極大,模型卻仍在所有基準上近乎同序排列——正相關共同變異 ρ = 0.79 正是如此。對 HCI 更關鍵的一點是,其進入年份正規化值以基準加入資料集的時間為錨點,而本文顯示,這是跨基準比較中最大的單一混淆因素
- Compute-Controlled Benchmarking — 該文的核心控制方法,在前沿模型橫斷面上顯示為第二佳工具。在日期調整中加入 log-compute,修正幅度反而縮小(同一批 58 個模型從 16.5 降至 9.3 個百分點),因為較晚的模型也較大;日曆承載了規模所承載的資訊。算力控制仍是處理基準刷分的正確方法(每次評估的預算是單次執行的公平性屬性);但它不是處理跨模型可比性的正確方法,在這種情況下,本文證據要求揭露的是發布日期
- GDPval Benchmark — 此快照中分數最高、預測也最佳的經濟基準;它與 Terminal-Bench 同屬代理式因素,而非另成一組。GDPval 在 F1 上負荷量為 0.84,折外預測 R² = 0.88,多因素表示法帶來 +0.026 [+0.010, +0.044] 的增益;SHAP 排序則將代理式因素置於規模之前。這是從共變異角度量化該文「基準測量低上下文專家」發現的版本
- Evaluation Horizon Versus Release Cadence — 同一個日曆因素造成的另一種限制。該文指出發布節奏快過模型的評估;本文則顯示發布節奏主導了模型間的比較。兩者都指向同一個揭露缺口:發布日期是排行榜上最具影響力而未受控制的變數,但沒有任何排行榜將它視為這樣的變數
- Measuring Beyond Accuracy Saturation — 對標題準確率未充分利用基準的相鄰診斷。該文的解方是沿非準確率軸重新衡量已飽和的基準;本文的解方則是先扣除飽和所依附的軸線。兩者的連結在於 Akhtar 等人發現基準飽和度會隨基準年齡增加,因此發布日期一開始就成為首要混淆因素
- Machine Self-Report Psychometrics — 語料中另一項以模型為受試者的探索性因素分析,研究對象正好相反:45 份人類問卷、涵蓋 50 個模型,得出一條主導的機器原生軸線(Pinocchio Axis,最多占模型間變異的 47.1%);正如十二項基準得出一條占 74.5% 的能力軸線。兩者接著都認為該軸線「只在投影中是一條軸線」,因而將之拆分——而兩種拆分都是探索性的。這種方法上的呼應值得留意:只要有人檢驗,以模型為受試者的網格似乎都近乎單維,不論題項是基準還是自我回報量表
- Market-Priced AI Exposure (the AI Premium) — 這是相反的情況,也是值得跨領域比較的理由。暴露度工具彼此近乎正交(市場推定的技能地圖與每一種任務型測量的共同變異都不到 2%);而這些測量所用的能力工具卻近乎共線,單一因素占 74.5% 的共同變異,十二項基準中有十項落在同一群。因此,暴露度測量之間的分歧,不可能源自多維能力前沿——它是在能力映射至任務、職業和價格的過程中產生的
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated — 本文稽核的是該分類法中各工具所採用的分母。每項暴露度測量都假設某種能力構念,卻從未驗證;本文驗證了這個構念,並發現它大多是發布日期趨勢,因此「AI 能做什麼」會不斷變動,而這種變動大多由日曆因素主導。本文未提供分類法最需要的資訊——沒有任何工具以已實現的經濟結果進行評分,因為論文刻意將研究範圍限定於內部效度
- Item Response Theory for LLM Benchmarks — 同一項心理計量稽核,但往下一層,得出相容的結論,也發現相同的混淆因素。本文對模型 × 基準進行因素分析,發現一個占共同變異 74.5%、與發布日期的關聯達 R² = 0.505 的因素;ATLAS 則在單一基準內對模型 × 題項配適潛在特質,發現正確率會讓 23–31% 的模型排名錯置超過十名。兩者都認為標題數字無法妥善估計其背後的構念。結構上的呼應是,每種量尺最終都相對於自己的參照群體——此處是快照涵蓋的發布窗口,彼處則是題目難度所校準依據的 Open LLM Leaderboard 微調模型群——兩篇論文都無法說明,換成不同參照群體後量尺會是什麼樣子
- Artificial Analysis — 本研究資料集所依據的排行榜營運方,也是此語料中第一個直接讀取其排行榜原始來源、而非廠商轉載版本的來源
- Cognitive Capability Profiling for Task Suitability — 同一個「一種能力還是多種」問題,但軸線互換,且研究設計旨在避開日曆混淆因素。Zhu 對模型 × 基準進行因素分析,發現一項主導因素;Prunty 等人則從認知理論預先指定因素(Carroll 與核心知識研究提出 18 項能力,依評分者間信度篩選為 16 項,再分群為 8 項),並以之測量題項,因此維度是設計選擇,而非研究發現。評分規準的需求層級不會隨發布日期改變,這是對本文 R² = 0.505 結果的結構性解答——但共同截距重新引入了某種相同問題,因為每項能力的水準都會隨目錄成員而變動,而其目錄只有五個平價級模型和一個 Pro。其「系統在認知維度間的差異大於模型家族間的差異」這項主要結論,是根據寬度 5.30 的維度差距對比寬度 1.12 的系統差距,卻未報告變異分解,因此證據弱於本文的平行分析方法
- Benchmark Convergent and Discriminant Validity — 本文的經濟問題所屬的建構效度稽核,以多特質多方法角度分析 48 項基準和 53 個模型,而非使用因素模型。其能力發現,是從標籤角度觀察本文單因素結果。推理、知識與理解基準在不同標籤間的相關,與同一標籤內的相關一樣強(組內 − 組間 ρ = −0.00),因此排行榜欄位上的標籤不能證明存在獨立構念。該文另有兩項貢獻。第一,按發布日期拆成兩半後,兩半內的非區辨性仍成立(2024 年 10 月之前 −0.01,之後 +0.00),因此能力基準的共同軸線不只是本文測得的日曆混淆因素。第二,網格中的安全面向表現完全不同:同標籤的安全基準幾乎不收斂(偏誤 0.20、安全偵測 0.02)。該文將第一主成分殘差化列為尚未檢驗的下一步;它從未對發布日期取殘差,而這正是本文的建議
開放問題#
- 日期驅動的結構能否在第二個獨立營運的排行榜上重現,還是 Artificial Analysis 的特例?十二項基準中有三項由營運方自行建構或選取子集,十二項也都在其單一測試框架下執行,因此營運方特定的題項建構方式與測試框架選擇,都與此結構混淆。可以直接檢驗:在另一個有相同模型、但題項不同的排行榜(Open LLM Leaderboard、LMArena、HELM)上執行相同的兩項測試,查看第一因素對日期的 R² 是否接近 0.505。部分問題已由 Desai 等人於 2026-09-25 回答(
empirical,COLM 2026)。他們的網格是第二個獨立於 Artificial Analysis 的單一流程網格:53 個模型 × 48 項衍生自 HELM 和 SafetyPrompts 的基準,全部由作者以單一 zero-shot 測試框架執行。在該網格中,能力基準再次共用一條軸線,標籤內的 ρ 不高於標籤間的 ρ(−0.00)。因此,這種結構不是 Artificial Analysis 的特例。至於日期這部分,只能劃定範圍。論文沒有對發布日期進行迴歸,而是以 2024 年 10 月將模型分組(n = 27 / 26),並發現各組內都存在非區辨性(−0.01 / +0.00)。在各自的發布日期範圍內,能力基準仍無法區隔。每一組涵蓋約一年以上的範圍(從 Llama-2 chat models 到 2024 年 9 月,接著從 2024 年 10 月到至少 claude-sonnet-4-5),所以這是寬鬆時間窗口,而非單一發布波次。結果與「日期趨勢占第一因素很大一部分、但並非全部」相符。原定測試——在第二個排行榜上測第一因素對日期的 R²——仍未執行。 - 是否存在驗證性經濟因素,還是只有過度萃取?論文自己的第一項限制是:三因素區隔屬探索性結果,沒有準則選出三因素,負荷量的 bootstrap 區間彼此重疊,而 F1 涵蓋分類上屬非經濟的兩項基準(Terminal-Bench Hard 0.82、AA-Omniscience 0.69)。可否證檢驗:在較新的獨立快照上,對事先指定經濟區塊的驗證性因素模型進行配適,並報告其相較於單因素模型的配適度。
- 日曆混淆因素是前沿排行榜的長期特性,還是 2025–2026 年發布潮造成的現象?這個快照中的所有模型都落在能力同步快速攀升的時段內;若各實驗室的發布時間不再同步,或同世代內的進展快過世代之間的進展,那麼即使基準不變,第一因素對日期的 R² 也應下降。值得觀察的觸發訊號是:配置層級的日期調整使第一因素占比減少不到十分之一的第一個快照。
資料來源#
-
One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(University of Oxford, Oxford Internet Institute;單一作者),One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation,arXiv 2608.29420,2026-08-29,25 頁,
empirical——保留其級別(輸入已固定、門檻預先指定、巢狀交叉驗證、未通過的假設如實報告),但持續提醒:這是未經同儕審查的單一作者預印本,分析計畫事後才存檔。§3(2026-07-06 的雜湊固定 Artificial Analysis 快照、涵蓋規則、兩種網格、KMO 0.933 和 ρ = 0.79);§4.1–4.3(平行分析、oblimin EFA、以移除秩一成分進行日期調整、四項預先指定的假設與門檻);§5.1(第一主成分 79.4%、特徵值 9.53/1.79 和 0.91/1.57、第一因素涵蓋 74.5% 共同變異);§5.2(logistic R² 0.505,相較 OLS 0.477;74.5% → 59.6%;14.9 / 24.1 / 16.5 / 9.3 個百分點的規格表);§5.3 和附錄 E 表 3(日期調整後的三因素負荷量);§5.4 和表 1(預測器階梯與 ΔMSE bootstrap);§5.5 和附錄 L(去重後 90.2% 和 +0.038、rank 94.5%、logit 91.8%、k ∈ {2,3,4,5} 掃描、未執行的四項預定檢查);§6(排行榜使用指引、雙重測試流程、四項限制);附錄 F 表 4(各基準涵蓋度與由營運方建構的三項);附錄 J(揭露的五項偏離,包括有爭議的 Terminal-Bench Hard 分類和錯誤校準的 H2(ii) 門檻);附錄 K(分群、k = 2、302/107 層級);附錄 M(GDPval R² = 0.88、SHAP 排序、Grok 4.3 Non-reasoning +1.14 殘差);附錄 N(來源紀錄、SHA-256 清單、遭拒的 Data API 請求、事後存入 OSF)。解析備註:從 PDF 擷取(docling 2.126.0,MLX 版面與表格階段,25 頁、6 張表、10 張圖,信心值excellent);匯入時五項軟性檢查全數通過,canary-recall 20/20。不過表 1、3、4、5 仍逐格與pdftotext -layout核對,確認為完全精確——全文沒有任何表格合併、偏移、黏合或拆列,這在此語料中相當少見。第二輪以圖片檢視圖 2 和 3;圖 2c 提供了任何表格都未列出的 F2 22 → 35 占比分配變化,圖 3c 的 SHAP 長條排序則確認了內文 -
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Desai、Truong、Wallach、Chouldechova、Cooper、Garcia-Gathright、Ho、Jacobs、Koyejo、Pangakis 與 Wang,What AI Benchmarks Actually Measure,arXiv 2609.08812,2026-09-08,COLM 2026,
empirical。此處僅在延伸閱讀與上方開放問題註記引用:§4.2(能力標籤無法區辨)和附錄 D.5 表 D.4(能力基準整體組內 − 組間 ρ 為 −0.00;按 2024 年 10 月發布日期區分後為 −0.01 / +0.00;已與pdftotext -layout第 43 頁核對無誤)。完整討論見 Benchmark Convergent and Discriminant Validity
Cited by 15
- Benchmark Score Redundancy×4
Economic Benchmark Construct Validity — the redundancy question asked as construct validity, on the…
- Benchmark Convergent and Discriminant Validity×3
Economic Benchmark Construct Validity — the corpus's other construct-validity audit of a benchmark…
- Compute-Controlled Benchmarking×3
Economic Benchmark Construct Validity — the control this page never named, measured against the one…
- GDPval Benchmark×3
Economic Benchmark Construct Validity — the external construct-validity audit of the column GDPval…
- Open Questions Backlog×3
Economic Benchmark Construct Validity (7d) — Is there a confirmatory economic factor, or only an…
- Artificial Analysis×2
Economic Benchmark Construct Validity — the only external audit of an AA board in this corpus, and…
- Headroom-Closed Index (HCI)×2
Economic Benchmark Construct Validity — the same worry resolved rather than repeated, and the…
- Cognitive Capability Profiling for Task Suitability
Economic Benchmark Construct Validity — the one-capability-or-many question with the axes swapped.…
- Evaluation Horizon Versus Release Cadence
Economic Benchmark Construct Validity — the same release cadence, read as a measurement confound…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
one capability or many economic validity frontier eval — Louis Yiven Zhu (Oxford Internet…
- Item Response Theory for LLM Benchmarks
Economic Benchmark Construct Validity — the other psychometric audit of a leaderboard, with the
- Machine Self-Report Psychometrics
Economic Benchmark Construct Validity — the same psychometric machinery with models as respondents,…
- Market-Priced AI Exposure (the AI Premium)
one capability or many economic validity frontier eval — Louis Yiven Zhu (Oxford Internet…
- Measuring Beyond Accuracy Saturation
Economic Benchmark Construct Validity — the residualising answer to the same ageing problem. This…
- Evals & Benchmarks
Economic Benchmark Construct Validity — Zhu's psychometric audit of a hash-pinned Artificial…
Related articles
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Cognitive Capability Profiling for Task Suitability
Prunty et al. (Cambridge CFI) put AI systems and workplace tasks in one cognitive space: rubric-annotate 19,535 benchma…
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
- Item Response Theory for LLM Benchmarks
Score a benchmark with a 3PL IRT model instead of percent-correct and two separable things follow. Scoring: whole-bank…
