資料來源#
- One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
摘要#
這是一種用來回答排行榜無法解答之問題的工具:不是「這個模型的分數有多高」,而是「原本還能提升的部分,已經拿下多少」。 The Last AI Built by Humans 第 2.1 節(arXiv 2609.11873,2026-09-10)以 2023 年至 2026 年 9 月間發布的模型為對象,納入十個能力領域中 393 筆符合資格的模型-基準觀測;在這篇 79 頁的調查中,這是唯一以測量而非論證為主的章節。
建構方式分三步:
1. 協定連結家族。 只有在「基準版本與評估 harness 保持穩定,或重疊模型的評估結果能在不同協定之間提供可靠橋接」時,兩筆結果才歸入同一家族。來自不相容版本或 harness 的結果會保留在稽核紀錄中,但不納入走勢。標準相當嚴格:在最新模型稽核所考量的 33 筆結果中,只有 17 筆獲准納入;另外 16 筆來自 Terminal-Bench、DeepSWE、CyberGym、ExploitBench、AutomationBench 和 BrowseComp,因「其基準版本或評估設定無法連結到圖表所繪家族」,故「保留供參考」。
2. 來源加權共識分數,用於多個來源在同一個家族、變體與模式下回報同一模型的情況。基礎權重為:基準所有者的表格 3、使用共同 harness 的獨立評估 2.5、同時涵蓋基準與模型的報告 2、模型作者的表格 1——接著**第一方數值再乘上 0.75。**研究所述目的,是「一種實用的敏感度調整方式,可限制自我回報結果的影響」。在這批資料中,這是唯一明確以數字折減供應商自我回報結果的做法(Compute-Controlled Benchmarking 主張揭露資訊;這裡則為其定價)。
3. 指數本身:以剩餘空間而非零作為正規化基準:
H = 100 × (s̄ − F<sub>b,0</sub>) / (100 − F<sub>b,0</sub>),其中 F<sub>b,0</sub> 是基準首次納入資料集那一年的模型分數第 90 百分位。
因此 H = 0 代表納入年份的前沿,H = 100 則代表滿分。接著,各領域走勢會彙整每個基準的第 90 百分位 HCI 前沿 Q<sub>b,y</sub>,並依對該基準年度前沿有貢獻的不同模型數量採用 √n 權重——「平方根權重能讓涵蓋較充分的家族貢獻更多,同時避免最大的表格主宰領域數值」。
研究發現#
有三項觀察,全都摘自文字敘述,而非任何表格。
進展的程度與形態各不相同#
2026 年各領域 HCI:
| 領域 | 2026 年 HCI |
|---|---|
| 資安代理 | 91.9 (跨年度不可比較——見注意事項) |
| 進階數學 | 86.4 |
| 研究所程度科學 | 85.8 |
| 廣泛知識 | 77.2 |
| 法律推理 | 64.5 |
| 多模態推理 | 62.2 |
| 前沿學術廣度 | 60.4 |
| 搜尋與終端代理 | 56.8 |
| 軟體工程 | 52.6 |
| 工具代理 | 39.9 |
年度增幅 ΔT 才是這項工具真正發揮作用之處,因為同一段期間內,變化方向截然相反:
- 廣泛知識依序上升 32.8、26.9、17.6——剩餘空間穩定縮小,但速度逐漸放緩。
- 法律推理大幅減速:2024 年 +48.2、2025 年 +11.4、2026 年 +4.9。
- 進階數學則加速:2025 年 +32.8 → 2026 年 +53.6。
- 多模態推理大幅下滑:2025 年 +59.7 → 2026 年 +2.5。
- 工具代理在 2026 年從 8.2 跳升至 39.9,但仍是走勢最低的領域。
- 軟體工程在 2025 年提升 40.8,2026 年提升 11.9。
論文本身的結論正好連結本頁與 Aggregate Cancellation:「單一彙總基準會掩蓋程度與走勢形態上的這些差異。」 同一年裡,一個領域提升 +53.6,另一個提升 +2.5,平均後的數字兩者都描述不了;而一個旨在跨基準比較的指數,恰好透過分層讓這種分歧顯現出來。
互動能力仍有較大的差距#
以研究所程度科學的 85.8 為基準,軟體工程的正規化剩餘空間消化程度低 33.2 點,搜尋與終端代理低 29.1 點,工具代理低 45.9 點。領先的資安代理走勢為 91.9,高於工具代理 52.0 點。
調查的解讀是:「在受限或容易驗證的環境中取得的進展,並未平均轉移到長時間、具狀態的工作流程」,因為這些任務「需要規劃、追蹤環境狀態、選擇工具、解讀結果,並修正後續動作」,而且「錯誤會沿著整段軌跡傳播,因此資料蒐集與評估必須涵蓋完整互動」。這是任務時間跨度的結果從另一種工具得出的相同訊息——METR 衡量代理能可靠完成多長的任務;HCI 衡量在受時間跨度限制的領域中,分數剩餘空間消化了多少——兩者對剩餘能力落在哪一端有一致看法。
論文對自身標題提出的一項注意事項。 資安走勢以虛線繪製,因為「較晚期的 Cybench 觀測使用了變更後的任務子集或 pass@1 彙整」,所以 91.9 無法跨年度比較。這是表中最大的數字,論文卻標明它不可用,這點值得肯定。
外推僅供說明,且有明確標示#
觀察 3 依據 R<sub>d</sub> = 100 − 0.22(100 − T<sub>d,2026</sub>) 推估 2026 年之後的區間,也就是假設每個領域都消化其剩餘差距的 78%。資安 91.9 → 98.2;軟體工程 52.6 → 89.6;搜尋與終端 56.8 → 90.5;工具代理 39.9 → 86.8。
0.22 是自行選定的常數,論文中完全沒有推導。 它唯一的作用,是讓「剩餘空間較大的領域得到較大的延伸」在算術上成立;這只是依照定義得出的結果。論文對此相當坦白——「終點用來說明這項假設」——而這項假設是調查的動機,並非研究結果:持續且經驗證的自我改進,會優先幫助目前在重驗證的互動工作流程中表現不佳的領域(RSI Autonomy Levels (B0–L5) 中的 L3–L4 機制)。應把曲線視為論證示意圖,而非預測。
圖 3 補充了文字沒有提到的內容#
依編譯時的雙階段規則將圖視為影像閱讀。有兩項資訊只出現在圖中:
各領域所包含的基準,文字從未列出:一般知識 = MMLU-Pro · LiveBench;研究所科學 = GPQA Diamond;學術廣度 = Humanity's Last Exam;數學 = FrontierMath v2 Tiers 1–3;多模態 = MMMU-Pro;法律 = Vals LegalBench;資安 = Cybench unguided / pass@1;軟體工程 = LiveCodeBench · SWE-bench;工具使用 = BFCL v3 · τ / τ²-bench;搜尋/終端 = BrowseComp · Terminal-Bench。這對解讀上方表格很重要:「軟體工程」指 LiveCodeBench 和 SWE-bench,並非廣義的代理式程式碼庫工作;而**「搜尋與終端代理」包含 Terminal-Bench**——同一項基準在自身第 5.2 節的批評中(見 Agent-Authored Harness Optimization)指出,前沿代理接近其上限的原因與能力無關。
十個領域對應自主性層級帶的方式,這是圖例的架構,文字中完全沒有提到:知識與科學評估 · L1–L2;專門推理 · L1–L2;軟體環境 · L2–L3;工具介導的工作流程 · L3–L4。這正是本節與調查其他部分的橋梁——剩餘空間消化程度最低的領域,恰好也是論文認為所需自主性層級最高的領域。
x 軸是模型實際發布日期,並非按年份分組,各模型均有標示(GPT-4o、Claude 3.5 Sonnet、o1、Gemini 2.5 Pro、Kimi K2、GLM-4.5、Opus 4.5、Sonnet 5、Fable 5、Kimi K3、Opus 5、GPT-5.6 Terra、GPT-5.6 Sol、Fable 5.1、GLM-5.3、GPT-6 Astra)。圖中無法辨識個別模型的 HCI 數值,因此本文不引用。
哪些地方應保留懷疑#
有四項限制,沒有一項致命,而且論文都未處理。
正規化方式取決於納入年份。 F<sub>b,0</sub> 是基準首次出現在資料集那一年的第 90 百分位分數,因此,模型能力已經很強時才推出的基準,起點就會較高,後續每一分增益都被壓縮到較小範圍;較早推出的基準則會放大增益。因此,兩個領域的 HCI 差異可能來自基準在能力曲線的不同時間點發布,而非能力本身有差異。前沿學術廣度(Humanity's Last Exam,於 2025 年設計,目標是接近無法解答)與廣泛知識(MMLU-Pro,在模型已有不錯分數時才納入)位於這個問題的兩端,卻在觀察 1 中直接比較。全文都沒有針對第 90 百分位的選擇、√n 權重或納入年份錨點進行敏感度分析。
資料集沒有公開。 393 筆觀測、家族歸屬、稽核紀錄及各基準的 F<sub>b,0</sub> 數值都有提及,卻沒有任何一項附上。17 筆納入、33 筆審查的統計,是唯一可見的協定連結篩選嚴格程度證據,而且只來自一次稽核。
完全沒有不確定性資訊。 沒有誤差棒、信賴區間、任何走勢的多次執行變異;各領域走勢是以每年少量模型集合的第 90 百分位次序統計量建構——依定義,單一強勢新模型發布就會推動前沿。多模態在 2026 年的 2.5 點增幅,以及數學在 2026 年的 53.6 點增幅,呈現出相同的表面精確度。
來源加權減少了供應商影響,但沒有消除。 模型作者的表格仍有 1 × 0.75 的權重,而非 0,因此只有第一方回報的能力仍會推動該領域走勢。考量到網格實際涵蓋的揭露資訊少得可憐——努力等級、harness 身分、取樣預算——兩筆「相同基準、相同模型、相同模式」的結果仍可能相差超過權重差距。
延伸閱讀#
- Measuring Beyond Accuracy Saturation——同樣回應飽和問題的姊妹文章,也是互補觀點。該文沿著新維度(可靠度、成本、腳手架貢獻)重新衡量單一飽和基準;本文則保留準確度,並在基準之間重新縮放,使飽和領域與停滯領域能用同一把尺比較。兩者都反對退役後替換;它們對解方的看法不同:要增加更多維度,還是改用更好的正規化方式
- Aggregate Cancellation——HCI 的領域分層旨在避免的失效情況,調查也直接指出:「單一彙總基準會掩蓋程度與走勢形態上的這些差異」;資料中最鮮明的例子是同一年 +53.6 與 +2.5 的差距
- Compute-Controlled Benchmarking——從另一側切入,提出相同的單一數字網格批評。該文主張缺少的是運算預算維度;本文加入來源折減(第一方 × 0.75)與剩餘空間正規化,卻完全未處理運算維度——每個 HCI 數值都混合了在未知且不相等的測試時預算下取得的分數
- Benchmark Score Redundancy——另一項跨基準分數矩陣研究,也是最值得本文擔心的一項:如果公開的模型 × 基準分數矩陣實質上只有秩 2,那麼十個「能力領域」可能不到十個自由度;HCI 所呈現的分歧便可能是正規化方式造成,而非能力本身不同。目前沒有人以 BenchPress 式的完成度分析套用到 HCI 走勢資料集
- Economic Benchmark Construct Validity——不是重複提出相同疑慮,而是解開它,也對本文的正規化方式提出更精準的質疑。Zhu 以單一 harness 快照分析十二個基準,發現一個因素解釋了 74.5% 的共同變異;乍看之下,這像是本文擔心的反例,但前提是區分兩種測量:HCI 衡量各領域隨時間變動的正規化程度與速度,該網格衡量單一時間點跨模型的共變異,兩者可以同時成立——各基準的絕對程度可以相差很大(數學 86.4,工具代理 39.9),模型在所有基準上的排名卻幾乎相同,這正是 ρ = 0.79 正向流形的樣貌。真正受衝擊的是錨點:領先能力軸與發布日期的關聯為 R² = 0.505,而 HCI 的正規化錨定於基準的納入年份,因此其基準線由跨基準比較中最大的混淆因素決定
- Task Time-Horizon Scaling——獨立趨勢線得出相同結論:剩餘能力差距位於長時間、具狀態、互動式工作中。METR 以任務時間長度衡量,HCI 以尚未消化的正規化剩餘空間衡量;兩者都指出,工具使用和代理工作流程離上限最遠
- Recursive Self-Improvement——本節旨在支持的論點:觀察 3 的示意性延伸主張,經驗證的自我改進在剩餘空間消化程度最低之處最有成效,這是調查對該文未來情境 2 和 3 的詮釋,並附上各領域細分
- Item Response Theory for LLM Benchmarks——第三種對飽和準確度數字重新縮放的方式,其路徑依賴因素則不同。HCI 以基準納入年份的第 90 百分位前沿作為正規化基準,因此尺度取決於基準何時發布;IRT 能力則以各題目的難度與鑑別度正規化,因此尺度取決於用來校準的模型群體——以 ATLAS 為例,是 3,467–4,680 個 Open LLM Leaderboard 微調模型。兩者都以相對數值取代絕對分數,也都繼承了參照群體選擇的任意性;差別在於 IRT 會在估計值旁公布標準誤,HCI 則既沒有公布區間,也沒有公布底層分數表
- RSI Autonomy Levels (B0–L5)——調查建構本節的目的:圖 3 圖例將十個領域映射至 L1–L4 層級帶;觀察 3 的示意性延伸則主張,遞迴自我改進在剩餘空間消化程度最低之處最有成效
- Benchmark Convergent and Discriminant Validity——在不同領域集合上檢驗能力標籤是否代表不同軸向。跨 48 項基準,推理、知識與理解標籤無法透過跨模型共變異區分(組內 − 組間 ρ = −0.00),只有摘要能力獨立成一類。這為 HCI 的十個領域是否構成十條走勢提供了限制條件,但無法定論,因為 HCI 高度分歧的領域沒有一個出現在該網格中
待解決的問題#
- HCI 的排序在改用不同納入年份錨點後是否依然成立?指數以基準首次納入資料集那一年的第 90 百分位分數為基準,因此重新錨定(固定日曆年份、首次發布分數,或隨機基準底線)是一項低成本的證偽測試——若十個領域的排名在不同錨點下都穩定,代表工具可靠;若法律推理與學術廣度互換位置,則測到的是發布時間。需要尚未公開的分數表,或自行重建資料。
- 十個能力領域是否足夠獨立,能各自成為一條走勢?Benchmark Score Redundancy 指出,一個涵蓋 84 個模型 × 133 項基準的公開矩陣實質上只有秩 2,這代表十個領域中的大多數可能只需少數幾項探測即可預測——也意味著數學(+53.6)與多模態(+2.5)同一年出現的差距,可能是資料集中對低秩結果最有力的反例,也可能是 HCI 正規化方式造成的假象。光靠 wiki 無法回答:要解決此問題,需要尚未公開的 393 筆觀測分數表,或從公開排行榜重建資料。Zhu 於 2026-09-22 部分回答了此問題(Zhu,
empirical,單一作者預印本)——回答了關於排名的部分,並將這個項目提出的非此即彼問題化解為兩者皆是。在一份經雜湊固定的單一操作者快照中,十二項基準涵蓋經濟、學術、科學程式設計及長上下文領域;一個因素解釋了74.5% 的共同變異,平行分析僅保留一個因素,而依相關距離進行的階層分群將十二項中的十項歸入同一群。因此,各領域在模型排名上並不獨立:知道模型在一個區塊中的位置,就能推知它在其他區塊的位置。但這不構成本頁所述領域分歧的反例,因為兩者測量的對象不同——前者是單一時間點的跨模型共變異,後者是各領域多年來的程度與速度;一項基準消化了 86.4 的剩餘空間,另一項只有 39.9,模型的排序仍可能完全相同。這項研究確立的是:「十條走勢」帶來十種程度,而非模型比較中的十個自由度。而且它指出了本頁比低秩更應擔心的機制。 領先軸與發布日期的 logistic R² = 0.505;移除日期趨勢後,組態層級數值下降 14.9 點(以每個基礎模型為單位的單列資料則下降 24.1 點)——然而 HCI 正是以基準的納入年份第 90 百分位分數正規化,這個錨點依定義便與發布日期有關。因此,上方第一項問題(將重新錨定視為證偽測試)比第二項更急迫,Zhu 也提供了測試方法:以發布日期迴歸每項基準,再針對殘差重新擬合。此問題仍未完全解決,原因有二——Zhu 的十二項基準並非 HCI 的十個領域(沒有多模態、法律推理或資安),也沒有人針對尚未公開的 393 筆觀測資料執行上述任一測試。Desai 等人於 2026-09-25 部分回答了此問題(Desai et al.,empirical,COLM 2026),探討能力標籤是否保證代表獨立軸向。答案是否定的。在一個包含 53 個模型 × 48 項基準的單一流程網格中,推理、知識及理解基準的跨標籤相關性,與同標籤內的相關性一樣強(組內 − 組間 ρ = −0.00,對模型時期分組結果仍穩健),只有摘要能力獨立成一類。因此,不能假設 HCI 的十個領域標籤代表十個自由度。但該網格沒有涵蓋 HCI 高度分歧的領域:除了 MATH/GSM8K 之外,沒有進階數學,也沒有工具代理或多模態。因此 +53.6 與 +2.5 的差距尚未經過檢驗,這些領域的問題仍未解決。
資料來源#
-
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Desai 等人,arXiv 2609.08812,2026-09-08,COLM 2026,
empirical。本文僅於未解問題附註及上方延伸閱讀引用:§4.2 與表 D.4(能力組內 − 組間 ρ −0.00,按時期分組為 −0.01 / +0.00;已依pdftotext -layout第 43 頁核對精確數值)。完整討論見 Benchmark Convergent and Discriminant Validity -
One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(Oxford Internet Institute,單一作者,未經同儕審查的預印本),arXiv 2608.29420,2026-08-29,25 頁,
empirical。本文僅於未解問題附註及上方延伸閱讀引用:§5.1(一個保留因素解釋 74.5% 的共同變異;第一主成分解釋總變異的 79.4%)、§5.2(發布日期 logistic R² = 0.505;日期調整後 74.5% → 59.6%,去重後的對應結果下降 24.1 點),以及附錄 K(十二項基準中有十項落在同一相關距離群集)。該研究未測量任何 HCI 領域,也未修訂任何 HCI 數值。完整討論見 Economic Benchmark Construct Validity -
The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — Duan、Liu、Tang、Chen、Zhou 等人(35 位作者;Shanghai Jiao Tong University、Theseus Labs、Tsinghua、ByteDance、ModelBest、Xiaohongshu、Shanghai AI Lab、Humanlaya、Agent-Native Research Lab、Frontis.AI),The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement,arXiv 2609.11873,2026-09-10,79 頁。僅引用 §2.1——協定連結家族規則及其 17 筆納入、33 筆審查的統計、來源權重(3 / 2.5 / 2 / 1,第一方 × 0.75)、定義 HCI 的公式 2、採 √n 加權的領域走勢,以及觀察 1–3 的所有引用數值。文件整體層級標記為
practitioner-opinion(主要內容是提出論證的路線圖——見 RSI Autonomy Levels (B0–L5)),但本節是對已發布基準分數進行量化的二次分析,因此依此類型加權:以下數值是衍生測量,而非主張。本頁所有圖表數值都取自文字敘述,而非表格——文件第 2 節的任何表格都未與本頁逐項核對。圖 3依編譯時的雙階段規則以影像方式閱讀,是本頁記錄各領域基準組成與 L1–L4 層級帶對應關係的唯一來源。限制,依本文重述:393 筆觀測資料及各基準的納入年份前沿均未公開;全文沒有任何不確定性估計;納入年份錨點取決於發布時間;觀察 3 外推中的 0.22 常數未經推導,僅供說明;論文也指出,資安 91.9 是自身最大數值,但因 Cybench 子集變更及 pass@1 彙整方式不同,無法跨年度比較。"
Cited by 13
- RSI Autonomy Levels (B0–L5)×3
Document-level tier: practitioner-opinion, confirmed on a full read. The load-bearing contributions…
- Measuring Beyond Accuracy Saturation×2
This page's prescription and Headroom Closed Index's are both about what to do around a saturating
- Open Questions Backlog×2
Headroom Closed Index: Are the ten capability domains independent enough to be trajectories?
- Recursive Self-Improvement×2
Headroom Closed Index — the same survey's empirical half, and the motivation underneath the ladder:…
- Agent-Authored Harness Optimization
Headroom Closed Index — the measurement behind §5.2's first condition, on the benchmarks this page…
- Aggregate Cancellation
Headroom Closed Index — the corpus's largest measured instance of concealment by aggregation, and…
- Benchmark Convergent and Discriminant Validity
Headroom Closed Index — the test that page's open question asks for, run on a different set of…
- Benchmark Score Redundancy
Headroom Closed Index — the cross-benchmark score matrix put to the opposite use, and the place…
- Compute-Controlled Benchmarking
Headroom Closed Index — the only instrument in the corpus that puts a number on the…
- Economic Benchmark Construct Validity
Headroom Closed Index — the apparent contradiction in the corpus, and it resolves cleanly. HCI…
- Item Response Theory for LLM Benchmarks
Headroom Closed Index — the other rescaling of a saturating accuracy number. HCI renormalizes…
- Evals & Benchmarks
Headroom Closed Index — A cross-benchmark normalization that reports how much of a benchmark's…
- Task Time-Horizon Scaling
Headroom Closed Index — an independent instrument agreeing on where the residual capability sits.…
Related articles
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Benchmark Contamination and Decontamination
Sun, Zhan & Gales (Cambridge): per-sample distribution distances expose that aggregate-accuracy decontamination can wor…
- Cognitive Capability Profiling for Task Suitability
Prunty et al. (Cambridge CFI) put AI systems and workplace tasks in one cognitive space: rubric-annotate 19,535 benchma…
