資料來源#
- CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
摘要#
GDPval 是 OpenAI 用來評估模型能否完成人們會付錢請人做的真實工作的基準測試。它不會拿答案和標準答案比對,而是把模型交付成果與該職業從業者的成果並列,請盲測的專家評分者判斷哪一份較好——也就是成對勝率,並以僅計勝場和勝場加平手兩種方式呈現。主要論文為 Patwardhan 等人所著,GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks(arXiv 2510.04374 v1,2025-10-05,19 位作者,皆來自 OpenAI,empirical)。
數月來,這個 wiki 一直引用 GDPval 的衍生版本:以此為基礎建立的 Artificial Analysis Elo 榜 GDPval-AA,出現在 Claude Opus 5、Claude Opus 4.8、Claude Opus 4.7、Kimi (Moonshot AI)、The Open-Weight Frontier Gap 和 Cost-per-Task Over Cost-per-Token 等頁面。這一頁介紹的正是那些數字的源頭。
衍生榜單已重新評分,而且不同版本無法比較。 Artificial Analysis 原版 GDPval-AA 榜(Opus 4.8 系統卡引用)和後續的 v2(Opus 5 引用;Kimi K3 和 The Open-Weight Frontier Gap 引用其 61 Elo 差距)對同一模型——Opus 4.8——分別給出 1890 和 1593。v2 重新建置了整個評測:取自 gold set 的 220 項任務、在代理程式迴圈中使用 shell 存取與網頁瀏覽,再依盲測成對比較計算 Elo。因此,GDPval-AA 數字只有附上榜單版本才有意義,絕不可拿 v1 和 v2 的 Elo 相減——The Open-Weight Frontier Gap 不把 IRT cyber Elo 與 Arena 差距相減時,也採取同樣的謹慎態度。
來源脈絡:2026-09-10 依據論文重建#
本頁最初於 2026-08-17 編寫,完全依據 Aakanksha Chowdhery 在 CS329A 第 8 講的內容——講者讀著投影片,經過 YouTube 自動字幕轉錄,屬於 practitioner-opinion——其中有幾個數字被標記為 ASR 受損。2026-09-10 特地將主要論文作為 baseline-lane 來源匯入,以釐清這些標記;除非特別註明來自講座,以下數字現在都以論文為準。
講座的內容大致經得起核對。 任務、職業、產業和 gold subset 的數量、金額、參考檔案占比、規格說明占比、兩個端點的勝率、品質分布,以及成本/速度比,都與講者原話吻合。有三點未能成立:產業選取規則、O*NET 數位工作篩選條件,以及——影響最大的一點——把 12% 到 48% 解讀成同一條大致線性的趨勢。下文會就地劃除這些說法。
利益衝突。 OpenAI 建立了基準測試、挑選職業、招募並支付專家酬勞、定義指標、執行評分,並以自家四個模型對比三個競爭對手模型。自動評分器是 GPT-5-high。所有「交付品質已接近業界專家」的說法,都出自測量自家模型的供應商。另一方面,這裡有個不尋常之處:榜首由競爭對手拿下——Claude Opus 4.1 的勝率為 47.6%,領先 GPT-5 high 8.8 個百分點;這不像是刻意美化作者自身表現的基準測試會出現的結果。兩面都不可或缺;請見 Sources 說明,了解利益衝突確實影響到哪裡(僅涵蓋 OpenAI 模型的成本表)。
設計#
| 論文(arXiv 2510.04374) | 講座描述 | |
|---|---|---|
| 產業 | 9 個,依 2024 年第二季附加價值(FRED)計算,各自占美國 GDP 超過 5%,合計約 75.7%——房地產與租賃 13.8%、政府 11.3%、製造業 10.0%、專業/科學/技術服務 8.1%、醫療照護 7.6%、金融與保險 7.4%、零售業 6.3%、批發業 5.8%、資訊業 5.4% | |
| 職業 | 44 個——每個產業中薪資最高且主要屬於數位工作的五種職業(零售業有四種),年收入合計 3 兆美元 | 44 ✓ |
| 任務 | 完整集合 1,320 項(每種職業至少 30 項);開放資料的 gold subset 220 項(每種職業 5 項) | 約 1,320/約 220 ✓(ASR 把第一個數字轉成「30 20」) |
| 任務來源 | 任務作者專家的實際工作成果,並依 O*NET 職業任務分類以確認涵蓋範圍 | ✓ |
| 專家門檻 | 該職業至少 4 年經驗,平均 14 年;篩查履歷中的升遷和管理經歷、視訊面試、背景調查、培訓及測驗;錄取申請者不到 10%;每種職業至少 5 位合格專家 | |
| 職業篩選條件 | GPT-4o 將每一項 O*NET 任務分類為數位或非數位;某職業的加權數位任務占比高於 0.60 時才符合資格(權重取自 O*NET 的相關性/重要性/頻率)。以 Acemoglu 與 Autor(2011)的任務內容框架驗證 | |
| 所需時間 | 專家平均完成時間 7 小時(簡介);gold subset 平均 9.49 小時、中位數 5.0、小時數最高 100;完整集合平均 8.63 小時,最高 605 小時 | 約 7 小時 ✓ |
| 價值 | Gold subset 平均 $398.46(中位數 $174.81,最高 $4,114.20);完整集合平均 $391.44,最高 $32,028.70——時間 × OEWS 時薪中位數 | 約 $400 ✓ |
| 參考檔案 | 67.7% 的任務至少需要一個檔案;gold set 平均 1.92 個檔案 | 約 70% ✓ |
| 規格說明 | Gold set 中 89.07% 的任務被評為規格明確(8.28% 規格不足、2.66% 規格過度);完整集合為 89.34/8.41/2.26 | 約 89% ✓ |
| O*NET 涵蓋度 | Gold subset 涵蓋 1,470 項 O*NET 任務中的 208 項(14.15%)、35 項技能中的 25 項(71.4%)、41 項工作活動中的 26 項(63.4%) | 未提供 |
| 品質控管 | 1,320 項任務全數經模型篩選,再由平均五位專家審查(至少三位),分成三個明確階段 | 「多輪審查」✓ |
講座提到的代表性任務:替組裝線製作電纜捲筒支架的 3D 模型(製造工程師);競爭版圖分析(金融分析師);評估影像並撰寫諮詢紀錄(註冊護理師);依腳本剪輯開場短片(影視剪輯師);回覆不滿意的顧客(客戶服務);安排四口之家的行程(禮賓人員);找出採購單的定價不一致之處(稽核);房地產銷售手冊(房地產經紀人);廠商園遊會場地配置(休閒活動工作者)。
有兩個容易忽略的設計選擇。任務是依職業薪資總額挑選,而非依 AI 曝險程度——挑選依據是「經濟為哪些知識工作支付最多報酬」,所以 GDPval 的 44 種職業與 Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated 和 Task Saturation: Broad but Shallow AI Diffusion 所採用的勞動市場分類不同。論文也刻意保留職業確實會涉及的 NSFW 與政治內容(例如影視、文學、法律、政治),而非刪除這些內容以改變分布。
核心結果——以及「大致線性」究竟涵蓋什麼#
在 220 項 gold subset 任務上進行盲測專家成對比較,數字為勝場加平手(圖 5;每個提示詞、每個模型取樣三次 × 三位人類評分者 = 每個提示詞、每個模型九次比較):
| 模型 | 相對業界專家的勝場或平手率 |
|---|---|
| GPT-4o | 12.4% |
| Grok 4 | 24.3% |
| Gemini 2.5 Pro | 25.5% |
| o4-mini high | 27.9% |
| o3 high | 34.1% |
| GPT-5 high | 38.8% |
| Claude Opus 4.1 | 47.6% |
本次編修最重要的更正: 勝率從 2024 年的 GPT-4o(約 12%)到 2025 年的 Claude Opus 4.1(約 48%)大致線性上升 (2026-09-10 由 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks 取代)。那是兩張不同的圖表。圖 5 是跨供應商的評分快照,依分數排序,榜首是競爭對手的模型。承載線性趨勢主張的是圖 6 時間序列,但它只畫了三個 OpenAI 模型——GPT-4o(2024 年 06 月,12.4%)、o3 high(約 2025 年 04 月,34.1%)、GPT-5 high(約 2025 年 08 月,38.8%)。圖中沒有 Claude Opus 4.1。因此,論文所說「隨時間大致線性進步」,是以單一供應商的發布歷史中三個點擬合而成,終點為 38.8%;48% 則是另一個量:所有受評模型在沒有時間軸的快照中取得的最高分。
這很重要,因為本 wiki 最常引用 GDPval 的地方,正是它和 METR 的線性與指數成長對比(Task Time-Horizon Scaling),而這個對比建立在三個資料點上。對比仍然成立——三個點並不能描述倍增——但引用時應一併交代樣本數。
講座對此對比的說明依然恰當,Chowdhery 也明確指出:「這和 METR 討論的每七個月翻倍趨勢非常不同。相較於 METR 談的指數趨勢,這裡比較像是大致線性趨勢。」 兩者測量的並非同一件事——一者是在可靠度固定時測量任務的持續時間,另一者是在任務固定時測量對照人類的產出品質——而這種偏向保守的解讀是刻意的:模型在實際耗時數小時到數週的工作中只有有限用途,而且這種用途是按職業拆開測量,而非彙整成單一時間跨度。
論文本身的一項勘誤。 §3.1 在引用 47.6% 後,稱模型交付成果「在略多於一半的任務中超越或達到專家人類的交付成果水準」——但 47.6% 略低於一半。圖表中的數字才是權威數據;這句話誇大了結果。
比較的是整套系統,而非單一模型。 註腳 2 明確指出:為了使用檔案建立與分析功能,Claude 是透過消費者版 UI取樣;OpenAI 模型則透過 API 執行,並搭配網頁搜尋、程式碼解譯器、背景取樣及一組預先安裝的函式庫。論文也承認盲測並不完美——OpenAI 的輸出經常使用 em dash,Claude 的輸出採用第一人稱措辭,Grok 偶爾會自稱名稱;檔名經過清理,但寫作風格沒有變更。Claude Opus 4.1 與 GPT-5 high 之間 8.8 個百分點的差距,有一部分可能來自 harness 和介面差異,而非模型差異;論文並未將兩者分開。
整體數字掩蓋的三種梯度#
任務時間(圖 13,依專家完成時間分組的勝場或平手率):
| 模型 | 0–2 小時 | 2–4 小時 | 4–8 小時 | 8 小時以上 |
|---|---|---|---|---|
| Claude Opus 4.1 | 56% | 44% | 42% | 37% |
| GPT-5 high | 48% | 33% | 35% | 30% |
| o3 high | 45% | 28% | 29% | 25% |
| o4-mini high | 38% | 25% | 23% | 19% |
| GPT-4o | 19% | 7% | 8% | 9% |
強模型在兩小時以下的工作中高於平手水準,而沿著任務時間軸下降約 10 到 20 個百分點——從品質角度得出的時間跨度形狀,出現在同一個用來反駁時間跨度呈指數外推的基準測試中。47.6% 的整體數字,是對從 56% 起始的一系列結果取平均所得。
產業(圖 10)。Claude Opus 4.1 在零售業(約 56%)、政府部門(約 52%)和批發業(約 52%)達到或接近平手水準——論文點名的三個領域;在資訊業則最低(約 32%),該產業包含製片人與導演、剪輯師、記者、影音技術人員及電影剪輯師。單一模型在不同產業之間的差距,大約和同一產業內不同模型的差距一樣大。
交付成果類型(圖 12,並列出每種類型的任務占比):
| 交付成果 | 占比 | GPT-4o | o4-mini high | o3 high | GPT-5 high | Claude Opus 4.1 |
|---|---|---|---|---|---|---|
| 純文字 | 9.9% | 5% | 15% | 21% | 23% | 14% |
| 31.3% | 9% | 18% | 25% | 30% | 45% | |
| xlsx | 23.1% | 12% | 26% | 27% | 35% | 43% |
| pptx | 5.6% | 11% | 27% | 28% | 25% | 45% |
| 其他 | 30.1% | 15% | 34% | 43% | 46% | 48% |
這是 Cost-per-Task Over Cost-per-Token 中供應商模型選擇指南建議的逐模型分類,並有基準測試本身的證據支撐:Claude 在每一種會產生檔案的類別都領先,GPT-5 high 則在純文字方面領先。令人意外的是,純文字是所有模型最難的類別——多數基準測試最常使用的格式,恰好是交付成果最少勝過專家的類別,而且在 GDPval 中不到 10%。
三者合在一起,就是在有償工作中以三種粒度測量的鋸齒狀能力;這正是基準測試本身主張應按職業報告,而非只用單一數字概括的理由。Chowdhery 也在軟體開發者項目上對自己的圖表提出保留:該項目的專家基準可能來自程式碼儲存庫維護者,而不是一般從業者,所以比較對象和工業或機械工程師所採用的對象不同。論文的專家標準既無法證實,也無法排除這種可能。
模型的失誤所在:遵循指示,而非知識#
論文將專家偏好人類交付成果的理由歸為三種標籤(圖 8,占樣本總數的比例):
| 失誤標籤 | Gemini 2.5 Pro | Grok 4 | Claude Opus 4.1 | GPT-5 high |
|---|---|---|---|---|
| 遵循指示 | 40% | 35% | 14% | 9% |
| 格式 | 6% | 13% | 5% | 10% |
| 準確度 | 7% | 5% | 6% | 5% |
四個模型中有三個以遵循指示問題為主。GPT-5 high 是例外,也是對講座摘要的更正:它最主要的失分類別是格式(10%),略高於遵循指示(9%)——講座說「GPT-5 的遵循指示錯誤比同類模型少」,就排名而言是對的(9%,對比 14/35/40%),但先前本頁的說法暗示所有模型都以遵循指示問題為主。對每個模型而言,準確度問題都是最少的類別:失誤不是知識不足。
最鮮明的形式是看似成功的失誤——論文原話指出 Gemini 和 Grok「經常承諾提供成果卻沒有交付、忽略參考資料,或使用錯誤格式」,講座則這樣解釋:
模型會答應查看參考資料,實際上卻沒看……它們會用自己想出來的幻覺覆蓋參考資料
有 67.7% 的任務附有參考檔案;如果模型聲稱看過檔案,實際上卻沒有,那它做出看似合理的成果時,仍然違背了這項基準測試的核心機制。
失誤有多嚴重? 專家重新評分 GPT-5 交付成果輸給人類的任務子集(圖 14):
| GPT-5 失分評級 | 占比 |
|---|---|
| 模型其實較好(重新評分者不同意原始判定) | 22.9% |
| 可接受但品質較差 | 47.7% |
| 糟糕——無法使用,但不危險 | 26.7% |
| 災難性——有害或錯得很危險 | 2.7% |
依轉錄結果,三個數字加總不精確,而且中間數字被以不同值說了兩次;保留趨勢即可,不引用數字。 (2026-09-10 取代:講座所說約 50%/約 20%/約 29%,與論文的 47.7%/22.9%/29.4% 相符,原先加上的保留並無必要。) 但分母確實需要更正,講座衍生的頁面先前也寫錯了:這些數字是 GPT-5失分項目的占比,不是所有輸出的占比。近半數落敗的成果仍可使用;約十分之三不能用;大約每四十次失敗中有一次相當危險。而 22.9% 的「模型較好」比例本身也反映評分者之間的差異——論文指出它「大致相當於評分者間的一致程度」,也就是記錄下來的失分中,五分之一是評分者意見不一致,而非模型真的失敗。
為監督定價:足以改變成本故事的數字#
§3.2 和附錄 A.2.1 是講座無法涵蓋的內容,也是這篇論文最具遷移價值的部分。論文在 gold subset 上測量四項數值,再組合成一套策略:
- 人工完成任務:
H_T= 404 分鐘,H_C= $361(經驗證的自我回報時間 × OEWS 時薪中位數;論文指出這會低估專家的真實市場成本)。 - 人工審查模型交付成果:
R_T= 109 分鐘,R_C= $86——從任務監控遙測資料讀取,取每位專家第一次評分所花的時間。 - 模型完成任務:
M_T、M_C取自實測 API 延遲與開立帳單的費用,每項任務完成三次。 - 勝率
w,即審查通過的機率。
在「嘗試 n 次,然後自己修正」策略下,預期成本為 (M_C + R_C)·(1−(1−w)ⁿ)/w + (1−w)ⁿ·H_C;結果列於表 2(編寫時已對照 PDF 核驗),重點如下:
| 模型 | 勝率 | 速度:天真估算 | 試 1 次 | 試 n 次 | 成本:天真估算 | 試 1 次 | 試 n 次 |
|---|---|---|---|---|---|---|---|
| gpt-4o | 12.5% | 327× | 0.87× | 0.46× | 5172× | 0.90× | 0.53× |
| o4-mini | 29.1% | 186× | 1.02× | 1.06× | 1265× | 1.06× | 1.22× |
| o3 | 35.2% | 161× | 1.08× | 1.28× | 480× | 1.13× | 1.47× |
| gpt-5 | 39.0% | 90× | 1.12× | 1.39× | 474× | 1.18× | 1.63× |
三點解讀:
- 天真的比值是虛構的,論文也如此指出。 模型單看 API 支出比專家便宜 474 倍,但在支付專家 $86 審查輸出、並在每次失敗時再次支付完整的 $361 後,只便宜 1.63 倍。審查時間占任務本身所需時間的 27%,而且每次嘗試都要付出這個成本,因此三個數量級的優勢幾乎全花在監督上。這就是驗證成為新的瓶頸,而且有帳單為證。
- 勝率低於門檻時,整個迴圈比自己動手更差。 GPT-4o 的勝率為 12.5%,速度僅 0.46×、成本 0.53×——反覆取樣通常會失敗的模型,只會耗掉審查時間,最後仍得由人類完成任務。效益的正負取決於
w,所以勝率是部署參數,而不只是排行榜上的數字。 - 講座中的成本說法正確,本頁卻錯誤地把它刪掉了。
成本/速度相關說法不該引用……兩者依轉錄結果無法調和;此處 ASR 受損。(2026-09-10 取代。) Chowdhery 所說「成本改善約 1.6 倍、速度改善約 1.4 倍」,正好就是 GPT-5 的「試 n 次」那一列(1.63×/1.39×);她說「不到人類專家薪資的 10%」,則是對同一張表的天真估算欄位做寬鬆解讀——原始取樣成本遠低於薪資的 10%(474 倍約等於 0.2%)。這兩個說法來自不同欄位,並不矛盾。
依論文本身說明,這套計算未納入以下項目:審查人類交付成果所需的時間(真實工作場所同樣會產生此成本)、人類交付成果也可能有問題,以及災難性錯誤的成本——上文的失誤分析將此估為失分項目的 2.7%,而其成本正是不會隨任務規模成比例變動的部分。註腳 9 認為模型受到了過度懲罰(專家調整提示詞後勝率應該上升,熟悉模型後審查時間應該下降)。成本分析的範圍限制也涉及利益衝突:成本估算只涵蓋 OpenAI 模型——「我們無法取得 Claude、Gemini 和 Grok 的成本估算」——因此在核心結果中勝出的模型,並未出現在節省成本表格中。可對照 METR 以美元為單位的指標 Expenditure Horizon:它將同一種人類與代理程式比較,放在單一最佳化問題的金額軸上。
引出能力的效果:推理力度、提示詞與輔助架構#
論文測試了三種非互動式手段(§3.4、圖 9),都使用相同的 gold subset 和評分者:
| 手段 | 結果 |
|---|---|
| 推理力度,o3 | low 29.8% → medium 30.8% → high 34.1% |
| 推理力度,GPT-5 | low 32.7% → medium 35.6% → high 38.8%(+6.1 個百分點) |
| 提示詞調校,GPT-5 high | 38.8% → 43.1%(+4.3 個百分點;正文四捨五入為「5 個百分點」) |
| 輔助架構 | 在容器中啟用 GET 請求;N=4 的最佳 N 次取樣搭配 GPT-5 評審 |
提示詞要求的是格式與自我檢查規範,而非任務知識:所有視覺交付成果都轉成 PNG 並且實際檢查;以程式化方式檢查空白頁和內容溢出;PDF 使用 LibreOffice;避免非標準字元;交付文件最多四句。實測效果尤其突出——先前影響超過一半生成 PDF 的黑色方塊偽影降為零;嚴重的 PowerPoint 格式錯誤從 86% 降到 64%;會用多模態能力檢查自身交付成果的代理程式,從 15% 升到 97%。幾乎所有增益,都來自讓代理程式檢查自己產出的內容。
這是論文本身證明「專家差距」中有相當一部分來自流程而非能力的證據,也有外部佐證:HarnessBank 演進出的 harness 在一個 GDPval 領域將結果從 43.7 → 52.9 Pass@1(+9.2,歸功於封存的保留資料集)——詳見 Agent-Authored Harness Optimization。但有一項特定流程尚未測試,因為基準測試的設計刻意排除了它:由人類修正第一次嘗試。
評分:專家盲測,以及以人類上限驗證的評分器#
220 項 gold 任務由專家進行盲測成對比較——相關職業的專家會查看需求與參考檔案,再將兩份或多份未標記的交付成果排序,並撰寫理由。每次比較平均超過一小時,因此才需要自動評分器。
自動評分器是 GPT-5-high,公開提供於 evals.openai.com。它的驗證方式是以恰當的方式呈現——拿它和人類評分上限比較,而非假設滿分為 100%:
- 人類與自動評分的一致率:65.7%
- 人類評分者彼此的一致率:70.8%
一致率定義為序位分數 {0, 0.5, 1} 上的 E[1 − |H − A|];論文說明,之所以採用此指標而非 Cohen's/Fleiss's κ 或 Krippendorff's α,是因為這些分數是三點序位尺度。這種做法——以評分器相對於人類彼此評分的結果呈現,而非和虛構的完美標籤比較——也正是 Usage-Telemetry Classifier Validation 對職業分類器主張的方式,只是由不同實驗室在不同情境下執行。
論文主動提出兩項限制,對 LLM-Judge Validation 都很重要:
- 在實際評測中測得自我偏好。 GPT-5-high 評分器「評估能力較強的 OpenAI 模型輸出時,與人類專家評分者的相關性較低」,引用 Panickssery 等人(2024)關於模型偏好自身生成內容的研究。這等於供應商承認自家的評審在評估自家模型時最不可靠——而且兩項一致性指標在弱模型上都最高,因為這些模型的輸出比較容易和人類產出區分。
- 220 項任務中有 12 項無法由自動評分器評分:任務需要網路存取、以 Python 以外的方式執行(三項軟體開發者任務)、特定字型套件,或語音轉文字。因此公開的自動服務只能代表一部分任務;論文表示仍建議採用人工評分。
可推廣的發現:基準測試測量的是低脈絡專家#
依設計,GDPval 的任務是單次完成且規格明確——專家腦中掌握的所有脈絡都寫進提示詞,而且沒有來回互動讓人類修正第一次嘗試。論文在自己的 §5 中將此列為限制。這項設計讓基準測試可以評分,同時也限定了它無法測量的事。
消融測試見附錄 A.2.7:改寫提示詞,省略資料位置、問題處理方式和交付成果外觀等資訊——將內容壓縮至原始 token 長度的 42%——再由人類專家重新評估 GPT-5-high。結果如下(圖 15):
| 提示詞 | 勝場加平手 | 僅計勝場 |
|---|---|---|
| 原始版本 | 47.7% | 43.3% |
| 精簡/規格不足 | 44.3% | 39.8% |
下降 3.4 個百分點。論文特別註明,此實驗使用的是 gold subset 的較早版本,因此其中 47.7% 的基準值並非正文的 38.8%,不可拿兩者相減。指標變動不大,但質化上的失敗比數字顯示的更明顯——「模型難以掌握脈絡」;或用講座的說法,「模型其實難以判斷該做什麼。」 Chowdhery 的解讀是:
真實工作往往非常依賴脈絡……人類基本上是在規劃出一組問題,然後讓模型去解決
這是用有償工作實際測量的脈絡優勢,而非品味:殘餘的人類貢獻來自資訊不對稱;GDPval 計算的是刻意抹平這種不對稱後,仍然留下的一半工作價值。結果也和 Returns to Expertise in Agentic Coding 的觀點一致;講座則直接連到 METR 關於承包商與維護者的發現——模型表現得像剛加入、沒有脈絡的聰明新人,而不是已融入環境的專家。
限制,以及論文內部的三處不一致#
論文 §5 自己指出:44 種職業、每種約 30 項任務只是「有限的初步選取」;僅涵蓋可獨立完成的數位知識工作(不含體力勞動、默會知識、PII、專有工具、人際溝通);採單次、非互動式評估;評分器有其限制;整體執行成本也不低。
編寫時發現三處內部不一致,均非解析受損(七張表都已依 pdftotext -layout 重新核對):
- 參考檔案數量。 §1 稱 gold subset 最多有「17 個參考檔案」,完整集合最多「38 個」;但標示為 gold set 的表 5,給出的最大值是 38。標題或引言必有一處錯誤。較穩妥的數字是平均值(1.92)和占任務比例 67.7%。
- 核心圖表和成本表的勝率不同。 圖 5 給出的 GPT-4o/o4-mini/o3/GPT-5 勝率依序為 12.4/27.9/34.1/38.8;表 2 的
w欄則是 12.5/29.1/35.2/39.0。論文沒有說明差異,因此成本節省比率採用的彙整數據,與核心結果略有不同。 - 「任務要花多久」有三種數字:7 小時(引言)、gold subset 平均 9.49 小時(表 3)、
H_T= 404 分鐘,約 6.7 小時(成本模型)。它們分別是四捨五入的核心說法、任務特性摘要,以及節省公式中經驗證的輸入數值,但論文沒有明確說明這一點。
GDPval 在能力空間中的位置(2026-09-22)#
外界首次以量化方式回答「GDPval 是否測量了其他基準測試沒有測量的東西」,不是來自 OpenAI,而是來自一份心理計量稽核:Zhu(Oxford Internet Institute,arXiv 2608.29420,empirical,單一作者、未經同儕審查的預印本)將十二個基準測試視為題項、421 種模型配置視為受測者,採用經雜湊固定的 Artificial Analysis 快照;每項假設均以涵蓋全部十二項測試的 96 模型網格評分。四項結果與本頁相關。
GDPval 具有代理程式特性,但並非獨樹一格。 將日期調整後的分數以三因子過度抽取後,GDPval 在代理程式/真實工作因子上的負荷量為 0.84,與 Terminal-Bench v2.1(1.01)、Terminal-Bench Hard(0.82)、AA-Omniscience(0.69)、τ³-Banking(0.54)和 τ²-Bench(0.50)同屬一因子;它在學術知識因子上的負荷量只有 0.13,在物理/高難度推理因子上的負荷量則為 −0.04。GDPval 和 GPQA 的差異,不外乎終端機代理程式和選擇題測驗的差異;而 GDPval 所屬的特性也和兩項被論文自身分類為非經濟性質的基準測試共享。
依預先指定的規則,根本沒有經濟因子。 對日期調整後的資料進行 Horn 平行分析,只保留一個因子;因此,上述區分是探索性的過度抽取,沒有任何維度判準會選擇它;作者的結論是,原先依指定方式提出的結構假設不獲支持。GDPval 的自助抽樣負荷量區間是 [0.44, 0.99]——它排除了零,但無法告訴你更細節的差異。
但 GDPval 確實提供一般指標沒有的資訊。 完全保留 GDPval,並使用其他十一項基準測試預測其分數,每一折內都重新估計因子;三因子表示法比單一平均分數指標多降低 ΔMSE +0.026,95% CI [+0.010, +0.044],最佳模型的折外 R² = 0.88。因此,只看智慧指標的買家,確實會漏掉專業任務品質方面真實但增幅有限的資訊——這正是此基準測試用來支持另列一欄的量化理由。
規模故事則出現反轉。 對配對的梯度提升學習器做 SHAP 歸因後,代理程式因子排名第一,其次是推理標記,再來才是高難度推理因子;參數對數值和開放權重狀態的貢獻幾乎為零。先前研究發現一般能力因子與參數數量的相關性約為 0.6;但在這裡,規模訊號是透過因子影響 GDPval,而非與因子並列。最大的單一殘差不只是診斷數值,也能解讀——Grok 4.3 Non-reasoning 的經濟性質預測高出 +1.14 個 z 分數單位,符合這項基準測試獎勵某種代理程式行為,而其他基準測試只能間接捕捉到它的解釋。
最直接影響本頁的保留說明。 該快照中的 GDPval 數值來自 Artificial Analysis GDPval Elo 榜,而非論文的勝率;Artificial Analysis 有紀錄指出,該榜在 v1 和 v2 之間曾遭悄悄重新評分,兩者無法比較。Zhu 沒有說明版本。共變異分析不受此影響,但上文任何數字都不能對照本頁的勝率。
延伸閱讀#
- Task Time-Horizon Scaling——這項基準測試刻意與之辯論的指標:在重疊工作上,固定可靠度下的任務時間呈指數上升,而對照專家的品質大致線性上升。論文的線性主張來自三個僅涵蓋 OpenAI 的資料點,終點為 38.8%;論文自己的任務時間梯度(最佳模型從 0–2 小時的 56% 降至 8 小時以上的 37%),則是在品質軸上重新測量時間跨度形狀
- Economic Benchmark Construct Validity——對 GDPval 所代表領域進行外部建構效度稽核,也是首份不出自基準測試作者、量化說明 GDPval 測量內容的研究。GDPval 在與 Terminal-Bench 共用的代理程式因子上負荷量為 0.84,依預先指定的規則並未形成獨立經濟因子;但在樣本外仍比單一智慧指標多提供 ΔMSE +0.026 [+0.010, +0.044]——沒有獨立構念,仍有增額效度。這份研究也說明,若兩個相隔數月發布的模型之間 GDPval 差距不大,應先依日期調整再解讀
- Expenditure Horizon——最接近的關聯研究,也是最可能採取聯合方法的一項:METR 以美元衡量單一最佳化問題中代理程式與人類的成本;GDPval 則透過結合人類薪資成本、實測專家審查時間和 API 成本,跨 44 種職業計算節省比率。GDPval 的版本明確納入監督成本,結果是原有的 474 倍優勢縮至 1.63 倍
- Verification as the New Bottleneck——同一個瓶頸,現在有了價格標籤:對一項耗時 404 分鐘的任務,專家要花 109 分鐘審查,而且每次重新取樣都得付出這個成本,因此天真的成本優勢只剩四捨五入後的誤差
- DRACO Benchmark——方法上的姊妹研究,也是利益衝突的對照。兩者都是由供應商建立、評估真實專業工作的基準測試,由專家判斷成果;DRACO 中供應商自家產品在每個領域都獲勝,GDPval 中供應商自家模型卻輸給競爭對手 8.8 個百分點。這種不對稱,是判斷該給哪一家供應商的基準測試打折時,最容易取得的證據
- Production-Sourced Evaluation——相鄰但不同的取材方法。DRACO 採用去識別化的實際產品流量;GDPval 則委託專業人士提交自己的真實工作成果,再讓每項任務經過五位專家審查。它既不是合成資料、憑空手寫的任務,也不是從生產環境抽樣——而是第三條路,可取得具職業代表性的樣本與以薪資計價的任務價值,代價則是分布由基準測試作者挑選,而非實際觀察所得
- LLM-Judge Validation——GDPval 的評分器驗證,是該頁追蹤的兩種情況之實例:將一致率相對於人類評分者的一致性上限報告(65.7% 對比 70.8%),而非對照 100%;同時實測出自我偏好效應——評分器 GPT-5-high 在評估能力強的 OpenAI 模型輸出時,反而較不同意人類評分者
- Usage-Telemetry Classifier Validation——不同測量問題上的相同相對上限報告方式;兩個實驗室各自得出「自動評分器應與人類彼此評分的結果比較」的結論
- Agent-Authored Harness Optimization——GDPval 是 HarnessBank 封存資料集 harness 演進中的一個領域(43.7 → 52.9 Pass@1,+9.2);加上本論文自己的提示詞調校和最佳 N 次取樣結果,顯示專家差距中有很大一部分來自流程而非能力
- Deep Research Agents——同一講座提到的第三項基準測試 DeepScholar-Bench,是本頁參考檔案失誤的延伸研究:GDPval 顯示模型會略過提供的參考資料;DeepScholar-Bench 測量模型必須自行尋找參考資料時的表現
- Context Advantage, Not Taste——規格不足消融測試以實驗驗證了這項主張,並提供數字:提示詞縮至原始長度的 42% 後,GPT-5 的勝場或平手率從 47.7% 降至 44.3%;質化失誤(「難以掌握脈絡」)造成的影響又大於 3.4 個百分點
- Returns to Expertise in Agentic Coding——從人類角度呈現相同的不對稱;GDPval 的基準是一位平均有 14 年職業經驗的專業人士,其優勢很大一部分來自脈絡,而基準測試的設計正是要把這些脈絡交給模型
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated——同一組問題的第五種測量工具,測量其他四者沒有測量的東西:不是 LLM 能做什麼,不是工作者表示 AI 做了什麼,也不是遙測觀察到什麼,而是交付成果實際上有沒有勝過專業人士。職業與產業的選取方式本身也是一項曝險測量設計選擇——先看 GDP 貢獻,再要求數位任務占比至少 60%
- Task Saturation: Broad but Shallow AI Diffusion——同一勞動市場的互補切面:ATLAS 詢問 AI 至少接觸到某職業多少任務;GDPval 則詢問九個產業中、依薪資總額而非實際使用情況選出的高薪數位工作,其輸出品質如何
- Cost-per-Task Over Cost-per-Token——供應商模型選擇指南引用 GDPval-AA 衍生榜來評估知識工作;此處依交付成果類型劃分的結果(Claude 領先 pdf/xlsx/pptx,GPT-5 領先純文字),則以基準測試自己的數據為該建議背書
- The Open-Weight Frontier Gap——在 GDPval-AA Elo 榜上,開放與封閉代理程式之間的差距為 61 Elo;這裡則介紹其底層基準測試的實際評估內容
- Measuring Beyond Accuracy Saturation——從另一個方向否定只看核心準確度:該頁將已飽和的基準測試沿非準確度面向重新設計;本頁則改變了評估對象,改用由人類評分的經濟價值工作。GDPval 主張沒有成長上限的理由是:只要更換基準對象,勝率就不會飽和
- Failures That Look Like Success——GDPval 的主要失誤模式正是這一類:Grok 和 Gemini 有 35–40% 的樣本出現遵循指示問題;模型承諾交付成果卻沒交付,也會忽略參考資料,但產出的文件看起來仍然沒問題
- Jagged Intelligence (Ghosts, Not Animals)——以三種粒度測量有償工作中的鋸齒狀能力:職業、產業(單一模型從 32% 到 56%),以及交付成果檔案類型
- OpenAI——此基準測試的作者,也是利益衝突的來源
- Aakanksha Chowdhery——在 2026-09-10 前,這位講師的 CS329A 課程是本頁唯一來源;論文大致證實了她讀取投影片時提到的數字
- CS329A: Self-Improving AI Agents (Stanford)——課程資訊;第 8 講以 METR 的時間跨度和 DeepScholar-Bench,將本基準測試列為代理程式評估的三個面向之一
- Cognitive Capability Profiling for Task Suitability——以能力拆分進行分析的對照研究,也是兩篇論文都沒有做的比較。GDPval 詢問模型的交付成果能否在真實工作中勝過平均有 14 年經驗的專業人士,並以盲測成對勝率評分,但完全沒有能力拆分;Prunty 等人則根據 19,535 個附有量規標註的基準項目推論模型在八個維度上的認知概況,對照 410 名工作者所述的工作活動需求,但不觀察任何輸出。前者以現任從業者為基準評估輸出;後者拆分能力,卻沒有任何驗證標準。讓他們建立認知概況的六套系統執行本頁的 220 項開放 gold subset,再把勝率與各活動的適用性相關分析,是兩個頁面都還欠缺的明確驗證;而且兩者的職業分類詞彙都取自 O*NET,因此現成就能交叉比對
待解決的問題#
- GDPval 只評估單次交付成果,沒有反覆修正。允許模型像真實工作那樣來回互動後,有多少專家差距能縮小——而這種差距來自能力還是流程?2026-09-10 由 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks 部分回答,但只涵蓋非互動部分。 論文測試的三種手段,在沒有任何人類介入的情況下都帶來明顯效果:推理力度(GPT-5 從 low 提升至 high,32.7% → 38.8%)、通用格式與自我檢查提示詞(38.8% → 43.1%;檢查自身交付成果的比例從 15% 升至 97%,並消除 PDF 黑色方塊偽影),以及輔助架構(搭配評審的最佳 N 次取樣,N=4,並開放容器 GET 存取)。論文外的 HarnessBank 封存資料集 harness 演進另增 9.2 個百分點。因此,有相當一部分差距源於流程。互動部分仍未測試——論文將單次、非互動式評估列為自身限制,並承諾未來版本會改進——而可證偽的研究方式也更清楚了:對 gold subset 採用有限次數的專家修正,測量勝率提升幅度,再與同一評分者對非互動流程所測得的 4.3 個百分點提示詞調校增益比較。
- 核心比較是系統層級,而非模型層級:Claude Opus 4.1 透過消費者版 UI 取樣以啟用檔案建立,OpenAI 模型則透過 API 執行,並搭配網頁搜尋、程式碼解譯器和預先安裝的函式庫。Claude Opus 4.1 與 GPT-5 high 之間的 8.8 個百分點差距,有多少來自模型,有多少來自取樣介面?可直接驗證——用相同的 API 輔助架構在開放的 220 項 gold subset 上執行兩者。
- 節省成本分析只涵蓋 OpenAI 模型——論文無法取得 Claude、Gemini 或 Grok 的成本估算——因此勝率最高的模型,沒有出現在勝率會影響報酬的表格中。勝率達 47.6% 的模型,反覆嘗試比率會高於 GPT-5 的 1.63 倍嗎?每份交付成果的價格要多少?
已解決問題#
論文本身不在這份資料集中——此處每個數字都是講師讀投影片得來的。GDPval 公布的數字究竟是什麼?ASR 受損的品質分布與成本主張,有多少能經得起原始資料檢驗?2026-09-10 由 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks 回答(arXiv 2510.04374 v1,empirical)。大多數內容都經得起檢驗。品質分布與講者所述相符(47.7% 可接受但品質較差/22.9% 模型較好/29.4% 糟糕或災難性),但本頁的分母寫錯了——這些是 GPT-5 失分項目占比,不是所有輸出占比。成本主張也正確,本頁卻錯誤地將其刪除,聲稱無法調和:「成本 1.6 倍、速度 1.4 倍」正是 GPT-5 的反覆嘗試數據(1.63 倍/1.39 倍),「低於專家薪資的 10%」則是同一表格的天真估算欄。三點未獲證實:產業規則(每個產業均超過 5%,並非前 5% 的區間)、O*NET 數位工作篩選條件(每種職業須達到 60% 的納入門檻,而不是保留任務的占比),以及專家年資(至少 4 年,平均 14 年,並非「10 年以上」)。最大的更正並非來自講座,而是來自本頁自身的解讀:大致線性的趨勢,是僅涵蓋 OpenAI 的三點擬合,終點為 38.8%;而 47.6% 則是競爭對手在另一張沒有時間軸的圖表中取得的分數。
資料來源#
-
One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(Oxford Internet Institute,單一作者、未經同儕審查的預印本),One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation,arXiv 2608.29420,2026-08-29,25 頁,
empirical。本頁上述段落引用 §5.3 和附錄 E 表 3(日期調整後三因子負荷量、GDPval 0.84/0.13/−0.04,以及使區分只能視為探索性的單因子保留結果)、§5.4 和表 1(ΔMSE +0.026 [+0.010, +0.044] 及其在比較序列中的位置)、附錄 M(折外 R² = 0.88、SHAP 排序、Grok 4.3 Non-reasoning +1.14 殘差),以及附錄 F(GDPval 在 548 個原始配置中評估 117 個,保留 112 個——各項評測中倒數第二稀疏的欄位)。表 1、3、4 均已與pdftotext -layout逐一核對,完全吻合。範圍:論文僅處理內部效度,不論證 GDPval 是否能預測任何真實經濟成果。完整討論見 Economic Benchmark Construct Validity -
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan、Dias、Proehl、Kim、Wang、Watkins、Posada Fishman、Aljubeh、Thacker 等人(19 位作者,皆來自 OpenAI),GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks,arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。除非特別標明歸於講座,這是本頁所有內容的主要來源:§2(產業和職業選取、專家招募、任務建立、審查流程)、§2.5 和 A.6(評分流程、自動評分器一致率,以及自我偏好和無法評分任務的限制)、§3.1 和圖 5–6(核心勝率;僅涵蓋 OpenAI 的時間序列)、§3.2 和 A.2.1 與表 2(速度/成本模型及其比率)、§3.3 和圖 8(失誤分類)、§3.4 和圖 9(推理力度、提示詞調校、輔助架構)、§5(限制)、A.2.2–A.2.6(產業、職業、交付成果、任務時間和失誤嚴重程度的細分)、A.2.7 和圖 15(規格不足消融測試)、A.4 表 3–7(任務特性)、A.7(O*NET 數位任務方法及其 Acemoglu–Autor 驗證)。以 baseline-lane 匯入,刻意不受通常的新鮮度時間窗限制,因為本頁原本完全依據講座內容撰寫。ICLR 2026 的 camera-ready 版本已發布於 proceedings.iclr.cc,但並未匯入;本頁任何內容都不應被引述為 camera-ready 版本的原文。解析說明:七張表均已在編寫時依pdftotext -layout逐格重新核對(表 2 第 13 頁、表 3–6 第 19 頁、表 7 第 20 頁、表 1 第 29 頁)——完全吻合,沒有欄位崩塌、移位或黏合。表 7 的標題黏在一起(%, gold set%, full set),忠實呈現 PDF 原貌;第一欄資料是 gold set。圖 5 只有圖片,匯入時已轉錄;在引用任何依據圖表得出的下列數字前,編寫時已直接查看該轉錄和圖 4b、圖 6–15。利益衝突:OpenAI 撰寫基準測試、挑選職業、支付專家酬勞、定義指標,並提供七個受評模型中的四個,以及 GPT-5-high 自動評分器——但核心結果由競爭對手模型勝出,而且論文也報告了自家評分器偏好自家模型的現象。利益衝突真正影響的是成本分析,因為分析只涵蓋 OpenAI 模型 -
CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks — Aakanksha Chowdhery,Stanford CS329A 第 8 講,2025-11-17 授課,2026-08-03 發布(
practitioner-opinion,YouTube 自動字幕稿,約 12.9k 字)。2026-09-10 前,這是本頁最初且唯一的來源;現在降為次要資料,但仍保留其論文未涵蓋的內容:上文引用的 METR 與 GDPval 對比、示例任務列表、各職業接近平手的評論、軟體開發者基準可能來自程式碼儲存庫維護者的保留說明,以及對規格不足結果的詮釋。圖表數字透過 ASR 從投影片讀取;凡與論文不同之處,上文均以論文取代。本頁的刪除線記錄了哪些講座說法成立、哪些不成立。沒有利益衝突——基準測試屬於 OpenAI,兩位 CS329A 講師都不是論文作者
Cited by 26
- CS329A: Self-Improving AI Agents (Stanford)×4
GDPval (OpenAI) · win rate against a practising professional on real paid work — Gdpval Benchmark ·…
- Artificial Analysis×3
GDPval-AA (Elo, v1 and v2) · Gdpval Benchmark, Claude Opus 4 8, Kimi, Open Weight Frontier Gap · an…
- Task Time-Horizon Scaling×3
Gdpval Benchmark — the deflationary counterweight taught alongside this metric: win rate against a…
- Aakanksha Chowdhery×2
Gdpval Benchmark — lecture 8's middle third, and until 2026-09-10 the wiki's only account of the…
- Agent-Authored Harness Optimization×2
Gdpval Benchmark — the domain in HarnessBank's suite whose primary benchmark this wiki now holds,…
- Cognitive Capability Profiling for Task Suitability×2
Gdpval Benchmark — the outcome-measured counterpart, and the comparison this paper never makes.…
- Context Advantage, Not Taste×2
Gdpval Benchmark — the asymmetry run as an experiment on paid work, and since 2026-09-10 with the…
- Cost-per-Task Over Cost-per-Token×2
Gdpval Benchmark — what the GDPval-AA row in the model-selection table above is built on, and where…
- DRACO Benchmark×2
gdpval real world economically valuable tasks — Patwardhan et al. (19 authors, OpenAI), arXiv…
- Expenditure Horizon×2
Gdpval Benchmark — the nearest sibling on the dollar axis, and the one that prices the piece this…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated×2
Gdpval Benchmark — an instrument outside this page's four, and outside Steele & Cruz's seven,…
- Failures That Look Like Success×2
Gdpval Benchmark — the class as the dominant failure mode of an economically-framed benchmark…
- Jagged Intelligence (Ghosts, Not Animals)×2
Gdpval Benchmark — jaggedness measured on paid work at three granularities, and the reason its…
- LLM-Judge Validation×2
gdpval real world economically valuable tasks — Patwardhan et al. (19 authors, OpenAI), arXiv…
- Open Questions Backlog×2
Gdpval Benchmark ×2 (oldest 19d) — The headline comparison is system-level, not model-level: Claude…
- Production-Sourced Evaluation×2
Gdpval Benchmark — the third sourcing route, adjacent to this page's and distinct from both of its…
- Returns to Expertise in Agentic Coding×2
Gdpval Benchmark — the benchmark that deliberately erases the premium, and since 2026-09-10 with…
- Task Saturation: Broad but Shallow AI Diffusion×2
gdpval real world economically valuable tasks — Patwardhan et al. (19 authors, OpenAI), arXiv…
- Usage-Telemetry Classifier Validation×2
Gdpval Benchmark — the same reporting discipline reached independently by a different lab on a…
- Claude Opus 4.8
The GDPval-AA row is the v1 board as reported in 4.8's own system card. Artificial Analysis later…
- Deep Research Agents
Read against GDPval from the same lecture, the two failures are one failure at different distances:…
- Economic Benchmark Construct Validity
Gdpval Benchmark — the economic benchmark this snapshot scores highest and predicts best, sitting…
- Measuring Beyond Accuracy Saturation
Gdpval Benchmark — the third response to "traditional benchmarks are saturating", after…
- Evals & Benchmarks
Gdpval Benchmark — OpenAI's benchmark of real, economically valuable knowledge work: 1,320 tasks…
- The Open-Weight Frontier Gap
Gdpval Benchmark — the benchmark under the GDPval-AA Elo board this page differences: real…
- OpenAI
Gdpval Benchmark — OpenAI's benchmark for whether a model's deliverable beats a practising…
Related articles
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
