資料來源#
- CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation
- DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias
- When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
摘要#
DRACO(深度研究準確性、完整性與客觀性)是由 Perplexity(與一位哈佛大學共同作者)於 2026 年 2 月發表的基準測試,包含 100 項複雜、開放式的深度研究任務,涵蓋 10 個領域,需要蒐集 40 個國家的資訊(arXiv:2602.11685)。它的特色在於:任務取自 Perplexity Deep Research 真實且去識別化的正式產品使用情境(Production-Sourced Evaluation),而非合成或人工撰寫的提示,之後再搭配任務專屬的專家評分規準,並由 LLM-as-a-judge 評分。這是評估系統/產品的基準,而非基礎模型;因此,它最受矚目的發現(編排能力勝過裸模型)也更容易理解。
差異所在(表 1)#
DRACO 定位為第一個同時具備以下特性的深度研究基準:取自正式產品使用情境、由人撰寫、一般領域(而非只涵蓋專門/技術領域),以及依專家評分規準評分。先前的開放式基準至少缺少其中一項:DeepResearchEval、ReportBench、DeepScholar-Bench 和 DRBench 仰賴合成任務生成;<sup>†</sup>其他基準雖由人撰寫,卻範圍狹窄或缺少專家評分規準。沒有任何一個直接取材自廣泛可用的正式深度研究系統。
<sup>†</sup> 有一個案例的「合成」標籤值得加註說明。DeepScholar-Bench 會自動生成任務,但其生成器使用近期真實 arXiv 論文,每月更新並限於訓練後截止日期之後發表的論文。因此,它是「非人工撰寫」意義上的合成,既非模型憑空想像,也不會受到資料污染。DRACO 的分類軸將取自正式產品使用情境的資料與其他來源區分;若看資料污染這個軸,DeepScholar-Bench 和 DRACO 位於同一側,而 DRACO 所強調的可更新性,正是 DeepScholar-Bench 已經實作的做法。
任務建構(5 個階段)#
任務取自 Perplexity Deep Research 的正式產品查詢,之後經過改寫、擴增和篩選,使任務不含身分資訊、規格明確、範圍有限、具挑戰性且能代表實際使用情境:
- 抽樣 — 從 2025 年 9 至 10 月的查詢中取出 1,000 項高難度英文查詢;以後續負面情緒或對先前回覆按下倒讚,作為難度的替代指標。
- 預處理 — 使用 LLM 改寫查詢,以移除個人識別資訊並降低歧義;全程自動化,人類分析員從未看過任何原始查詢(以隱私為設計原則)。
- 擴增 — 沿兩個軸線系統性擴展:情境(角色、輸出格式、來源具體程度)與範圍(時間、跨實體比較、地理區域)。將模糊查詢轉成定義明確、能反映使用者隱含意圖的任務。
- 篩選 — LLM 只保留符合下列條件的任務:客觀(專家對優劣有共識)、可處理(範圍有限)且困難(需要非平凡的多步驟蒐集/綜合資訊)。
- 策選 — 抽取 100 項任務,使其符合真實領域分布,之後由內部領域專家人工審查。
10 個領域為:金融、購物/產品比較、學術、科技、一般知識、UX Design、法律、醫療、海底撈針、個人化助理。
評分規準設計與評分#
評分規準由 26 位受邀領域專家(醫師、律師、金融分析師、工程師、設計師)透過包含 LLM 協助的 4 階段流程建立,其中包含飽和度測試:若領先系統在某任務已獲得 >90% 的分數,該任務就會送回去加強難度(約 45% 的任務經過此處理)。每項任務在四個軸線上合計有 約 39.3 個加權評分準則;其中約一半針對事實準確性。評分準則分為正向(值得肯定的特性)與負向(缺失或陷阱),最嚴厲的扣分保留給有害的醫療內容(最低至 −500)。
| 軸線 | 權重範圍 | 每項任務約有的評分準則數 |
|---|---|---|
| 事實準確性 | −500 至 +20 | 20.5 |
| 分析廣度與深度 | −100 至 +10 | 8.6 |
| 呈現品質 | −50 至 +20 | 5.6 |
| 引用品質 | −150 至 +10 | 4.8 |
評分採用開源的 LLM-as-a-judge 流程:逐項評分準則判定符合/不符合,再計算加權的標準化分數(0–100%)與通過率。評審模型為 Gemini-3-Pro(透過內部人類與 LLM 對齊研究選出);GPT-5.2 和 Sonnet-4.5 提供交叉佐證。不同評審的排名一致,但絕對分數高低會變動。
主要結果#
**Perplexity Deep Research 在所有領域和所有評分軸都居首。**以下比較深度研究系統:
| 系統 | 標準化分數 | 通過率 |
|---|---|---|
| Perplexity Deep Research (Opus 4.6) | 70.5 | 72.8 |
| Perplexity Deep Research (Opus 4.5) | 67.2 | 70.9 |
| Gemini Deep Research | 59.0 | 62.7 |
| OpenAI Deep Research (o3) | 52.1 | 56.9 |
| OpenAI Deep Research (o4-mini) | 41.9 | 48.0 |
| Claude Opus 4.6 (裸模型 + 工具) | 59.8 | 63.1 |
| Claude Opus 4.5 (裸模型 + 工具) | 46.7 | 50.2 |
對這份 wiki 而言,有三項重要發現:
- **編排能力 > 基礎模型。**Perplexity(Opus 4.6 基礎模型)比搭配工具的裸 Opus 4.6 高出約 10 個百分點;參見深度研究代理程式。這是模型進步時 Harness 縮減論點的一項即時反例。
- Claude Opus 4.6 是最強的非 Perplexity 系統(59.8%/63.1%),領先 Gemini Deep Research 與兩種 OpenAI 設定。Opus 4.6 在 10 個領域中有 5 個排名第二(非 Perplexity 系統)。
- 事實準確性/引用是各系統普遍較弱的軸線;呈現品質則在所有系統中最強。Perplexity 與第二名的差距在金融領域最大(21.6 個百分點),法律領域最小(1.6 個百分點)。
限制(論文自述)#
只測試單輪互動(未測試提出澄清問題/多輪互動能力);儘管更新流程可自動化,測試仍是靜態快照;僅限文字(不含多模態);僅限英文;擴增可能過度明確地規定任務,消除自然查詢的多樣性;建立評分規準仍需要大量領域專家投入;絕對分數會受到 LLM 評審影響(但排名不會)。評估層級為系統(黑箱),無法將結果歸因到檢索、規劃或綜合等個別元件。
相關連結#
- GDPval Benchmark — 方法上的雙生基準,也是利益衝突的對照鏡;它為本頁自身的可信度問題提供目前最精準的校準。兩者都是供應商建立、針對真實專業工作的基準,依專家判斷評分,而非比對標準答案;兩者都開源部分資料,並提供以人類評分一致性驗證過的 LLM 評分器。差異在結果:DRACO 中,作者自己的產品在每個領域與每個評分軸都領先;GDPval 中,OpenAI 的最佳模型在最受矚目的結果上以 8.8 分落後 Claude Opus 4.1(38.8% 對 47.6%),而且論文也指出自家的 GPT-5-high 評分器偏好自身。基準作者自己的產品沒有勝出,能提供任何方法章節都無法補上的建構證據;反過來說,這也正是 DRACO 全面勝出的結果值得打折看待之處。GDPval 的利益衝突影響範圍較窄,卻很有啟發性:速度與成本分析只涵蓋 OpenAI 模型
- 深度研究代理程式 — DRACO 評估的系統類別;此文探討編排、驗證與效率相關發現
- Production-Sourced Evaluation — DRACO 的核心方法學貢獻:以真實且去識別化的正式產品流量建立任務
- LLM-as-a-Judge — DRACO 採用的依評分規準逐項判定流程;也連結到 CalibratedRubric 探討的評分規準建構環節:DRACO 的 26 位專家與 4 階段撰寫流程,正是該研究試圖降低的成本;而它的拆分方式也提供了有用回應:光靠評審一致性,就能自動化評分規準庫的篩選、加權與規模設定(κ 0.604 → 0.743;49 項而非 131 項評分規準),但撰寫與驗證評分準則仍無法自動化。這也提醒我們注意 DRACO 自己的飽和度測試:若領先系統得分 > 90%,就會加強任務難度;該測試會依目前排行榜重新推導評分準則,而由共識推導出的評分準則集合,已被證明會受到推導時所用評審小組影響
- Task Time-Horizon Scaling — 相關的能力基準;METR 衡量模型能持續處理的任務長度,DRACO 衡量代理程式系統研究報告的品質,兩者都指出基準飽和壓力(DRACO 的飽和度測試會剔除 >90% 已解決的任務)
- 模型進步時 Harness 縮減 — DRACO「編排勝過裸模型」的結果,是 Harness 縮減論點的反例
- 驗證成為新的瓶頸 — 所有系統的事實準確性弱點,都顯示驗證問題浮現於研究產品之中
- Evals as Product Spec — DRACO 是「以 evals 定義完成標準」的大規模外顯形式,評分規準則代表 eval set
- Perplexity/Anthropic/Google DeepMind — 基準作者;以及受評估系統和評審模型的開發者
- LLM-Judge Validation — 對 DRACO 評審穩定性主張的補充觀點:DRACO 顯示排名跨評審模型保持一致(更換評審,任務不變);Norman 等人(2026)則顯示評審排名跨基準並不穩定(更換任務)。兩者測量的是不同的不變性,合併來看能界定評審評分排名的可轉移範圍
- Reference-Free Judge Over-Crediting — DRACO 評分的開放式報告沒有單一標準答案(近似無參考答案的設定),並發現事實準確性是普遍弱點;Kranti 與 Vajjala 說明其機制:提示中沒有參考資料時,評審會對錯誤答案給予過多肯定
開放問題#
- 這個基準目前是靜態的,但建構流程可自動化。Perplexity 會真的更新它嗎?若供應商建立的基準中,供應商自己的產品獲勝,這個基準還能長期維持可信度嗎?2026-09-10 由 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks(
empirical)進一步聚焦;它提供的是對照案例,而非答案。OpenAI 建立了同類型基準:真實專業工作、專家成對評分、開放子集,以及供應商打造的自動評分器。它自己的最佳模型落後競爭對手 8.8 分,而且論文另指出 GPT-5-high 評分器在評估 OpenAI 輸出時,與人類專家的符合程度更低。因此,「由供應商建立」本身並不足以否定基準;真正能區分優劣的是當供應商有選擇空間時做了哪些決定:哪些模型有成本比較列(GDPval 只涵蓋 OpenAI 模型)、哪家產品能以最佳設定的抽樣介面參與(GDPval 透過消費者介面抽樣 Claude,透過調校過的 API 腳手架抽樣 OpenAI 模型),以及評分器是否測量自身偏好,還是置之不理。這個頁面現在應該反問自己的第三個問題:DRACO 使用第三方模型作為評審,排除了自我偏好管道,卻沒有排除評分規準撰寫者造成的影響。 - 排名在不同評審下保持穩定,但分數高低會變;若改用非 Gemini 評審,絕對分數會變動多少?這會影響跨論文比較嗎?Yang 等人(2026)已於 2026-08-04 部分回答,但構念上仍有限制。他們固定候選答案配對,只更換評審,設計正符合此問題:在對抗式 LLMBar 上,十種評審測得的數值從 0.463(Qwen3-1.7B)→ 0.900(GLM-5.1),而且沒有任何評審在四個資料集中都領先;這表示單是評審選擇就會造成很大的差距,而且差距的方向取決於資料集,這正是讓天真跨論文比較失效的部分。不過,也有兩項校準結果指向較小的影響。同一家族的相鄰版本(MiniMax M2 → M2.7)準確度最多只差 0.022,配對 McNemar 檢定也從未達顯著;因此例行的供應商升級只是小幅擾動。即使固定同一個評審,單純反轉 A/B 順序也會讓它改變 14.7% 的自身判定;因此看似來自評審選擇的部分差異,其實是評審內部的流程雜訊,可透過隨機化答案位置來消除。**讓此問題仍未解決的限制:**他們的「絕對分數」是評審對成對項目的人類偏好標籤之符合準確度,而不是系統對長篇報告的加權評分規準分數。開放式研究輸出依加權評分規準評分時,沒有可用來衡量準確度的標準成對標籤,因此更換評審對 DRACO 式分數的影響幅度仍未經測量。
- 以正式產品使用情境資料搭配專家評分規準的方法,能否以低成本推廣到非英文、多模態和多輪深度研究?
資料來源#
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等人(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。本文將其作為利益衝突的對照案例:§3.1 圖 5(作者自有基準上 Claude Opus 4.1 得分 47.6%,GPT-5 high 得分 38.8%)、§2.5 與 A.6.2(GPT-5-high 評分器與人類一致率為 65.7%,低於人類最高的 70.8%;作者指出它偏好 OpenAI 輸出)、註腳 2(透過消費者介面抽樣 Claude,透過調校過的 API 腳手架抽樣 OpenAI 模型),以及註腳 4(未估算非 OpenAI 模型的成本)。完整分析見 GDPval Benchmark - DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity — 完整論文(arXiv:2602.11685,Perplexity 與哈佛大學,2026 年 2 月):任務建構、評分規準流程、評分方法及所有結果表格
- Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias — Norman 等人(arXiv 2606.19544,2026 年 6 月,
empirical):呈現跨基準差異,與 DRACO 跨評審模型保持不變的結果相對照;參見 LLM-Judge Validation - When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability — Yang、Hou 與 Yang(arXiv 2607.08535,2026 年 7 月,
empirical):§4.1 與表 3(固定候選答案時更換評審造成的分數差距;沒有評審在四個資料集中都領先;相鄰版本差異不顯著)、§4.2(14.7% 的 A/B 順序反轉殘餘翻轉率);探討評審版本軸線,也部分回答本頁關於分數變動幅度的問題;參見 LLM-Judge Validation - CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation — Chen 等人(FinStep 與 StepFun,arXiv 2607.29252,2026-07-31,
empirical):說明評分規準庫建構哪些部分可自動化、哪些不可自動化(§3 假定評分規準集合已給定;§4.2 κ 0.604 → 0.743;§4.3 為 49 項對 131 項評分規準),並提出命題 1,指出由共識推導的評分準則集合會受排行榜規模影響;完整分析見 LLM-as-a-Judge
Cited by 14
- LLM-Judge Validation×5
The vault's prior answer on judge trust came from DRACO: rankings are stable across judge models,…
- Deep Research Agents×4
Deep research is a long-horizon, autonomous, multi-step task — exactly the regime Task Time Horizon…
- Open Questions Backlog×3
Draco Benchmark: The benchmark is static; the construction pipeline is automatable. Will Perplexity…
- Production-Sourced Evaluation×3
Production-sourced evaluation builds a benchmark from real, de-identified usage of a deployed…
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×2
DRACO finds system-under-test rankings stable across judge models while absolute magnitudes vary;…
- LLM-as-a-Judge×2
LLM-as-a-judge is the evaluation paradigm where one language model scores another model's outputs…
- Perplexity×2
Perplexity is an AI answer-engine / search company. In this corpus it appears as the author of the…
- Anthropic
Draco Benchmark — Claude Opus 4.6 is the strongest non-Perplexity deep-research system on this…
- Evals as Product Spec
Draco Benchmark — evals externalized to benchmark scale: expert rubrics as the eval set, graded…
- GDPval Benchmark
Draco Benchmark — the methodological twin and the COI mirror. Both are vendor-built benchmarks of…
- Google DeepMind
Draco Benchmark — Gemini plays both roles in Perplexity's deep-research benchmark: Gemini Deep…
- Evals & Benchmarks
Draco Benchmark — Perplexity's benchmark of 100 production-sourced deep-research tasks (10 domains,…
- Reference-Free Judge Over-Crediting
Draco Benchmark — DRACO grades open-ended deep-research reports without a single gold answer (a…
- Task Time-Horizon Scaling
Draco Benchmark — a sibling capability benchmark (quality of agentic research reports vs. the task…
Related articles
- Deep Research Agents
Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
- LLM-Judge Validation
UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
- Agent Quality Flywheel
Google's eval-fix loop packaged as a skill your coding agent drives: Build & Test → Ship & Monitor → Learn & Refine, ex…
