H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translatedENHOWARDISM

DRACO Benchmark

Perplexity 以 100 項取自正式產品使用情境的深度研究任務(涵蓋 10 個領域、40 個國家)建立的基準測試,由 26 位專家依準確性、完整性、客觀性與引用評分;Perplexity Deep Research 在所有領域與評分軸皆領先,Claude Opus 4.6 是最強的非 Perplexity 系統,而事實準確性是普遍弱點

Article metadata
Publication details
Published:June 15, 2026
Filed:Concept
Domain:Evals & Benchmarks
Tags:BenchmarksCapability EvaluationDeep ResearchLLM As A Judge
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

DRACO Benchmark 插圖

資料來源#

摘要#

DRACO(深度研究準確性、完整性與客觀性)是由 Perplexity(與一位哈佛大學共同作者)於 2026 年 2 月發表的基準測試,包含 100 項複雜、開放式的深度研究任務,涵蓋 10 個領域,需要蒐集 40 個國家的資訊(arXiv:2602.11685)。它的特色在於:任務取自 Perplexity Deep Research 真實且去識別化的正式產品使用情境(Production-Sourced Evaluation),而非合成或人工撰寫的提示,之後再搭配任務專屬的專家評分規準,並由 LLM-as-a-judge 評分。這是評估系統/產品的基準,而非基礎模型;因此,它最受矚目的發現(編排能力勝過裸模型)也更容易理解。

差異所在(表 1)#

DRACO 定位為第一個同時具備以下特性的深度研究基準:取自正式產品使用情境、由人撰寫、一般領域(而非只涵蓋專門/技術領域),以及依專家評分規準評分。先前的開放式基準至少缺少其中一項:DeepResearchEval、ReportBench、DeepScholar-Bench 和 DRBench 仰賴合成任務生成;<sup>†</sup>其他基準雖由人撰寫,卻範圍狹窄或缺少專家評分規準。沒有任何一個直接取材自廣泛可用的正式深度研究系統。

<sup>†</sup> 有一個案例的「合成」標籤值得加註說明。DeepScholar-Bench 會自動生成任務,但其生成器使用近期真實 arXiv 論文,每月更新並限於訓練後截止日期之後發表的論文。因此,它是「非人工撰寫」意義上的合成,既非模型憑空想像,也不會受到資料污染。DRACO 的分類軸將取自正式產品使用情境的資料與其他來源區分;若看資料污染這個軸,DeepScholar-Bench 和 DRACO 位於同一側,而 DRACO 所強調的可更新性,正是 DeepScholar-Bench 已經實作的做法。

任務建構(5 個階段)#

任務取自 Perplexity Deep Research 的正式產品查詢,之後經過改寫、擴增和篩選,使任務不含身分資訊、規格明確、範圍有限、具挑戰性且能代表實際使用情境:

  1. 抽樣 — 從 2025 年 9 至 10 月的查詢中取出 1,000 項高難度英文查詢;以後續負面情緒或對先前回覆按下倒讚,作為難度的替代指標。
  2. 預處理 — 使用 LLM 改寫查詢,以移除個人識別資訊並降低歧義;全程自動化,人類分析員從未看過任何原始查詢(以隱私為設計原則)。
  3. 擴增 — 沿兩個軸線系統性擴展:情境(角色、輸出格式、來源具體程度)與範圍(時間、跨實體比較、地理區域)。將模糊查詢轉成定義明確、能反映使用者隱含意圖的任務。
  4. 篩選 — LLM 只保留符合下列條件的任務:客觀(專家對優劣有共識)、可處理(範圍有限)且困難(需要非平凡的多步驟蒐集/綜合資訊)。
  5. 策選 — 抽取 100 項任務,使其符合真實領域分布,之後由內部領域專家人工審查。

10 個領域為:金融、購物/產品比較、學術、科技、一般知識、UX Design、法律、醫療、海底撈針、個人化助理。

評分規準設計與評分#

評分規準由 26 位受邀領域專家(醫師、律師、金融分析師、工程師、設計師)透過包含 LLM 協助的 4 階段流程建立,其中包含飽和度測試:若領先系統在某任務已獲得 >90% 的分數,該任務就會送回去加強難度(約 45% 的任務經過此處理)。每項任務在四個軸線上合計有 約 39.3 個加權評分準則;其中約一半針對事實準確性。評分準則分為正向(值得肯定的特性)與負向(缺失或陷阱),最嚴厲的扣分保留給有害的醫療內容(最低至 −500)。

軸線權重範圍每項任務約有的評分準則數
事實準確性−500 至 +2020.5
分析廣度與深度−100 至 +108.6
呈現品質−50 至 +205.6
引用品質−150 至 +104.8

評分採用開源的 LLM-as-a-judge 流程:逐項評分準則判定符合/不符合,再計算加權的標準化分數(0–100%)與通過率。評審模型為 Gemini-3-Pro(透過內部人類與 LLM 對齊研究選出);GPT-5.2 和 Sonnet-4.5 提供交叉佐證。不同評審的排名一致,但絕對分數高低會變動。

主要結果#

**Perplexity Deep Research 在所有領域和所有評分軸都居首。**以下比較深度研究系統:

系統標準化分數通過率
Perplexity Deep Research (Opus 4.6)70.572.8
Perplexity Deep Research (Opus 4.5)67.270.9
Gemini Deep Research59.062.7
OpenAI Deep Research (o3)52.156.9
OpenAI Deep Research (o4-mini)41.948.0
Claude Opus 4.6 (裸模型 + 工具)59.863.1
Claude Opus 4.5 (裸模型 + 工具)46.750.2

對這份 wiki 而言,有三項重要發現:

  1. **編排能力 > 基礎模型。**Perplexity(Opus 4.6 基礎模型)比搭配工具的裸 Opus 4.6 高出約 10 個百分點;參見深度研究代理程式。這是模型進步時 Harness 縮減論點的一項即時反例。
  2. Claude Opus 4.6 是最強的非 Perplexity 系統(59.8%/63.1%),領先 Gemini Deep Research 與兩種 OpenAI 設定。Opus 4.6 在 10 個領域中有 5 個排名第二(非 Perplexity 系統)。
  3. 事實準確性/引用是各系統普遍較弱的軸線;呈現品質則在所有系統中最強。Perplexity 與第二名的差距在金融領域最大(21.6 個百分點),法律領域最小(1.6 個百分點)。

限制(論文自述)#

只測試單輪互動(未測試提出澄清問題/多輪互動能力);儘管更新流程可自動化,測試仍是靜態快照;僅限文字(不含多模態);僅限英文;擴增可能過度明確地規定任務,消除自然查詢的多樣性;建立評分規準仍需要大量領域專家投入;絕對分數會受到 LLM 評審影響(但排名不會)。評估層級為系統(黑箱),無法將結果歸因到檢索、規劃或綜合等個別元件。

相關連結#

  • GDPval Benchmark — 方法上的雙生基準,也是利益衝突的對照鏡;它為本頁自身的可信度問題提供目前最精準的校準。兩者都是供應商建立、針對真實專業工作的基準,依專家判斷評分,而非比對標準答案;兩者都開源部分資料,並提供以人類評分一致性驗證過的 LLM 評分器。差異在結果:DRACO 中,作者自己的產品在每個領域與每個評分軸都領先;GDPval 中,OpenAI 的最佳模型在最受矚目的結果上以 8.8 分落後 Claude Opus 4.1(38.8% 對 47.6%),而且論文也指出自家的 GPT-5-high 評分器偏好自身。基準作者自己的產品沒有勝出,能提供任何方法章節都無法補上的建構證據;反過來說,這也正是 DRACO 全面勝出的結果值得打折看待之處。GDPval 的利益衝突影響範圍較窄,卻很有啟發性:速度與成本分析只涵蓋 OpenAI 模型
  • 深度研究代理程式 — DRACO 評估的系統類別;此文探討編排、驗證與效率相關發現
  • Production-Sourced Evaluation — DRACO 的核心方法學貢獻:以真實且去識別化的正式產品流量建立任務
  • LLM-as-a-Judge — DRACO 採用的依評分規準逐項判定流程;也連結到 CalibratedRubric 探討的評分規準建構環節:DRACO 的 26 位專家與 4 階段撰寫流程,正是該研究試圖降低的成本;而它的拆分方式也提供了有用回應:光靠評審一致性,就能自動化評分規準庫的篩選、加權與規模設定(κ 0.604 → 0.743;49 項而非 131 項評分規準),但撰寫與驗證評分準則仍無法自動化。這也提醒我們注意 DRACO 自己的飽和度測試:若領先系統得分 > 90%,就會加強任務難度;該測試會依目前排行榜重新推導評分準則,而由共識推導出的評分準則集合,已被證明會受到推導時所用評審小組影響
  • Task Time-Horizon Scaling — 相關的能力基準;METR 衡量模型能持續處理的任務長度,DRACO 衡量代理程式系統研究報告的品質,兩者都指出基準飽和壓力(DRACO 的飽和度測試會剔除 >90% 已解決的任務)
  • 模型進步時 Harness 縮減 — DRACO「編排勝過裸模型」的結果,是 Harness 縮減論點的反例
  • 驗證成為新的瓶頸 — 所有系統的事實準確性弱點,都顯示驗證問題浮現於研究產品之中
  • Evals as Product Spec — DRACO 是「以 evals 定義完成標準」的大規模外顯形式,評分規準則代表 eval set
  • Perplexity/Anthropic/Google DeepMind — 基準作者;以及受評估系統和評審模型的開發者
  • LLM-Judge Validation — 對 DRACO 評審穩定性主張的補充觀點:DRACO 顯示排名跨評審模型保持一致(更換評審,任務不變);Norman 等人(2026)則顯示評審排名跨基準並不穩定(更換任務)。兩者測量的是不同的不變性,合併來看能界定評審評分排名的可轉移範圍
  • Reference-Free Judge Over-Crediting — DRACO 評分的開放式報告沒有單一標準答案(近似無參考答案的設定),並發現事實準確性是普遍弱點;Kranti 與 Vajjala 說明其機制:提示中沒有參考資料時,評審會對錯誤答案給予過多肯定

開放問題#

  • 這個基準目前是靜態的,但建構流程可自動化。Perplexity 會真的更新它嗎?若供應商建立的基準中,供應商自己的產品獲勝,這個基準還能長期維持可信度嗎?2026-09-10 由 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks(empirical)進一步聚焦;它提供的是對照案例,而非答案。OpenAI 建立了同類型基準:真實專業工作、專家成對評分、開放子集,以及供應商打造的自動評分器。它自己的最佳模型落後競爭對手 8.8 分,而且論文另指出 GPT-5-high 評分器在評估 OpenAI 輸出時,與人類專家的符合程度更低。因此,「由供應商建立」本身並不足以否定基準;真正能區分優劣的是當供應商有選擇空間時做了哪些決定:哪些模型有成本比較列(GDPval 只涵蓋 OpenAI 模型)、哪家產品能以最佳設定的抽樣介面參與(GDPval 透過消費者介面抽樣 Claude,透過調校過的 API 腳手架抽樣 OpenAI 模型),以及評分器是否測量自身偏好,還是置之不理。這個頁面現在應該反問自己的第三個問題:DRACO 使用第三方模型作為評審,排除了自我偏好管道,卻沒有排除評分規準撰寫者造成的影響。
  • 排名在不同評審下保持穩定,但分數高低會變;若改用非 Gemini 評審,絕對分數會變動多少?這會影響跨論文比較嗎?Yang 等人(2026)已於 2026-08-04 部分回答,但構念上仍有限制。他們固定候選答案配對,只更換評審,設計正符合此問題:在對抗式 LLMBar 上,十種評審測得的數值從 0.463(Qwen3-1.7B)→ 0.900(GLM-5.1),而且沒有任何評審在四個資料集中都領先;這表示單是評審選擇就會造成很大的差距,而且差距的方向取決於資料集,這正是讓天真跨論文比較失效的部分。不過,也有兩項校準結果指向較小的影響。同一家族的相鄰版本(MiniMax M2 → M2.7)準確度最多只差 0.022,配對 McNemar 檢定也從未達顯著;因此例行的供應商升級只是小幅擾動。即使固定同一個評審,單純反轉 A/B 順序也會讓它改變 14.7% 的自身判定;因此看似來自評審選擇的部分差異,其實是評審內部的流程雜訊,可透過隨機化答案位置來消除。**讓此問題仍未解決的限制:**他們的「絕對分數」是評審對成對項目的人類偏好標籤之符合準確度,而不是系統對長篇報告的加權評分規準分數。開放式研究輸出依加權評分規準評分時,沒有可用來衡量準確度的標準成對標籤,因此更換評審對 DRACO 式分數的影響幅度仍未經測量。
  • 以正式產品使用情境資料搭配專家評分規準的方法,能否以低成本推廣到非英文、多模態和多輪深度研究?

資料來源#

§ end
Cited by 14
  • LLM-Judge Validation×5

    The vault's prior answer on judge trust came from DRACO: rankings are stable across judge models,…

  • Deep Research Agents×4

    Deep research is a long-horizon, autonomous, multi-step task — exactly the regime Task Time Horizon…

  • Open Questions Backlog×3

    Draco Benchmark: The benchmark is static; the construction pipeline is automatable. Will Perplexity…

  • Production-Sourced Evaluation×3

    Production-sourced evaluation builds a benchmark from real, de-identified usage of a deployed…

  • How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×2

    DRACO finds system-under-test rankings stable across judge models while absolute magnitudes vary;…

  • LLM-as-a-Judge×2

    LLM-as-a-judge is the evaluation paradigm where one language model scores another model's outputs…

  • Perplexity×2

    Perplexity is an AI answer-engine / search company. In this corpus it appears as the author of the…

  • Anthropic

    Draco Benchmark — Claude Opus 4.6 is the strongest non-Perplexity deep-research system on this…

  • Evals as Product Spec

    Draco Benchmark — evals externalized to benchmark scale: expert rubrics as the eval set, graded…

  • GDPval Benchmark

    Draco Benchmark — the methodological twin and the COI mirror. Both are vendor-built benchmarks of…

  • Google DeepMind

    Draco Benchmark — Gemini plays both roles in Perplexity's deep-research benchmark: Gemini Deep…

  • Evals & Benchmarks

    Draco Benchmark — Perplexity's benchmark of 100 production-sourced deep-research tasks (10 domains,…

  • Reference-Free Judge Over-Crediting

    Draco Benchmark — DRACO grades open-ended deep-research reports without a single gold answer (a…

  • Task Time-Horizon Scaling

    Draco Benchmark — a sibling capability benchmark (quality of agentic research reports vs. the task…

Related articles
  • Deep Research Agents

    Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…

  • LLM-as-a-Judge

    Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…

  • LLM-Judge Validation

    UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…

  • Production-Sourced Evaluation

    Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…

  • Agent Quality Flywheel

    Google's eval-fix loop packaged as a skill your coding agent drives: Build & Test → Ship & Monitor → Learn & Refine, ex…