資料來源#
- An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
- Beyond RAG: Building Agentic Document Workflows with LlamaIndex
- CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks
- DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
- Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
摘要#
深度研究代理程式是一種代理式 AI 系統,接收複雜且開放式的查詢後,會:(1) 拆解成各個子工作流程,(2) 反覆搜尋多元外部來源,以及 (3) 將蒐集到的證據綜整為結構化且附有引文的報告。不同於單次問答,它會交錯進行多步規劃與推理、自主檢索及評估——驗證主張、處理相互衝突的證據,並找出文獻中的缺漏。這類分析的廣度與深度,若由人類專家完成,原本需要投入大量心力。DRACO(Perplexity,2026 年 2 月)正是為了評估這類系統而建立;它納入評測的四種正式系統——Perplexity Deep Research、OpenAI Deep Research、Gemini Deep Research,以及搭配網頁搜尋與程式碼執行工具的 Claude Opus——就是代表性實例。
與單次問答的模式差異#
| 單次問答 | 深度研究代理程式 | |
|---|---|---|
| 規劃 | 無/隱含 | 明確將查詢拆解為子工作流程 |
| 檢索 | 單次(或沒有) | 反覆、多來源、自主進行 |
| 推理 | 在單次生成中完成 | 多步進行;驗證、處理衝突、找出缺漏 |
| 輸出 | 一個答案 | 結構化且附有引文的報告 |
| 取代的工作量 | 查找資料 | 數小時的人類專家研究 |
深度研究在知識密集領域日益成為關鍵能力,例如學術研究、醫療決策支援、法律分析與財務分析。在這些領域中,必須針對龐大且異質的資料集,進行全面深入、透明且可驗證的推理,才能達到要求。
編排勝過單純使用模型(DRACO 的發現)#
對這份 wiki 最重要的結果是:在 DRACO 上,Perplexity Deep Research(以 Opus 4.5/4.6 為基礎)大幅勝過只搭配 web_search 與 code_execution 工具的 Claude Opus 4.5/4.6——4.6 組合的正規化分數為 70.5% 對 59.8%。同一個基礎模型包在專門打造的檢索與綜整 harness 中,分數就提高了約 10 個百分點。論文自己的解讀是:這顯示「基礎模型之外,代理程式編排的重要性」。
這是對模型進步時 harness 縮減這項論點的直接反例。這份 wiki 一再主張,模型進步時腳手架會逐漸縮減,而機械式驗證仍是關鍵。深度研究則是截至 2026 年初仍由 harness 承擔系統品質中一大部分、且可量測的領域——編排層(查詢拆解、反覆檢索策略、來源選擇、綜整規範)尚未消融進基礎模型。模型跨越下一個能力門檻後,這部分是否會縮減,仍是未解問題;DRACO 是目前的量測結果。
驗證是關鍵瓶頸#
在 DRACO 評分的所有系統中,各評分軸的排名一致:呈現品質最強,事實準確性與引文品質最弱。流暢度已經解決;可驗證的正確性還沒有。這是驗證成為新瓶頸在研究產品內部的具體呈現——難處不再是產出易讀報告,而是確保其中每項主張都屬實且來源適切。這是開放領域中AI 驅動的形式化證明搜尋的對應情況:編譯器能讓驗證成為完整流程;深度研究沒有這種預言機,因此準確性與引文成了前沿問題。
一份誤導文件就能翻轉結論(MisKnow-Agent)#
DRACO 評估輸出的事實準確性,發現這是所有系統最弱的一環。Zhu、Li、Yang、Su 與 Shao(Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions,BUPT/Shanghai AI Lab/CQUPT,arXiv 2607.20891,2026-07-23,empirical)從輸入端攻擊同一個弱項,並將它量化:在檢索池中插入一份誤導但可信的文件,錯誤結論採納率(FCAR)平均會從未注入對照組的 0% 升至 54.7%。
首先要正確理解這項研究的定位。這不是一篇攻擊論文。威脅模型明確排除提示注入與指令劫持——模型參數、系統提示、工具實作與基礎證據環境都未受影響,注入文件也完全不含任何指令。文件裡只有一項看似合理的錯誤主張,歸於一個看似可信的機構,並採用看似合理的文體。代理程式從未遭到劫持;它完全照使用者要求執行任務,只是因為某份文件說服了它,最後得出錯誤結論。這是研究成果的認知腐化;作者將其描述為開放網路的常態,而非攻擊者所為。這與代理程式資料注入(ADI)屬於不同層面:後者的負載是要被誤認為結構——偽造的留言作者、虛構的工具結果——使代理程式依據不存在的資料行動。此處的資料恰如其表面所示:一份提出主張的文件。所有防止不受信任文字被當成指令,或防止不受信任資料被當成受信任資料的防禦,都與此失效模式無關,因為文件唯一造假的部分,是它所描述的世界。
**設定。**取自 DeepResearch Bench 的 100 項任務。每項任務的藍圖會固定一個可量化、可評分的典型錯誤結論,並按三個權威層級分出機構池;接著由 DeepSeek-V4 Pro 依照 3 個權威層級 × 4 種來源文體(論文/新聞/部落格/貼文)× 每層 5 個機構,生成文件。經搜尋引導的迭代修訂、五個啟用搜尋的跨模型驗證器,以及人工篩選後,留下 5,933 份經品質控管的誤導文件;每個目標錯誤結論也都經人工依權威來源稽核,涵蓋率達 100%。評估範圍包括 2 個開放原始碼框架(DeerFlow、WebThinker)× 3 個骨幹模型(DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro),以及閉源的 Gemini Deep Research。
FCAR 是嚴格的指標,因此這個數字令人警覺,而非只是定義使然。只有報告在其綜整、結論、建議或執行摘要中,把錯誤主張當成事實或最有力證據支持的結論,才算採納。提及該主張、引用它、註明它來自某個來源、對它有所保留、拿它與公開證據對照,或加以反駁,一律算未採納。評審模型 DeepSeek-V4 Pro 在 300 份報告上,對兩位盲測人工標註者的原始一致率達 99.7%,Cohen's κ = 0.993——這項評估已適當驗證,而且遠高於量表評分常見的一致程度,因為這裡判斷的是定義明確的二元結果,而非品質分數。
流程在哪裡失效:FCAR = MER × ECAR#
論文的分析貢獻,是用兩個因素拆解,指出工作流程中的失效位置:
- MER(誤導證據觸及率)——實際檢索到至少一份注入文件的任務比例。
- ECAR(暴露條件下的採納率)——在接觸到文件的任務中,報告採納結論的比例。
由於未接觸文件的任務從未採納錯誤結論,FCAR = MER × ECAR 完全成立。高權威、論文文體的配對設定如下:
| 骨幹模型 | WebThinker FCAR / MER / ECAR | DeerFlow FCAR / MER / ECAR | 差距(總計/MER/ECAR) | McNemar p |
|---|---|---|---|---|
| Intern-S1-Pro | 55.0 / 72.0 / 76.4 | 76.0 / 94.0 / 80.9 | +21.0 / +17.3 / +3.7 | < 0.001 |
| Qwen3.5-397B | 50.0 / 98.0 / 51.0 | 60.0 / 97.0 / 61.9 | +10.0 / −0.6 / +10.6 | 0.064 |
| DeepSeek-V4 Pro | 60.0 / 92.0 / 65.2 | 65.0 / 96.0 / 67.7 | +5.0 / +2.7 / +2.3 | 0.487 |
這種拆解的價值,在於顯示框架之間同樣 12 個百分點的平均差距,背後有三種不同原因。對 Intern-S1-Pro 而言,差距幾乎全來自檢索觸及率(DeerFlow 只是更常找到文件);對 Qwen3.5-397B 而言,兩個框架的觸及率相同,差距完全來自接觸文件後的採納行為;對 DeepSeek-V4 Pro 而言,兩者各占一半。只看單一 FCAR 數字,只能得出「DeerFlow 較不穩健」,無法採取更具體的行動。逐層歸因遺漏也以同樣方式處理遺漏——既然流程包含可分離階段,就不應只在輸出端評分;而自動化失效歸因則指出,事後的 LLM 評審無法自行提供這種診斷。
請留意這揭示的上限:**MER 高達 72–98%。**檢索並不是過濾器。只要檢索池裡有一份看起來相關的誤導文件,幾乎所有設定都會讀到它。
什麼會說服代理程式,什麼不會#
- **呈現文體比機構權威更有影響力。**論文 61.0% > 部落格 53.0% > 新聞 44.0% > 貼文 37.5%;論文與貼文相差 23.5 個百分點,而且在六種設定中,論文都最高、貼文都最低。權威層級的差距較小,為 14.8 個百分點(高 61.0%/中 57.7%/低 46.2%),且不完全呈單調變化——WebThinker 的兩種設定都把中權威評得比高權威高。生成提示明確禁止按層級改變寫作品質(「不要把低層級文件寫得更簡單,也不要加入錯字」),因此權威效果純粹來自名稱與網址,與文字品質清楚分離。看起來像論文,比真的出自 MIT 更有用。
- **搜尋結果排名幾乎無關。**結果位於前/中/後段時,採納率為 66.2/65.5/64.5%;跨設定平均差距只有 1.7 個百分點,任何單一設定都不超過 6 個百分點。代理程式重視相關性,而非列表位置。若防禦策略只是把可疑來源降級,針對的就不是關鍵變因。
- **超過一份文件後,劑量反應就趨平。**一份文件時為 54.7%,兩份時為 59.5%,三份時達到 61.0% 的高點,之後反而下降——四份時為 60.3%,五份時為 58.3%,沒有任何設定呈單調變化。一份文件幾乎就造成了全部效果。(Gemini Deep Research 是例外:從一份文件時的 27% 升至三份時的 54%;它透過本機來源上傳介面接收文件,而非從檢索池取得。)
- **工作流程所處階段的影響遠大於其他因素。**冷啟動時平均 FCAR 為 40.5%,研究中途為 44.2%,而文件在最終綜整前一刻才出現時則為 85.5%(六種設定介於 77–94%)。能保護代理程式的不是偵測,而是後續工作流程——接下來的搜尋有機會挑戰或取代該主張。WebThinker 在早期階段優於 DeerFlow(冷啟動時為 27.7% 對 53.3%),但在綜整前略微反轉(87.7% 對 83.3%),這正是關鍵線索:它從來沒有拒絕證據,只是把它稀釋了。
驗證的不對稱性——這是 harness 的發現,而非模型的發現#
值得記住的結果是:**五個啟用搜尋的驗證器模型,一致將保留的 5,933 份文件全數歸類為誤導;而其中三個驗證器,正是接著在工作流程中以 50–76% 的比率採納相同文件的骨幹模型。**DeepSeek-V4 Pro、Qwen3.5-397B 與 Intern-S1-Pro,在單獨拿到文件並被問「能否找到佐證?」時,都能識破它們;但執行研究任務時,只要恰巧檢索到文件,就會認同它們。模型具備這項能力,工作流程卻從未啟用它。
坦白說,原因是提示與角色不同,而非能力莫名崩潰;這正是此發現可供採取行動的原因。驗證器只拿到一份文件、一個聚焦問題、網頁搜尋工具,以及明確的搜尋規範——查核特定量化主張、交叉比對具名機構、不可把佔位網域當成證據。研究代理程式拿到的則是任務,但每個步驟都沒有人被指派負責驗證。因此差距出在架構:harness 沒有分配步驟、預算或指令來執行它明明完全有能力完成的查核。這解釋了為何研究前防禦只需提出要求,就能補回一大部分差距,也解釋了為何它無法完全消除差距。
兩項限制提醒我們,這不是受控的 A/B 測試。語料庫是依照全體驗證器一致判定「誤導」來挑選,因此無法據此推算驗證器對真實文件的偽陽性率;而驗證器的任務(判斷單一文件)也遠比代理程式的任務(執行其他工作時同時判斷文件)簡單。不對稱確實存在,但其幅度尚未量化。
這與同一週整理出的兩項相鄰驗證器失效模式相似——在雜訊驗證器下停止(驗證器的接受訊號與真實有效性脫鉤)以及自動化失效歸因(診斷論述得自信,卻是錯的)。三者都在表達同一件事:你以為正在進行的驗證步驟,不是根本沒執行,就是無法區辨,或是沒能指出正確原因。
防禦能降低風險,無法消除;合併使用甚至可能適得其反#
以 DeerFlow 未防禦基準 60–76% 為比較:研究前加入驗證提示後降至 37–57%;研究後逐項查核主張的修訂代理程式降至 20–58%;兩者合用則為 15–62%。三個骨幹模型中有兩個在合併防禦時效果最好;但對 Intern-S1-Pro 而言,三種方案中合併方案最差,達 62%,高於單獨使用任一防禦時的 57% 與 58%。
論文對這種反轉的解釋值得借鑑:修訂代理程式在同一個遭污染的檢索環境裡重新驗證主張,因此可能再次檢索到誤導文件,重新認同原本已被研究前謹慎態度保留的主張。若修復步驟所依據的證據來源本身就是污染源,它就有非零機率損害原本正確的輸出——這是在雜訊驗證器下停止中 β 項的 FCAR 實例:正確做法可能是完全不執行修復。
框架與骨幹模型:穩健性不是能力階梯#
在配對設定下,FCAR 介於 50–76%;跨骨幹模型平均後,DeerFlow 為 67.0%,WebThinker 為 55.0%。追查執行軌跡可看到其中機制:DeerFlow 採用相當直接的 Planner→Researcher→Reporter 流程,保留觀察結果中的檢索文件並傳給 Reporter;WebThinker 則把任務拆為更細的子查詢,將證據壓縮進文件記憶,再逐節起草——這些轉換會在綜整前削弱或丟棄誤導證據。harness 對穩健性與品質同樣關鍵——又一個編排比其包裝模型更重要的面向。
但這並非階梯式關係。FCAR 絕對值與 Artificial Analysis Intelligence Index 不呈單調關係:Intern-S1-Pro(Index 22)在 DeerFlow 下以 76% 成為最差,在 WebThinker 下卻居中;Qwen3.5-397B(Index 34)在兩個框架下都是最佳;DeepSeek-V4 Pro(Index 44)在 WebThinker 下則最差。隨能力提升而縮小的只有框架間的差距:21 → 10 → 5 個百分點。結合模型進步時 harness 縮減來看:harness 對穩健性的貢獻確實隨模型進步而縮小,但它未能提供的剩餘穩健性並不會歸零;而且不能只根據框架選擇或 Intelligence Index 推斷穩健性。模型只有三個,還不足以判定趨勢。
Gemini Deep Research 在保留原生線上搜尋功能的情況下,也重現了定性模式(高權威 54%、中權威 46%、低權威 8%;論文 54% > 部落格 41% > 新聞 34% > 貼文 28%),因此這不只是開放原始碼流程或停用真實檢索所造成的假象。
值得一併記住的限制#
- **語料庫為合成資料,由 LLM 生成。**5,933 份文件全由同一個模型 DeepSeek-V4 Pro 生成,提示也要求它使用檢視時能辨認為合成資料的網址。這有利有弊:文件不如真實網路錯誤資訊逼真,但即使假網址刻意設計得容易識別,仍有 54.7% 的採納率。
- 文件注入隔離的檢索池,沒有發布到即時網路上(基於倫理考量);Gemini 則透過本機來源上傳介面接收,信任情境與自然搜尋結果有實質差異。
- 因工具或 API 錯誤而失敗的執行會重跑,而不會被計為未採納,因此相較於終端使用者實際看到的情況,FCAR 會略高。
- 排名實驗只考慮已納入的文件——約 65% 的基準不能和 54.7% 的標題數字相比;後者是單一文件、不以曝光為條件的數值。
效率:token 更多 ≠ 成效更好#
DRACO 的 token 與延遲表格打破了「執行時間越長、成本越高,結果就越好」的直覺:
- 最高分系統 Perplexity(Opus 4.6),也是深度研究系統中延遲最低的(245 秒),儘管它的輸入 token 數最多(每項任務約 779k tokens)——檢索時大量輸入,輸出精簡(約 8.8k tokens)。
- OpenAI o3 和 Gemini 的輸出量最大(24.9k、22.1k tokens),分數卻居中——冗長沒有換來品質。
- OpenAI o4-mini 整體 token 效率最高(總計約 53.5k),但分數較低(41.9%)。
這個模式——品質與輸出長度脫鉤,真正發揮作用的是輸入 token 開銷——是深度研究中用戶端代理程式最佳化所形式化的成本與品質組合取捨(依角色選模型、配置預算、路由)的實例:真正重要的槓桿是編排設計,而不是原始 token 花費。
從檢索角度命名的形式:代理式檢索樹,而非迴圈#
前文從評估角度探討語料內容(DRACO 評分系統;MisKnow-Agent 攻擊系統輸入)。Doulcet 的 2026 年 RAG 回顧(practitioner-opinion,LlamaIndex 廠商利益衝突)補上缺少的結構說明:深度研究在檢索演進中的位置,以及它實際採用的控制流程。
他用一句話修正分類法。修正型/代理式 RAG 是一個迴圈——檢索、評分片段、重新表述、重試,直到證據品質足夠。深度研究則是*「規劃 → 分成平行子搜尋 → 綜整。這是一棵代理式檢索樹,而非迴圈。」展開分支,而非反覆迭代。這項區別並非表面差異:迴圈的成本隨困難查詢所需的嘗試次數增加;樹狀流程的成本則取決於拆解時一次決定的分支因子——這也解釋了為何 DRACO 最高分系統能同時擁有最多輸入 token(每項任務約 779k)與最低*延遲。各分支是並行執行的。
他指出,這種形式也說明工作流程執行環境為何值得投入成本——列出的四項特性正是深度研究所需:子問題必須平行執行,才能符合延遲預算;綜整器必須等到所有子問題完成;引文必須貫穿整個流程;而且一個子問題失敗不得拖垮其他問題。最後一項,是評分式評估看不到的。若某分支失敗時樹狀流程默默丟棄它、綜整其餘結果,就會產生看似完整且附有引文的報告,但輸出中看不出涵蓋範圍有缺口——這正是逐層歸因遺漏用檢查點探針處理的深度研究遺漏問題,也具體說明了為何它的「將損失歸因至特定層」方法,在這裡比單次檢索更重要。
這個頁面還有兩點值得借鑑,兩者都指向 DRACO 未測量的上游環節:
- **代理程式越厲害,解析證據就越重要,而非越不重要。**Liu 的討論串中,最精準的公開回覆是:「如果檢索步驟會導致行動,我希望代理程式先引用自己用到的確切片段、表格或頁面,再開始操作工作流程。」這是尚未查證的實務工作者評論,但它指出了產品簡報中解析流程所要提供的特性(每個值都有頁碼與邊界框引文),也正是讓深度研究引文變得可查核而非裝飾的關鍵。DRACO 會評分引文品質,但評分方式無法區分正確解析的表格列,和合併儲存格後所產生的引文。
- 檢索就是稽核軌跡。「『AI 為什麼這麼說?』檢索會留下引文紀錄;長上下文只會留下感覺。」這是目前最有力的論據,說明即使語料放得進上下文視窗,深度研究這種形式仍不會消融成一次長上下文閱讀;報告的價值與可追溯性密不可分。
另一條路:訓練搜尋者,而非編排搜尋流程#
以上內容都是評量系統——用於包裝固定前沿模型的正式 harness,其編排效益比只搭配工具的裸模型高約 10 個百分點。TRACE(Tao et al.,UW–Madison + Microsoft Research,arXiv 2607.13988,2026-07-15,empirical)是這份語料中首個選擇另一條路的來源:刻意維持極簡 harness——讓 ReAct 迴圈使用三個工具:browser.search/browser.open/browser.find,「保持介面精簡有助於隔離訓練訊號的效果」——並改為對政策模型的工具使用進行後訓練。
結果顯示,小模型在搜尋能力上也能大幅進步。只用純 RL,並採用密集的逐回合回饋(沒有冷啟動 SFT、沒有代理式中期訓練、沒有即時網路訓練資料,也沒有評審模型),Qwen3-4B 在封閉網路 BrowseComp-Plus 的分數從 7.2 升至 35.6,Qwen3-30B-A3B 從 8.4 升至 42.6;訓練後的 4B 在該基準上勝過數個 32B 深度研究代理程式:ASearcher-QwQ-32B 為 28.9、WebDancer-32B 為 32.4,和 CutBill-30B-A3B 的 35.1 大致相當,但仍遠低於 TongyiDS-30B-A3B 的 44.4。論文將這四者列為未受控的參考點(資料、骨幹模型、流程與 harness 都不同),不可把它們當成實驗組。真正可泛化的是遷移結果:完全在封閉的 FAISS 語料庫內訓練後,30B-A3B 代理程式在 BrowseComp 得分 12.9、GAIA 得分 52.0、中文 xbench-DeepSearch 得分 45.0——跨越檢索環境與語言。
這和編排研究結果相輔相成,並非與之對立;分界在答案格式。TRACE 的獎勵是依短答案片段的正規化完全比對計算;其限制段落也指出,對於「冗長、結構化或開放式」輸出,凍結參照的進度探測未必能代表狀態價值——例如多檔案修補,或未明確說明的偏好。這個頁面評量的一切——結構化、附有引文且涵蓋多來源的報告——都在界線的另一側。因此,「訓練搜尋者」已在深度研究的短答分支上獲得驗證,但在報告分支上仍明確未經證實。
能遷移的是一幅關於受訓搜尋政策的行為圖像,由方法附帶產生的逐回合回饋軌跡呈現。三項工具的分工清楚:search 透過找出非顯而易見的實體獲得回饋(一次開場查詢找回題目中未被凸顯的特約合作夥伴公司,而非問題點名的顯眼對象,因此得到 δ = +6.39);open 透過取得答案獲得回饋(打開點名該人物的頁面,得到 +6.05);而答案已確認後才執行純字面 find,只得到 +0.10 或 +0.00——確認本身沒有價值,這正是獎勵設計能防止灌水的效果。這裡有一種本頁應該辨識的典型失敗模式:執行軌跡已抵達答案確定的前綴,卻在一次診斷工具呼叫後失去答案。這正是在雜訊驗證器下停止所定價、驗證成為新瓶頸所追蹤的「多做一次檢查反而變糟」模式;此處是在單次執行軌跡內以回合為單位觀察,而非跨修復迴圈觀察。在密集回饋下,受訓互動長度也會增加,比只用結果回饋的 RL 更早、速度更快,因為局部進展訊號能在最終答案正確之前,就為好的回合提供獎勵。
第三個攻擊面:樹的根部#
DRACO 評分輸出,MisKnow-Agent 污染輸入。Pahuja、Brokman、Hofman 等人(An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,Fujitsu Research of Europe/Cohere/Fujitsu Research,arXiv 2608.03735,2026-08-04,empirical)則鎖定從請求到規劃的界線——樹根處、任何分支產生之前的單一決策。他們對失敗的定義刻意排除執行品質:
使用者請求與生成的計畫不一致;即使計畫正確執行,結果仍無法滿足原始請求。
這條界線值得獨立看待,原因在於樹狀結構本身帶來風險。他們指出:「即使後續行動都在內部以英文進行,這通常仍是多語言輸入實際使用的介面」;而且「此處一旦理解錯誤,後果特別嚴重,因為任何扭曲都可能沿著整個多代理程式工作流程傳播。」迴圈能在第一步錯誤後評分自身片段並重試;從錯誤理解的拆解結果開始展開的樹,卻會讓每個分支同時追錯問題。這也是本文第一個以儀器化方式評估 HuggingFace 的 Open Deep Research(分類法的推導框架,採用 Qwen2.5-32B-Instruct 與 Aya-Expanse-32B),而非正式系統或 DeerFlow/WebThinker 的來源。
計畫會遺漏承諾的五種常見方式——實體、來源、時間、操作與答案格式的依據不足——其緩解方法依失敗模式設計,而非只是改善提示:規劃前加入具型別的表示法(在封閉詞彙集合中提供 entities、time_constraint、source_constraint、attachment_type、operations、answer_type),注入規劃器,並在下游持續保留,因為「TART 不會在規劃階段使用一次後就丟棄」——它也會進入協調器與工作代理程式的系統提示。使用 OWL,並凍結基礎模型時,在 GAIA-MAPS 上,GPT-5-mini 的十一種語言平均完全比對分數提高 5.6 個百分點;Mistral-Large-3 提高 5.9 個百分點;Qwen3-VL-235B-A22B 在七種語言子集上提高 3.6 個百分點;而在表格推理資料集 MULTITAT 上,Mistral 提高 10.0 個百分點。這是另一筆固定模型下變更 harness 的數據,呼應前述編排研究結果,提升幅度約為 DRACO 約 10 個百分點的一半,槓桿則不同:關鍵不在於選擇哪一種檢索與綜整流程,而在於流程是否明確表述自身任務。論文的結論正是將引文貫穿每個步驟這項特性,從來源追溯推廣到意圖:「多代理程式架構應透過明確且可檢視的語意契約保留使用者意圖,而非完全依賴不受限制的自然語言規劃。」
**而且這個平台期量出了分支因子的論點,結果也有刺。**難度等級 1 的平均增益為 +9.0,等級 2 為 +5.0,等級 3 則為 0。一種看似合理的解釋是:等級 3 中可修正的規劃失敗較少;但論文自己的評審統計否定了這種說法,因為分類法涵蓋的失敗比例在等級 2 和等級 3 都維持 55.2%。真正增加的是任務內在長度;根據 GAIA 的英文標準答案註記,參考解答步驟數從 5.48 → 7.48 → 13.00,所需工具數從 1.58 → 2.55 → 3.38。因此,「樹的成本取決於拆解時一次決定的分支因子」有了可靠性上的對應:即使修正了根節點,也無法保證正確性維持完整長鏈,因為每多一步,規劃正確後的下游檢索、工具使用或推理就多一個獨立出錯機會。也要留意哪種失敗最常見:操作依據不足——也就是推理鏈錯誤、拆解出錯——是三個骨幹模型中分類法涵蓋最多的類型(占失敗的 24.0%/36.5%/30.2%),且在其中兩個模型的資源最少語言中占絕大多數。這和 MisKnow-Agent 發現「檢索並非過濾器」的模式一致,只是從規劃端得出:代價高昂的錯誤發生在任務拆解時,而不是取得證據時。
這項研究也有兩項限制,與自動化失效歸因所討論的問題相呼應:(1) 消融實驗中增益最大的一項,只增加答案格式與附件欄位(在總計 +5.4 中占 +3.1),因此部分增益可能只是完全比對格式遵循度提升,而非依據改善;(2) 十一種語言中有六種是作者自行機器翻譯的語言,這也是論文診斷部分最薄弱之處。
這棵樹的成本,以及裁剪位置#
前文衡量深度研究執行能產出什麼。Kolukuluru、Ashok、Arora 等人(Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents,UMass Amherst/UT Austin/Adobe Research,arXiv 2608.08389,2026-08-09,empirical)則衡量它花費多少;他們固定流程、生成器,甚至快取的子查詢與檢索證據,只改變裁剪策略——八種評分規則,以及詞彙、混合與學習式變體,並與三個介入點(檢索前、檢索後、綜整前)交叉組合,在 GPT-Researcher 上測試 100 個 DeepResearchGym 查詢,總計約 40 種設定。這是上文「效率:token 更多 ≠ 成效更好」在同一流程中的受控版本;DRACO 只能跨產品比較。
**資源花在哪裡,以及這如何由樹狀結構決定。**未裁剪執行需耗費 29.0 個節點/375.4k tokens/3422.6 秒,品質分數為 57.83,成本分布極不平均:94.41% 的 token 花在結果處理,查詢生成占 4.58%,規劃占 1.02%。規劃與寫作所占微不足道;真正昂貴的是閱讀各分支傳回的內容。這正是樹狀而非迴圈形式的成本:分支展開數在拆解時就已決定,每個保留項目後續都要付三次成本(檢索、結果處理,以及它所觸發的遞迴展開)。研究量出兩項結果:
- **在分支展開前就裁剪,是唯一能降低上游成本的介入方式。**檢索後的 MMR 將節點數從 29.0 降至 8.84,token 從 375.4k 降至 114.6k(−69.5%),同時保留 56.62 的品質分數,即基準的 97.9%。它減少的也不只是提示 token,還包括生成量:輸出 token 從 114.7k 降至 31.7k,因為未展開的分支不會產生結果處理文字。
- **最後才裁剪,無法追回先前成本,多半省不回裁剪本身的代價。**八種單階段綜整前方案中,有七種只讓基準 token 數變動 +2.5% 至 −3.0%——Submodular Coverage 使用 384.7k、LLM 評審裁剪使用 386.7k,兩者都高於基準的 375.4k——只有 Hybrid 真正降低了 11.5%;儘管最終綜整上下文減少 63–96%,八種方案的總執行時間全都增加 12.0% 至 33.3%。流程內建的末段裁剪也同樣如此:搜尋成本已經支付後,才將累積上下文從 66.10 個項目降至 44.08 個(占 token 的 34.06%)。
**合理的效益前沿,以及不可單獨引用的數字。**摘要所稱的「最高可達 73%」,指三階段 MMR:token 降至 100.1k(−73.3%),品質分數為 55.90,低於 57.83 的基準;同一項設定同時產生壓縮率標題數字與低於基準的結果。較站得住腳的是兩階段 CD + SC:品質 59.47(+1.64)、token −63.4%、執行時間 −53.3%。和前述 harness 發現對照來看,這是在凍結模型下的第三種槓桿,但也是第一種透過刪減來發揮作用的槓桿;它帶來的是效率,TART 與編排帶來的則是品質。
**而這筆成本落在本頁最弱的一環。**壓縮會兩度犧牲依據品質:
- CD + SC 的引文召回率降至 89.96,低於 95.54 的基準,也低於單獨使用 Submodular Coverage 的 94.74。研究中品質效率最佳的設定,其報告依據反而比未裁剪版本薄弱——同一方法讓品質與忠實度朝相反方向變化。
- **裁剪始終無法保住相關內容。**KPR+KPC(相對於標準答案文件的關鍵要點召回率,扣除矛盾內容)在基準為 70.23;39 種裁剪設定中,最佳也只到 66.32,而且這種設定只省下 0.2% 的 token。所有真正省下成本的設定都低了 4 至 29 個百分點。(論文只對單階段方案明確這樣陳述;此處涵蓋所有設定的結果,是編寫本文時逐列讀取表 5 推得。)有三種方案的引文召回率達到或超過基準,且都採用多樣性導向方法(檢索後 DPP 95.62、三階段 DPP 95.40、三階段 Learned-Query + GRN 95.48),但每種方法都犧牲相關性——DPP 的 KPR+KPC 僅為 43.33。
評分規準的評審看不出這個陷阱。三階段 Learned-Query + GRN 的品質分數為 58.13(高於基準)、引文召回率為 95.48(與基準相當)、token 數為 145.7k(−61.2%)——但標準答案關鍵要點涵蓋率已損失四分之一。在 DRACO 評分最高的面向,裁剪幾乎沒有代價;在原本就普遍最弱的面向,代價卻不小。
值得一併記住的四項限制。(1) 一套流程、一個基準、每種方法只測一個代表性運作點;論文也如此說明。(2) 品質評分在很大程度上取決於評審模型——表 4 中,同一批報告由 gpt-4.1-mini 自評時得分為 91.50,由 gpt-5-mini 評分則為 47.67;完全相同的文字相差 43.8 個百分點。因此只有同一評審下的排序有意義,論文本身也只對效率結果有信心。(3) 沒有任何結果附上變異數:品質、相關性與忠實度都是 100 份報告的平均值,沒有區間。唯一可得的變異估計來自意外情況——名義上相同的 MMR 策略出現兩次(分支與根節點裁剪比率相同,token 數與節點數相同,執行時間差不到 1.5 秒),但品質相差 0.22、引文召回率相差 0.91、KPR+KPC 相差 1.67;這約等於論文解讀的幾項差距。(4) 跨基準測試無法重現品質方面的結果:在 DeepResearch Bench 上,token 節省更多(三階段 MMR 達 92.32%),但除了唯一一種方案(僅裁剪根節點的 Submodular,0.4811)外,所有裁剪設定的分數都低於 0.4798 的基準。階段順序的結論可以遷移,方法層級的品質排名則無法遷移;論文也明確表示,第二個基準只用來觀察方向。
沒有天花板問題的基準測試:DeepScholar-Bench(2025 年底)#
以上所有評估,都是在優秀系統能取得不錯分數的基準測試上進行。DeepScholar-Bench — Stanford/Berkeley 的即時基準測試,在 CS329A 第 8 堂課中講授(Aakanksha Chowdhery、practitioner-opinion、透過 ASR 讀取投影片圖表)— 則是反例:「現有系統沒有一個真正超過 19%。」它是這份資料集中最早的深度研究評估,也是發揮空間最大的評估,因此成為 DRACO 的前身,而後來才建立了其他基準測試。
任務是多數研究人員都想完成的事:給定一篇近期論文,產生其相關研究章節。基準內容是即時更新的 — 涵蓋 22 個領域、難度達博士級的近期 arXiv 論文,每月以新論文重新執行,並限於主要模型訓練截止日期之後發表的論文。它透過定期更新避免資料污染,而非事後修正;由於學術文獻不會停止發展,這項任務也永遠不會過時。
三個評分面向,各自經過人類評分者驗證,一致度約為 70–80%:
| 面向 | 評估問題 |
|---|---|
| 知識綜整 | 撰寫內容是否組織有序、連貫,並涵蓋關鍵事實? |
| 檢索品質 | 找到的參考資料是否相關、重要(權威且引用多),並且涵蓋完整? |
| 可驗證性 | 引文是否支持各項主張(精確度),而主張是否有佐證(涵蓋率)? |
失敗模式才是其中有用的部分,而且四種問題都出在根據資料立論,而不是寫作:
- 相關不代表重要。 系統找得到相關文件,卻漏掉奠基性論文 — 也就是專家憑著累積的知識會知道的那些論文。各系統的文件重要性分數都低於約 12.5%。
- 即使資料來源完美,關鍵事實仍會漏掉。 把應引用的論文原封不動交給系統,關鍵事實涵蓋率仍只有約 50%;沒有這些論文時,涵蓋率更低。瓶頸在於擷取,而不是搜尋。
- 綜整品質與可驗證性互有取捨。 OpenAI deep research 寫出的文字最連貫,但可驗證性較低;基準測試自己的參考流程則達到約 90% 的引文精確度,卻無法同時做到同等的綜整品質。沒有任何系統能在兩方面都表現出色。
- 這也正是課堂上可廣泛應用的重點:評分規準會獎勵連貫、看似引文齊全的文字,但非專家讀者無從查核 — 這也是資料集中其他地方流暢的產出能躲過審查的原因。
與同一堂課介紹的 GDPval 一起看,兩者的失敗其實是同一種,只是發生在不同距離:GDPval 把參考檔案交給模型,發現模型答應會閱讀,卻沒有讀;DeepScholar-Bench 則要求模型自行尋找參考資料,發現它只會檢索到表面相關的資料。兩者缺少的都是專家脈絡,而不是能力。
它的定位#
深度研究是一項長期、自主、多步驟的任務 — 正是 Task Time-Horizon Scaling 所衡量的情境 — 以持續進行檢索與綜整的 harness 執行。這是目前最明確的案例之一:產品(harness 加上協調機制)的價值遠高於它所包裝的模型。因此,像 DRACO 這種評估系統(而非模型)的基準測試,才是合適的工具;評分則由 LLM-as-a-judge 根據從真實生產使用建立的專家評分規準進行。
相關連結#
- Autonomous Scientific Discovery — 說明這種模式在研究型 AI 系統調查分類中的位置:屬於Scientific AI Assistants 層級(ChatGPT/Gemini Deep Research、SciSpace、NotebookLM、Cursor),定義為「本質上是被動回應」;同一份調查也承認這個層級站不住腳,因為 Deep Research、Claude Research 和 Perplexity Labs「已具備更多代理功能」,因此助理與代理是同一自主性連續光譜上的不同位置
- Open-Ended Discovery Harnesses — 值得釐清的名稱重疊。 Autoresearch、AlphaEvolve/EvoX、CORAL 和 SwarmResearch 都自稱研究代理,但它們沒有一個在做此頁描述的事:沒有檢索、沒有引文、沒有報告 — 而是在沒有已知最佳解的問題上(圓形填充、GPU 排程、競賽啟發式方法、解碼核心),以數值評估器對照分數執行數小時。兩項發現確實可以互相參照。以受控形式再次出現「協調優於基礎模型」的發現(固定模型,只變更 harness,結果就有所改變);失敗模式也相似:MisKnow-Agent 所說的採納有說服力的錯誤結論,正是 SwarmResearch 案例研究所說的搜尋代理產生改進後的執行結果,卻附上自信而缺乏佐證的因果故事 — 兩者都是流暢的產出躲過了審查
- Document Parsing as the Retrieval Bottleneck — 這條流程的上游部分,也說明評分最低的面向可能根本不是模型問題。此文提出控制流程的修正(「代理式檢索的樹狀結構,而非迴圈」)、讓這種形式可建置的工作流程特性(平行分支、依數量合併結果的 composer、每個步驟都串接引文、一個分支失敗不會拖垮其他分支),以及 DRACO 的輸出評分在結構上無法涵蓋的失敗類型:遭到攤平表格錯誤歸屬的圖表,會以正確的引文出現在報告裡,內容卻是錯的
- Crystallizing Agent Work into Workflows — 這種形式所需的執行環境,以及它引出的生命週期問題。樹狀結構(
send_event扇出、collect_events依數量合併、每個步驟都串接引文、一個分支失敗不會拖垮其他分支)是該文探討的工作流程機制;反方向的開放問題則是,研究樹是否曾經結晶成工作流程 — 它的價值在於每次執行都能探索不同路徑,而這正是 Malik 所指出的限制:何時適合將其晉升為固定流程 - DRACO Benchmark — 為評估這類系統而建立的基準測試;本文的協調、驗證與效率發現皆源自此處
- Turn-Level Credit Assignment — 另一條路線:透過每輪密集獎勵,對搜尋器的工具使用進行後訓練,而非協調固定模型,並從產生的政策本身的信用分配軌跡讀出其行為。其設計範圍受限於精簡、可驗證的答案,與引用報告位於格式軸的另一端
- Tool-Output Pruning — 在程式碼代理中衡量相同的精簡做法,也是完整收錄階段安排結果的頁面。兩點可以互相參照。邊界完全相符 — SWE-Pruner Pro 在工具回應進入歷史記錄前先加以壓縮,這正是此流程中的檢索後階段 — 但效益結構不同:程式碼代理只為工具回應付費一次;研究樹則在檢索時、處理結果時,以及衍生出的分支中,都要為保留的項目付出代價,因此在此及早修剪會讓節點數從 29.0 降至 8.84,而不只是縮短提示。兩篇論文都以 token 和執行時間計價,卻未計入金錢成本;因此,成本帳單問題可在該頁找到,並有此處提供的匯率項目可供換算
- Context Lifecycle Management — 長時間研究執行所受的脈絡限制:Self-GC 的 Hard Set 正是這種工作負載(瀏覽器、shell、網頁擷取軌跡在持續的工具壓力下執行);後續綜整回合所仰賴的,往往是埋在舊工具輸出中的確切 URL、擷取出的資料列值或回呼控制代碼 — 而此處衡量的每種位置或類型修剪啟發式方法,都有超過 70% 的機率造成影響
- Agent Harness Engineering — 深度研究是一種檢索與綜整 harness;「協調能力超越基礎模型」的結果,直接證明 harness 層不可或缺
- Harness Shrinkage as Models Improve — 相反的資料點:此處的 harness 並未縮入模型之中(協調模型與僅配備工具的裸模型之間約有 10 個百分點的差距)
- Layerwise Omission Attribution — DRACO 最弱面向背後尚未解答的問題。事實正確性是在輸出端評分,無從判斷遺漏來源究竟是 L1 分頁停止、L2 精簡、L5 脈絡中段遺漏,還是 L8 迭代上限 — 只有後兩者與模型有關。該文的真實資料試驗也提醒,不應把研究代理視為不受來源影響:同一個 harness 中,端到端失敗率因來源而有 6 倍差異(FHIR 0.148、SEC 0.639、PubMed 0.889),但設計上來源與領域有所混淆
- Verification as the New Bottleneck — 事實正確性/引文是所有系統的弱項;可驗證的正確性才是前沿
- Task Time-Horizon Scaling — 深度研究是長期自主任務,恰好符合 METR 的時間跨度指標所衡量的類型
- Client-Side Agent Optimization — token/延遲的取捨(更多輸出 ≠ 更好;協調 > 原始花費)是深度研究在組合/預算最佳化上的實例
- LLM-as-a-Judge — DRACO 如何依據特定任務的評分規準,為深度研究輸出評分
- Production-Sourced Evaluation — DRACO 的任務來源(Perplexity Deep Research 的真實流量),讓基準測試反映實際使用情況
- AI-Driven Formal Proof Search — 驗證完整性的對照:可靠的驗證器能消除深度研究無法彌補的正確性落差
- Perplexity — 領先的深度研究系統與 DRACO 的建置者
- Anthropic / Google DeepMind — 受評估系統的開發者(Claude Opus;Gemini Deep Research,以及作為評審的 Gemini-3-Pro)
- Repository Exploration Subagent — 在程式碼代理中的結構性平行案例:FastContext 將任務拆解為探索與解題,並將迭代搜尋封裝在精簡的綜整結果中回傳 — 深度研究對網頁採用的也是相同的拆解→搜尋→綜整模式
- Agent Data Injection (ADI) — 相鄰但不同的失敗,而且這項區別不可忽略。ADI 偽造結構(評論的作者、捏造的工具結果),讓代理在不存在的資料上執行使用者的任務;MisKnow-Agent 完全不偽造任何結構 — 文件確實是一份提出主張的文件,它靠說服力取勝。此處的威脅模型明確排除提示注入與指令劫持,因此該頁上的所有防禦措施(分隔符隔離、來源標籤、nonce 隨機化、CaMeL Strict)都屬於另一個問題:正確的資料流追蹤會如實標示誤導文件的真實不可信來源,但代理仍然會相信它。內容層級的可靠性與信任邊界完整性是不同面向,只有後者有機制性的解決方式
- Stopping Under a Noisy Verifier — 同一種不對稱性,並附上係數與直接案例。Wu 等人為接受訊號與真實有效性脫鉤的驗證器定價(
Ā = ρ₀ + J·Q);此處的驗證器完全沒有校準錯誤 — 同一批骨幹模型在獨立情境中能正確評分誤導文件,在工作流程中卻採納這些文件,因此缺陷是根本沒執行查核,而非查核有雜訊。案例是:DeerFlow 的研究後精煉代理,在同一個遭污染的檢索環境中重新驗證主張,反而讓 Intern-S1-Pro 的表現變差(合併防禦為 62%,單獨使用各項防禦則為 57%/58%)— 這是 β 確實大於零的修復算子,此時正確做法是不修復。兩頁從相反方向得出相同建議:只有當修復或驗證步驟的證據來源比待修復內容更可靠時,執行該步驟才有價值 - Automated Failure Attribution — 同一種「獨立情境與工作流程中表現不同」的模式,但高一個層級,也是必須實際記錄 MER × ECAR、而非僅靠推論的原因。Liu 等人測量評審讀取整段失敗軌跡後,指出關鍵步驟與成因的能力(最佳步驟 73.9%;完整三元組為 16–25%);本頁的分解則透過兩個計數器,直接得知流程在哪裡失敗 — 文件是否被檢索,以及曝光的報告是否採納該文件 — 因為注入內容讓真值可被建構。階段邊界能計數時就直接計數;無法計數時才退而求其次,進行事後歸因。兩者也都發現,診斷能力與實際能力存在於同一模型中,卻未能相互配合:前者中,評審取得正確答案後,過程追蹤能力反而變差;此處則是獨立標記某文件的模型,執行任務中途卻認可該文件。2026-08-13 擴充:該頁現在也收錄了資料集中唯一一組實際蒐集而非注入的失敗案例 — 依「英文成功、非英文失敗」篩選出的規劃落地失敗;上文所述的樹根章節即源於此,並附上限制其範圍的兩項因素,以及領域持續以定義排除多重故障軌跡、而非實際測量的發現
- Failures That Look Like Success — 報告層級最具代表性的案例。深度研究報告採納預先植入的錯誤資訊後,仍然流暢、有架構、有引文,並通過 DRACO 評分最高的所有呈現檢查;FCAR 的嚴格標準(提及、引用、歸屬與保留語氣都算作未採納)表示,54.7% 的數字只計入自身結論錯誤的報告。產出本身沒有任何跡象能揭露問題,因此論文建議持續在工作流程中驗證,而非只檢查輸出
- LLM-Assisted Grey-Literature Theory Building — 對任何從實務工作者文字中彙整知識的流程提出資料品質警示,此知識庫也不例外。此處量得最強的說服線索是文體,而非來源:採用論文風格的文件,比論壇貼文多 23.5 個百分點被採納,超過高低權威來源之間 14.8 個百分點的差距;而生成流程讓各權威層級的寫作品質保持一致,因此效果來自格式本身。採用網誌、論壇與預印本的理論建構流程,恰好會提高這個可被操弄的訊號權重;而
evidence:分層制度依來源判定可信度 — 這是兩種線索中較弱的一種 - LLM-Judge Validation — 評審可靠性的對照案例。FCAR 評審對盲測、經裁定的人類標籤達到 99.7% 一致度,κ = 0.993,遠高於以評分規準進行的深度研究評分;原因在於它處理的是有明確判定規則的二元問題(「報告自身的結論是否認可這項特定主張?」),而非品質分數
- Self-Propagating Prompt Injection (AI Worms) — 代理透過另一種無關機制,污染其下游文件的另一種方式;值得並列,是因為兩者的補救方式不同。MisKnow-Agent 的文件不造假也不下指令;它們以說服取勝,代理自己的綜整又會讓錯誤結論延續下去(0% → 54.7%)。Måløy 的 Copilot for Word 蠕蟲(
case-study、MSRC、協調歷時 144 天)則除了指令之外什麼都沒有,並將指令原封不動複製到每一份輸出中,因此傳播載體數量持續增加。結果是:來源資訊在其中一種情境中就是完整解答,在另一種情境中卻毫無作用 — 在文件中記錄原始材料來源與模型所做的編輯(揭露報告提出的唯一結構性建議),能揭露植入內容的傳播軌跡;但一份標示正確來源的誤導文件,其來源資訊完全屬實,因此仍會被相信。兩者最終都導致同一結果 — 組織的資訊基礎在一般工作流程中悄悄劣化 — 但只有其中一種是安全漏洞 - Reasoning–Acting Interleaving (ReAct) — 幾乎所有此處系統採用的 harness 結構,定義如下:CS329A 第 4 堂課介紹 2022 年提出該結構的 ReAct 論文,包括本頁 MisKnow-Agent 結果所揭示的另一半失敗模式轉換 — 根據資料立論會減少幻覺,卻讓系統依賴檢索結果
- Retrieval Inside the Reasoning Chain — 此形式的前身,在 CS329A 第 7 堂課中作為入門介紹。三個層級(一次性檢索的 RAG、使用特殊 token 的鏈中代理式 RAG,再到 Search-o1 將文件中的推理壓縮)是本文系統展開成樹狀結構之前的單鏈版本;關鍵發現是,只有先針對查詢壓縮每份文件,加入文件才會有所幫助。這項研究在 2025 年底進行,評估的是簡短答案,因此不涉及此處的引文或報告面向
開放問題#
- 隨著基礎模型跨越下一個門檻,協調帶來的優勢是否會縮小?還是開放式檢索/綜整會成為持久的 harness 優勢(不像提示架構等做法)?
- DRACO 只評估單輪互動。真實深度研究價值有多少來自基準測試尚未衡量的多輪循環(釐清問題、後續追問)?
- 事實正確性是各處都薄弱的面向 — 解方是更好的檢索、驗證循環,還是像 Lean 為證明搜尋提供根據那樣,以工具作為根據的查核?Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions(arXiv 2607.20891、
empirical)部分回答了這個問題:排除了一條路線,並測量第二條。不是檢索:誤導證據的觸及率已達 72–98%,搜尋結果排名只讓 FCAR 改變 1.7 個百分點,第一份文件之後再加入文件也沒有幫助 — 檢索不是篩選環節,因此改善檢索無法成為解方。驗證循環有幫助,但不足以解決問題:研究前提示驗證,使 DeerFlow 的結果從 60–76% 基準線降至 37–57%;研究後精煉代理降至 20–58%;兩者合併則降至 15–62% — 但對 Intern-S1-Pro 而言,合併效果比單獨使用任一方法更差,因為精煉步驟會從同一個受污染的資料池重新檢索。以工具為根據的路線尚未觸及,仍是未解的另一半:開放領域的事實主張沒有 Lean;此處最接近的已測方法(具搜尋功能的驗證器),恰好就是在獨立情境中已能正確判讀這些文件、卻從未在工作流程中被呼叫的方法。因此,現存問題已收斂為:驗證應在工作流程中的哪個位置進行,而非驗證是否有幫助。 - 是否有任何脈絡修剪政策,能在與未修剪執行結果比較時,位於全部三個評分面向 — 評分規準品質、引文召回率,以及真值關鍵點涵蓋率 — 的 Pareto 前緣上?在 Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents 的 39 種設定中,沒有一種能做到:修剪後 KPR+KPC 的最佳結果為 66.32,低於 70.23;而三種維持引文召回率的方案都犧牲了一半相關性。這類工作負載中的壓縮可能有無法消除的涵蓋成本;或者,尚未有人建構出以涵蓋率而非相關性減去冗餘為目標的修剪器 — 可證偽的檢驗方式,是直接依保留的關鍵點召回率為修剪規則評分,但此處八種規則都沒有這麼做。
- 驗證的不對稱性是推論得出的,尚未獨立測量:誤導語料是經過篩選、以確保驗證器一致認可;獨立驗證器的任務(使用搜尋工具與明確搜尋規範,判斷單一文件)嚴格來說也比代理的任務(執行研究任務時判斷文件)容易。**如果在工作流程中安排驗證步驟,提供相同工具、相同聚焦提示和獨立預算,能否縮小差距 — 還是無論提示方式如何,執行任務都會削弱查核能力?**研究前防禦是這項實驗的弱化版本(會提出查核要求,卻沒有獨立步驟或工具),大約彌補了一半差距;強化版本尚未執行。
資料來源#
- CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks — Aakanksha Chowdhery、Stanford CS329A 第 8 堂課,2025-11-17 授課,2026-08-03 發布(
practitioner-opinion、YouTube 自動字幕逐字稿)。DeepScholar-Bench 章節涵蓋:相關研究生成任務、每月更新並涵蓋 22 個領域的截止日期後 arXiv 論文、三個評分面向及其約 70–80% 的人類驗證度、低於 19% 的天花板與低於 12.5% 的文件重要性,以及四種失敗模式(漏掉奠基性論文、使用完美來源時關鍵事實涵蓋率仍約為 50%、綜整與可驗證性互有取捨)。圖表數值是從投影片以 ASR 讀取,資料集中沒有收錄論文;系統層級的歸因(OpenAI deep research 文筆連貫但較難驗證;參考流程的引文精確度接近 90%)是講者的摘要 - Beyond RAG: Building Agentic Document Workflows with LlamaIndex — Pierre-Loic Doulcet、AI Engineer Singapore 2026(
practitioner-opinion、LlamaIndex 供應商利益衝突):樹狀而非迴圈的流程安排、四項工作流程特性,以及將檢索作為稽核軌跡的論點。圖表透過圖像雙重檢查閱讀;原始檔案含有刻意損壞的剖析器輸出作為示範素材,不應引用其中任何圖表 — 詳見 Document Parsing as the Retrieval Bottleneck - DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity — §1(深度研究的定義)、§5(受評估的系統、協調能力超越基礎模型的發現、token/延遲表格、各面向結果)
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions — Pengyu Zhu、Lijun Li、Longju Yang、Sen Su 與 Jing Shao(Beijing Univ. of Posts and Telecommunications / Shanghai AI Laboratory / Chongqing Univ. of Posts and Telecommunications),Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions,arXiv 2607.20891,2026-07-23,
empirical。§3.2(威脅模型 — 明確排除提示注入與指令劫持)、§3.3(MisKnow-Agent:藍圖、受控生成、跨模型驗證篩選)、§3.4 + 附錄 D–E(研究前與研究後防禦、驗證提示與精煉演算法)、§4.1(系統、Serper 後端、temperature 0、評審驗證)、§4.2(搜尋結果排名、生命週期階段)、§4.3(權威性與文體效應)、§4.4(預算/劑量反應)、§4.5 + 附錄 G(framework-LLM 互動、MER/ECAR 分解)、§5.1(Gemini Deep Research)、§5.2(防禦效益)、附錄 B(評審與人類一致度)、附錄 C(目標錯誤結論的人工驗證)、附錄 I(所有提示模板 — 生成提示中各層級寫作品質相同的限制,以及驗證器的搜尋規範指示,皆引自此處)。 - 表格已核實。 表 3(framework-LLM 結果)已透過算術與 PDF 頁面圖像交叉核對:六列的
FCAR = MER × ECAR,誤差均在 0.1 個百分點以內;三列的兩個差距分解項也都精確重現論文所列數值 — 這有力證明解析過程保留了標籤/數值的對應關係,因為若有攤平或位移,恆等式就不會成立。表 1(生成模型比較,質性)已對照 PDF 核查,解析無誤。表 2僅以單欄描述藍圖,不含比較數據。本文所有引用的百分比皆來自正文或已核實的表 3。 - 未閱讀圖表。 權威性、文體、排名、生命週期階段、預算、Gemini 組別和防禦組別等條件的 FCAR 數值,位於圖 3–7;本文依照引用正文而非表格的慣例,引用報告這些數值的正文內容。正文未列出的各設定長條圖數值不予引用。
- Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents — Kolukuluru、Ashok、Arora、Ciccarelli 與 Ashok Kumar(UMass Amherst)、Nie(UT Austin)、Dernoncourt、Basu、Rossi 與 Lipka(Adobe Research),Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents,arXiv 2608.08389,2026-08-09,
empirical。本文引用 §4(成本分解與內建的末段精簡,項目數由 66.10 降至 44.08)、§6(GPT-Researcher 上的 DeepResearchGym、1,000 個 Researchy Questions 中的 100 題、四組指標,以及 Citation Recall 定義為報告主張中有可檢索來源支持的比例)、§7.1–7.3(所有階段結果皆依正文和表 1–3 引用,並在編譯時與pdftotext -layout逐格核對)、§7.4(跨階段發現)、附錄 B.5(DeepResearch Bench 組別重現效率排序、未重現品質排序)、附錄 B.6 + 表 4(評審敏感度),以及表 11的基準列,支持結果處理占 94.41%(該列加總為 100.01)。所有設定的 KPR+KPC 天花板、意外的變異數估計,以及 token/美元的不對稱性,都是編寫本文時推導得出;完整推導、逐表判定、論文中三處數值不一致,以及圖 3 的座標軸檢查,請見 Tool-Output Pruning - An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures — Pahuja、Brokman、Hofman、Nizri、Vishna、Goldfarb-Tarrant、Marchisio、Kojima 與 Vainshtein(Fujitsu Research of Europe / Cohere / Fujitsu Research),An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,arXiv 2608.03735,2026-08-04,
empirical。本文引用 §1(規劃落地的定義,以及從請求到計畫的傳播論點)、§3.2(Open Deep Research 作為推導框架)、§3.3 + 附錄 B(TART 架構,以及將其注入規劃器、協調器與工作代理)、§5(四項主要效益,皆引用正文)、§5.2(作業落地的整體比例,並與表 10 自身的列與欄總和核對)、附錄 E.2(Level-3 平台期:表 6 中分類涵蓋率維持 55.2%,表 7 中的參考步驟為 13.00、工具為 3.38),以及 §6(語意契約立場)。解析備註:此文件未執行canary-recall(符合條件的唯一 token 數為 0 — 標題數字重複),而其表格標題左右交替,因此本文引用的每個數值皆來自正文或經內部算術核對的表格。圖 4 未引用,因為長條圖順序與標籤順序不同;圖 1(b) 未引用,因為其中一個骨幹模型平均涵蓋十一種語言,另兩個則為七種。完整討論、利益衝突,以及精確比對合規與機器翻譯的限制,請見 Automated Failure Attribution - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents — TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents,Tao、Peng、Yao、Ge、Cheng、Wang、Gao、Li(UW–Madison + Microsoft Research),arXiv 2607.13988,v1 2026-07-15,
empirical。§4.1(刻意保持精簡的 ReAct harness 與三工具瀏覽器介面;四個外部代理明確只是未受控的參考點)、§4.2 + 表 1(本文引用的所有基準測試數值,編譯時與pdftotext -f 8 -layout逐格核對)、§4.3(軌跡尺度動態)、§6(讓研究不屬於報告路線的精簡答案範圍限制)、§A.3(工具架構、停止規則)、§A.5(每輪信用軌跡 —search/open/find的分工,以及答案已取得卻又遺失的失敗模式)。完整討論與所有解析備註,請見 Turn-Level Credit Assignment。
Cited by 33
- DRACO Benchmark×4
<sup>†</sup> The "synthetic" label deserves a footnote in one case. DeepScholar-Bench generates its…
- Autonomous Scientific Discovery×3
Deep Research Agents — the survey's Scientific AI Assistants category, and its concession that the…
- CS329A: Self-Improving AI Agents (Stanford)×3
DeepScholar-Bench (Stanford/Berkeley) · research-synthesis quality: retrieval, key facts, citation…
- Open Questions Backlog×3
Deep Research Agents: Factual accuracy is the weak axis everywhere — is the fix better retrieval,…
- Perplexity×3
Perplexity is an AI answer-engine / search company. In this corpus it appears as the author of the…
- Production-Sourced Evaluation×3
Auto-generated from a live corpus (DeepScholar-Bench) — DRACO's Table 1 files this under synthetic,…
- Reasoning–Acting Interleaving (ReAct)×3
Deep Research Agents — where the pattern lives in current practice, and where its grounding trade…
- Retrieval Inside the Reasoning Chain×3
Treat all of this as a dated baseline. It is a lecture recounting one paper's tables, delivered in…
- Document Parsing as the Retrieval Bottleneck×2
The deck's answer to "what do you wire around a document the agent can actually read" is LlamaIndex…
- Open-Ended Discovery Harnesses×2
Deep Research Agents — the same word, a different system class: query decomposition + web retrieval…
- Tool-Output Pruning×2
Not Worth Another Token (Kolukuluru, Ashok, Arora, Ciccarelli, Ashok Kumar, Nie, Dernoncourt, Basu,…
- Aakanksha Chowdhery
Her fourth and final solo lecture (delivered 2025-11-17) surveys three benchmarks — METR's time…
- Agent Data Injection (ADI)
Deep Research Agents — the failure that survives every defense on this page, and the reason to keep…
- Agent Harness Engineering
Deep Research Agents — a retrieval-and-synthesis harness where orchestration stays load-bearing:…
- AI-Driven Formal Proof Search
Deep Research Agents — the no-instant-verifier sibling in open-domain research: factual accuracy is…
- Artificial Analysis
Intelligence Index · Deep Research Agents · used as a capability ordering; agent performance is…
- Automated Failure Attribution
Deep Research Agents — the same injection-for-golden-labels method used to get attribution for…
- Client-Side Agent Optimization
Deep Research Agents — DRACO's token/latency table is this cost/quality framing in the…
- Context Lifecycle Management
Deep Research Agents — the workload the Hard Set is drawn from (browser, shell, web-fetch traces…
- Crystallizing Agent Work into Workflows
Parallelism is declarative. send_event fans out (a step emitting N events of one type runs N…
- Failures That Look Like Success
Deep Research Agents — the class at the level of a whole research report, and the one instance…
- GDPval Benchmark
Deep Research Agents — the third benchmark in the same lecture (DeepScholar-Bench) is the follow-up…
- Layerwise Omission Attribution
Deep Research Agents — the pipeline shape at its most exposed: decompose, retrieve iteratively…
- LlamaIndex
Deep Research Agents — deep research shipped as one of four reference Workflow patterns (decompose…
- LLM-as-a-Judge
Deep Research Agents — the system class DRACO grades this way
- LLM-Assisted Grey-Literature Theory Building
Deep Research Agents — the corpus-quality risk this pipeline runs, measured. MisKnow-Agent (arXiv…
- LLM-Judge Validation
Deep Research Agents — the high end of the agreement range, and what buys it. MisKnow-Agent's FCAR…
- Agent Systems & Harness Engineering
Deep Research Agents — Agentic systems that decompose a complex query, iteratively search diverse…
- Repository Exploration Subagent
Deep Research Agents — structurally parallel: deep-research decomposes a query into search +…
- Self-Propagating Prompt Injection (AI Worms)
Deep Research Agents — the other way an agent corrupts downstream documents, by a completely…
- Stopping Under a Noisy Verifier
Deep Research Agents — β observed in the wild, and the case where the verifier is not noisy at all.…
- Task Time-Horizon Scaling
Deep Research Agents — deep research is a long-horizon autonomous task of exactly the kind this…
- Turn-Level Credit Assignment
Deep Research Agents — the agent class TRACE trains, and the behavioural side of the same result:…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- Context Lifecycle Management
Treating an agent's active context as indexed runtime objects with a lifecycle (fold/mask/prune, recoverable sidecars,…
- Cost-per-Task Over Cost-per-Token
Anthropic's inverted model-selection default: start with the most capable model and dial effort down — a stronger model…
