H
Howardism
Plate IIAgent Systems機器翻譯 · machine-translatedENHOWARDISM

推論鏈中的檢索

CS329A 第 7 講教的三級階梯,是深度研究的前身:RAG 在思考開始前檢索一次;代理式 RAG 讓模型在推理鏈中段、特殊 token 之間輸出搜尋指令,再把文件插回去;Search-o1 加入文件內推理模組,根據目前的查詢閱讀每份檢索到的文件,並只附加擷取出的片段。區分它們的結果是文件數量曲線:加入更多文件時,直接推理和 RAG 持平或下滑,Search-o1 則上升,因為它要解決的是對檢索雜訊進行長情境推理,而不是檢索本身。觸發訊號是模型自己的遲疑 token(「或許」、「或者」、「等等」),Search-R1 則透過 RL 把同一個迴圈移進權重中。

Article metadata
Publication details
Published:August 17, 2026
Filed:Concept
Domain:Agent Systems
Tags:RetrievalAgent EngineeringReasoningContext ManagementTool Use
Reading:16 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

推論鏈中的檢索插圖

資料來源#

摘要#

大型推理模型有知識截止點,也有很長的思維鏈,兩者交互作用會帶來問題:當推理鏈遇到權重中沒有的資訊時,模型會猜測並繼續推理,而猜測會一路傳到答案。CS329A 第 7 講把解法教成三級階梯,分開命名各級很有必要,因為 wiki 的 2026 年來源描述了位於第三級的系統,卻沒有頁面說明前兩級是什麼。

級別檢索時機進入推理鏈的內容
RAG一次,在推理開始前檢索到的文件,放在提示中
Agentic RAG推理鏈中段,每當模型在特殊 token 之間輸出搜尋指令時檢索到的文件,插入推理鏈中
Search-o1推理鏈中段,由相同訊號觸發只有擷取出來、依查詢調整的片段——每份文件會先由文件內推理模組讀取

這是 Deep Research Agents 的脈絡,也是當執行動作的模型變成會輸出自身工具呼叫的推理模型時,ReAct 所演變出的機制。

證據。 CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents(Aakanksha Chowdhery 個人授課,於 2025-10-17 錄製,2026-08-03 發布,practitioner-opinion)——以投影片逐步講解 Search-o1(2025),提到 Search-R1 並明確表示不會介紹。兩篇論文都不在 raw/;所有圖表數據都是從投影片上讀取,經 ASR 轉錄而來,因此都有保留不確定性。所述的最新技術狀態是2025 年底,而這份 wiki 已有大量更新、探討相同工作負載的來源。

觸發訊號:模型自身的遲疑,就是知識落差的訊號#

這堂課整套設計建立在一項觀察上,也是最值得記住的一點:**推理軌跡中會先顯露知識落差,答案中才會顯露。**在 GPQA 上執行推理模型時,「你會在推理鏈中常常看到『或許』這個詞,也會看到『或者』或『等等』」——這些遲疑用語正好標示出模型對不熟悉的內容自行發揮的步驟。若置之不理,「那些知識落差會持續擴散到整個推理過程中」,而且「你對最終答案的確定程度很低」。

由此可得兩點。

**這是可用的檢索觸發條件。**在推理鏈出現遲疑時搜尋,不要按時程搜尋,也不要遇到每個實體都搜尋。當學生問模型怎麼知道要查什麼時,課堂給出的實用做法是:「找出你不想依賴 LLM 知識庫的部分……這幾乎就像找出問題中的關鍵實體,再取得相關資訊。」

**這也能用來評估。課堂指出,Search-o1 會透過計算推理鏈中的不確定性標記來衡量自身效果,並發現標記「大幅減少」。這是相當直接的測量工具——介入措施和指標讀取的是相同 token——也是對系統過程的測量,而這類系統通常只按答案評分。

這也與同一位講師在三講之前提出的主張相互呼應。在第 4 講(推理與行動交錯(ReAct))中,她不建議根據模型自評的信心程度來決定是否使用工具,理由是*「模型的校準並不好」,並建議預設採用外部資訊來奠定答案。這裡的觸發條件是模型的隱含不確定性——推理軌跡中的遲疑 token,而非明示的機率——而且確實有效。課堂沒有明說的調和方式是:詢問模型有多確定,和閱讀模型聽起來有多確定,是兩種不同的測量;只有前者被 Confident But Unsure 證明有問題。第 7 講的結尾討論也再次確認前半部:彙總輸出 log-probability 後,「模型往往過度自信」*,例如答對率 50% 的模型聽起來有 80% 把握(這是講師舉例的數字,不是測量結果);過度自信也會反映在行為上,例如模型受糾正後仍拒絕改變想法。

課堂反覆用一句話說明 RAG 為什麼不夠#

「你一開始只檢索一次,所以沒辦法調整內容。」如果問題有好幾部分,「每個推理步驟都需要[一]項不同資訊」——而能找到該資訊的查詢,要等前面的步驟執行完才寫得出來。因此,RAG 適用於單跳問題(「天氣如何」),但正如課堂所說,「它在多步推理中肯定會遇到困難。」

Agentic RAG 解決了時機問題,卻帶來另一種問題:文件既長又有雜訊,而且*「如果放進 10 或 20 份文件,[模型] 可能真的沒辦法好好推理。」*化學的實例把問題具體呈現出來——若問一連串反應中第三個產物含有幾個碳,標準推理會猜錯中間產物的結構;Agentic RAG 雖檢索到正確的一般資料,卻答出 14,而正解是 10,檢索到的大量內容干擾了推理鏈,反而沒有幫助;Search-o1 擷取出相關化學式後便答對了。

**因此,第三級要解決的是長情境推理,而不是檢索。**學生問進步是否真的來自精確率/召回率時,課堂明確表示,論文的主張是:*「即使找到了多份與查詢內容有些關聯的相關文件,一旦你把所有文件都放進情境,就是要求模型對那麼多文件進行大量推理。」*檢索品質大致維持不變,優勢來自文件檢索後的處理方式。這正是 Context Window Smart Zone 所討論的問題,只不過是從檢索的角度切入。

文件內推理模組,以及區分不同級別的結果#

這個模組在檢索工具呼叫內部運作,而不是在工具呼叫外部。它會根據檢索到的文件、觸發搜尋的查詢,以及目前為止的推理內容,判斷相關性並輸出擷取片段;只有片段會附加到推理鏈,接著推理繼續進行。課堂的比喻值得記住:「人類不會只整理所有可能的參考資料,也會為那些參考資料做筆記。」

**讓階梯之所以成為階梯的關鍵結果,是文件數量曲線。**在 GPQA 的物理、化學和生物學子集中,繪製 pass@1 與檢索文件數量的關係:

  • 加入更多文件後,直接推理和 RAG 不會改善(持平或下滑)。
  • Search-o1 會改善,因為每份新增文件都會先依據查詢壓縮,再進入推理鏈,而不是讓推理鏈變得更長。

Chowdhery 為這種形式命名:「你可以平行精煉,而不是反覆精煉,因為你可以取得更多資訊,再把它切成片段放進模型的情境中。」更多檢索是調節廣度的旋鈕,但只有將逐份文件壓縮納入迴圈後才會發揮作用——這也從檢索端說明了同一個觀點:Tool-Output Pruning 三年前在代理程式與環境的邊界、透過提示而非訓練好的頭部所提出的主張。

壓縮結果還必須能在多輪對話中持續保留,於是有學生問到狀態由什麼保存。誠實的答案是:*「這裡假設有狀態或記憶緩衝區……但這種結構並未明確說明。」*保存目前查詢和先前推理內容的緩衝區是被假設存在,而非經過設計;這正是 Context Lifecycle Management 所探討的對象。

基準測試主張:全部是 2025 年底的說法,而且都保留不確定性#

將 GPQA 與人類專家對照,按學科看對角線。課堂在此處的謹慎值得保留:比較物理學家的分數和系統的物理學分數,而不是拿來和系統總分相比。依此解讀,以推理模型為基礎的 Search-o1 在物理學上*「很有競爭力,有時甚至更好」,在生物學上接近持平,在化學上則較差。學生問物理學家有多優秀時,Chowdhery 隨即淡化自己投影片上的主張:「也許他們找來的物理學家表現不好」,並將主張重申為競爭力,而非優越性:「這不是說你超越了人類專家。」*有學生推測化學上的落差是因為化學式經過 tokenization 後,微小修改就會破壞其意義;這個問題仍是待驗證的假設。

**多跳 QA。在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Bamboogle 上,純 RAG 和 Agentic RAG 都「遇到一定程度的飽和」,而 Search-o1 在大多數以粗體標示(表現最佳)的儲存格中勝出。ASR 沒有保留任何絕對數字;主張重點是趨勢。

應把這些內容視為有日期的基準資料。這是 2025 年 10 月一場課程對單篇論文表格的轉述;wiki 上探討同一工作負載的 2026 年來源(Deep Research Agents),評估的是附有引用來源的報告,而非簡短答案的準確度。

Search-R1:把相同迴圈移進權重中#

課堂講到第二篇論文時時間已不夠,只用一句話說明差異:**Search-o1 透過提示建立迴圈;Search-R1 則透過 RL 迴圈教模型搜尋。wiki 已經從檢索工具端記錄了同一組案例——Harness Shrinkage as Models Improve 記載了 Search-R1/R1-Searcher,指出「團隊過去要手寫的檢索迴圈,最後會直接內化到模型本身」;Document Parsing as the Retrieval Bottleneck 則從另一面記錄了資源緊縮的情況(Adaptive-RAG 將大多數查詢路由到完全不需要迴圈的路徑)。

本頁為這些記錄補充的是究竟有哪些部分會被吸收,又有哪些不會。可被吸收的部分是觸發條件和查詢——何時搜尋,以及要查詢什麼。文件內推理模組會額外呼叫一次模型,來讀取策略尚未關注的文件;搜尋動作上的 RL 迴圈不會讓這個步驟變得多餘,而文件數量曲線也顯示,承載實際效果的正是這個步驟。因此,第二級到第三級之間的差異,是這套架構中最不可能消失並融入權重的部分。這把縮減論點化為可驗證的形式,而非只是重述。

非文字語料中的實際應用:檢視候選資料,不要只相信名稱#

上述階梯以文件為基礎,「在檢索到的內容中推理」指的是閱讀文字。Bridgewater Associates 的 PAT 將相同做法應用於包含數千萬條時間序列的資料庫(How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes,case-study)。這個案例很有啟發性,因為要解決的問題完全相同,但資料內容不同。

Michael Ran 表示,他們的搜尋代理程式使用「RAG、重新排序等傳統搜尋技術」——也就是第一和第二級;真正帶來差異的是加入了類似人類的檢視方式:人類研究者尋找資料時,「不會只根據時間序列的名稱做錨定。他們會查看頻率、序列的幣別,最重要的是,序列中的數值是否符合他們的先驗判斷。」據稱,把這種推理方式嵌入搜尋代理程式後,檢索準確度從約 50% 提升到 90%。

這就是第三級:文件內推理模組讀取的不是文字,而是資料。排序器提出候選項目後,模型呼叫會根據查詢含意,檢視候選項目的實際內容,判斷其形態是否相符。此處的結構性主張與本頁的區分結果一致——解法不是改善檢索,而是對檢索結果進行推理;這也將主張延伸至中繼資料稀少的語料,因為只靠名稱比對幾乎行不通,一個名為 oil price 的序列可能對應數千種不同年份、頻率和幣別。

衡量這項證據時要考量其限制:這是第一方演講,只有一組自述的準確度數字,沒有基準測試、任務定義、樣本數,也沒有說明「準確度」對嵌入較大流程中的檢索步驟有何意義。這是來自實際應用的方向性佐證,並非測量結果。

延伸閱讀#

  • CS329A: Self-Improving AI Agents (Stanford)——第 7 講的後半部,作為課程深度研究作業的入門
  • Aakanksha Chowdhery——授課講師
  • Deep Research Agents——這套階梯進一步發展的方向。第三級是單一推理鏈,一邊搜尋一邊壓縮;深度研究代理程式則把相同的基本做法展開成平行子搜尋樹,再由整合器整理內容並附上引用。該頁的 2026 年測量以附有引用來源的報告為對象,評分維度是本講座的簡答基準測試從未觸及的
  • 推理與行動交錯(ReAct)——同樣的交替模式,但思考階段由模型自身的推理模式提供,而非少樣本範例;觀察結果也會在讀回之前先摘要。該頁記錄的失敗模式轉換(以檢索失敗取代幻覺)說明了遲疑 token 觸發條件為何值得關注:它能偵測交錯流程未能消除的殘餘幻覺
  • Tool-Output Pruning——同一個邊界上的相同刪減方式,並經過測量。Search-o1 的文件內推理是 2025 年透過提示實現、逐份文件進行的檢索後剪枝;SWE-Pruner Pro 則是 2026 年利用主幹模型自身隱狀態的訓練頭部。兩者的共同發現是放置位置:觀察結果進入歷史前先壓縮;2026 年的深度研究比較表還補上本講座從未提到的成本部分:太早剪枝會刪除整個分支,太晚剪枝則只會修改提示
  • Context Window Smart Zone——整套階梯試圖守住的限制。第二級失敗不是因為檢索品質變差,而是鏈中的 10–20 份文件超出模型能良好推理的範圍;這就是本頁以 token 數量描述的機制
  • Context Lifecycle Management——課堂坦承只是預設存在、而非明確規格化的記憶緩衝區:目前查詢、先前推理內容和累積的擷取片段,都必須在多輪對話中存放於某處
  • Harness Shrinkage as Models Improve——Search-R1 是本頁第二級迴圈被吸收到權重中的案例,wiki 已從 RAG 工具端記錄過。這裡進一步說明:觸發條件和查詢可以被吸收,讀取文件的步驟則是獨立的模型呼叫,不會被吸收
  • Document Parsing as the Retrieval Bottleneck——更底層的一層。這套階梯假設文件進來時已是值得推理的文字;該頁指出,資訊可能早在擷取階段就已流失,而文件內推理模組即使把扁平化表格讀得再好,擷取出的數字仍會是錯的
  • Confident But Unsure——此設計試圖繞過、而非解決的校準失效。遲疑 token 觸發條件直接從推理軌跡讀取不確定性,而非詢問模型;課堂結尾也重申直接測量方式的失效:彙總 log-probability 會導致過度自信,並在行為上表現為抗拒糾正
  • Trained Calibration——課堂未附引用、但有提及的另一條路:透過 RL/RLHF 讓模型明示的信心程度具有意義,使模型*「不會輸出自己信心不足的答案」*
  • The Verifiability Thesis——開放領域的事實問題沒有機械式檢查器,因此這裡每一級帶來的都是資訊奠基,而非驗證;擷取出的片段是推理鏈據以判斷的證據,不是用來檢查答案的依據

尚待解答的問題#

  • Search-o1 透過計算推理鏈中的遲疑 token 來衡量自身效果,並發現這些 token 大幅減少。標記數量反映的是正確性,還是只反映檢索文字的存在?也就是說,注入無關但看似可信的文件,是否也能同樣減少標記?課堂報告了相關性,卻沒有對照組。
  • 文件內推理步驟會針對每份檢索到的文件額外呼叫一次模型。這份語料中的來源都沒有估算它的成本:計入額外呼叫費用後,先壓縮再推理,會比把文件全部塞進長情境更便宜,還是更貴?這堂課和 2026 年的剪枝論文都報告了 token 數量或準確度,卻從未報告費用。

資料來源#

  • CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents — CS329A Self-Improving AI Agents — Part 7: Self-Improvement with Search & Deep Research Agents,Aakanksha Chowdhery 個人授課,Stanford Online。於 2025-10-17 錄製,2026-08-03 發布至 YouTube(practitioner-opinion,YouTube 自動字幕逐字稿,約 12.1k 字)。深度研究部分涵蓋:以遲疑 token 表現知識落差的觀察和 GPQA 標記詞彙、包含特殊 token 觸發條件和文件內推理模組的 RAG/Agentic RAG/Search-o1 階梯、涵蓋三種方式的化學實例(包括 Agentic RAG 答錯 14 而非 10)、pass@1 與文件數量曲線、與人類專家比較 GPQA 對角線及講師本人的保留態度、HotpotQA/2WikiMultihopQA/MuSiQue/Bamboogle 上的多跳 QA 主張、不確定性標記減少、對記憶緩衝區的承認,以及 Search-o1 與 Search-R1 的一句話差異。結尾討論 log-probability 校準和模型過度自信。所有圖表數據皆由 ASR 從投影片讀取;兩篇論文都不在 raw/。講師無論文作者利益衝突——Search-o1 來自 Renmin University,Search-R1 也不是她的研究
  • How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes — McManus、Ran 和 Weight(Bridgewater Associates),LangChain channel,2026-07-24,25:44 演講,case-study。引用時間序列搜尋中的類人檢視方式,以及 50% → 90% 的數字(10:24–11:14)。自述結果,沒有基準測試或方法說明。另見 Bridgewater Associates
§ end
Cited by 11
Related articles
  • Deep Research Agents

    Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…

  • Reasoning–Acting Interleaving (ReAct)

    The 2022 prompting abstraction that made an agent out of a language model: alternate a free-text thought with a tool ac…

  • Layerwise Omission Attribution

    Rajan: omission — a decision-critical fact silently missing from an answer — is a pipeline property assignable to one o…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Agent Loop Pattern

    `/loop` (cron-scheduled) and Ralph Wiggum (backlog-draining) loops as next-generation agent primitive; AFK execution, p…