資料來源#
- CS329A Self-Improving AI Agents — Part 3: Robust Verification
- CS329A Self-Improving AI Agents — Part 9: Future Research Areas
- Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set
摘要#
此處的驗證器是一種訓練式模型,輸入問題與候選解答,輸出解答正確的機率。它是驗證器分類法中第四級,也是最柔性的階段——當沒有證明助理、測試套件或參考實作時,就會用到它;而它的設計只取決於一個問題:你要標註完成的答案,還是通往答案的每個步驟?
- 結果獎勵模型(ORM) — 每個解答一個標籤,將最終答案與正確答案比對而得。便宜、自動化,卻看不見答案是如何得出的。
- 過程獎勵模型(PRM) — 每個推理步驟一個標籤。成本高,而這筆成本換來的是 ORM 做不到的事。
CS329A 第 3 講(CS329A Self-Improving AI Agents — Part 3: Robust Verification、Azalia Mirhoseini,於 2025-09-29 授課、2026-08-03 發布,practitioner-opinion)帶我們看三篇橫跨 2021–2024 年的論文,逐步發展出這套方法。整個脈絡有個弔詭,值得先於所有細節說明:**過程監督最重要的好處,是抓出靠幻覺一路推理卻得到正確答案的解答;而自動化步驟標籤的論文,卻以該步驟是否能導向正確答案來定義標籤——於是自動化又引入了監督原本要抓出的同一種失敗。**以下會詳細展開這句話。
本文所有數字都取自 YouTube 自動字幕逐字稿中的投影片。raw/ 中沒有收錄這三篇論文。數字皆為約略值,依據課堂內容而非論文,時間點為 2025 年底。
1. 結果驗證器(OpenAI,2021)#
Training Verifiers to Solve Math Word Problems 引入了 GSM8K——一組國小程度的文字題,刻意挑選需要多步推理並以自然語言作答的題目——以及課堂著墨的另一部分:與生成器一起訓練的驗證器。Mirhoseini 解釋其動機時說,我們人類會希望有份評分規準,告訴我們目前的解題方向是否正確;驗證器就是交給模型使用的那份規準。她指出,論文提出的動機(「LLM 會產生幻覺,而且可能很有自信地提出錯誤解答」)四年後依然成立。
方法如下,每個步驟後來都成為其他研究重新檢視的設計決策:
- 在資料集上對生成器微調兩個 epoch。
- 每題抽樣 100 個補全;將每個補全的最終答案與人工撰寫的正確答案比對,標為正確或錯誤。人工只需離線參與一次;之後所有標籤皆自動產生。
- 使用這些配對資料訓練驗證器一個 epoch。
架構。驗證器本身是語言模型,搭配一個輸出逐 token 正確性預測的小型純量預測頭;問題 token 不納入損失計算。訓練時使用兩種目標——二元正確性損失,以及一般的下一 token 語言模型損失——論文指出,兩者合用勝過只使用二元損失。
消融實驗比較了兩種標籤粒度:逐句標註(每個句號後計算損失,判斷目前為止的句子是否是正確步驟)與逐 token 標註(雜訊大得多——每個 token 都必須符合通往正確最終答案的推理路徑)。無論採哪種方式,實際使用的分數都是最後一個 token 的預測值,因為選擇器只需要對每個解答給出一個判斷。課堂逐張講解投影片時,展示了逐 token 訊號如何以顏色呈現在解答上:正確解答在中途下探,最後回到綠色;錯誤解答則以紅色結尾。
結果,以及延續至今的兩項發現。
- 驗證優於單獨使用監督式微調:投影片展示的兩種模型大小(6B 與 175B,來自 GPT-3 時代)皆如此,而且驗證器的訓練集越大,兩者差距越大。訓練題目少於約一千題時,較大的模型使用微調基線反而較好——驗證器需要足夠資料,複雜度才值得。
- **非對稱的模型大小。****較大的生成器搭配較小的驗證器,勝過較小的生成器搭配較大的驗證器。**Mirhoseini 的直覺是:平均而言,生成比較難,因此應把參數花在生成器上。她指出,兩者大小配置的 Pareto 前緣仍是一個尚待研究的題目——她認為現在比 2021 年更值得研究,因為 Hugging Face 上已有可直接使用的驗證器與獎勵模型,也各有排行榜。
本文最希望你記住的發現:候選答案增加時,驗證器精確率會下降#
逐步增加每題補全數量,再用驗證器評分,準確率會上升到約 400 個樣本後開始下滑。到 800 個時,驗證器「無法追上最佳解答」:候選答案這麼多,兩個幾乎相同、但一對一錯的解答,比 400 個候選時更難區分,因此分數最高的答案品質會下降。論文實際採用的系統停在每題 100 個樣本,此時大部分效益已經取得。
這是對第 2 講結果的延伸,而非重述。前一講顯示,多數決投票在 10–50 個樣本後就會停滯,但涵蓋率仍持續增加(可驗證性論點)。此處的訓練式驗證器把有效範圍延伸了約一個數量級,接著也會退化;多數決投票則不會以同樣方式退化。因此,生成與驗證之間的落差包含兩個不同部分:共識式選擇器在結構上看不見少見但正確的答案,而學得的選擇器在候選集合擴大時會失去區辨力。兩者都無法靠增加抽樣數量解決。10,000 個樣本的涵蓋率曲線是以完美選擇器為基準測量的;本文介紹的方法在該規模下都無法企及。
這也是在有雜訊的驗證器下停止所形式化描述的最明確案例:雜訊驗證器的回報分數看起來仍然可用,但它所選出的結果卻越來越差。
Mirhoseini 認為可能已過時的一個步驟:先對生成器做監督式微調。現代基礎模型已能遵循指令且具備數學知識,因此「很多較新的做法會直接開始訓練驗證器目標,不先做監督式微調」。
2. 過程監督(Let's Verify Step by Step,OpenAI,2023)#
兩年後,同一間實驗室用不同方式描述同一個問題:早期的一個錯誤步驟會讓整個答案偏離正軌,而結果標籤無法指出是哪個步驟出錯。論文以同一個經微調的 GPT-4 基礎模型訓練 ORM 與 PRM,並比較兩者。
- ORM 標籤:將最終答案與正確答案比對。分數 = 最後一個 token 的預測值,如上所述。
- PRM 標籤:**人工標註者為每個步驟評分:正向、負向或中立。**分數 = 每個步驟機率的乘積。
過程監督真正的理由是避免假陽性,而非信用分配#
課堂先談信用分配,接著指出更重要的事,並稱之為整體測試時擴展可能面臨的陷阱:
過程監督讓我們比單靠結果監督更能妥善處理假陽性……模型可能會產生幻覺——而且出乎意料地,這種情況確實會發生——最後得到正確答案,但整個推理過程其實完全錯誤。
以最終答案比對結果訓練的 ORM 會獎勵這種解答,而以它建構的選擇器也會欣然選中它。監督各個步驟則能大幅降低這種情況。同一類失敗在代理程式一側被整理為看似成功的失敗——結果看起來正確,過程卻不正確——而在此處,它成了訓練資料的缺陷,而非執行期間的缺陷。這正是過程監督值得付出標註成本的具體理由。課堂提到的次要好處比較不明確:推理過程可解釋,以及人類明確認可的解題過程(因為標籤是由人類撰寫)。
PRM800K 與資料效率技巧#
釋出的資料集為 PRM800K——約 80 萬筆步驟層級標籤,採用開放原始碼授權。資料集的建置有兩個值得注意之處:
- **迭代式自舉。**請 LLM 判斷一個步驟,就能免費得到粗略的 PRM;團隊使用一系列 PRM 挑選下一批供人工標註的資料,讓模型與資料品質交替提升。
- 根據意見分歧進行主動選取,據報比隨機抽樣標註的資料效率高 2.6 倍。課堂稱這些為「很有說服力的錯誤答案」,接著又描述為最終答案正確但中間步驟錯誤的樣本。兩種說法並不相符——前一個說法指的是目前的 PRM 給予高分、但最終答案錯誤的解答——而逐字稿沒有釐清歧異。能穩妥採納的是兩種解讀共有的機制:優先標註驗證器判斷與結果不一致的樣本,因為人工標籤在這些地方最有價值。2.6 倍這個數字來自課堂,是本文唯一依據該段模糊內容的數字。
結果#
- PRM > ORM > 多數決投票,比較每題抽取 n 個解答的情況。在此設定下,多數決投票約在 100 個樣本後失效。
- PRM 能找到少見的正確答案。它能在少於 5% 的抽樣解答正確的題目中找出正確解答——這正是第 2 講指出多數決投票在結構上看不見的情況,因為值得找的答案在一萬個中只出現一到三次。這是在兩堂課中,最接近對該機制提出建設性解方的做法。
- **PRM 比 ORM 更省標籤。**增加標籤都能改善兩者,但 PRM 每增加一個標籤的曲線斜率更大。一位學生提出比較不公平——ORM 每題需要 k 個標籤,PRM 則需要 k × 步驟數——Mirhoseini 承認,論文本身也指出這很難控制,只能部分處理。應將效率主張視為方向性結論。
- 能泛化至新領域與資料集,而她指出這正是驗證器研究應追求的目標:多數決投票比 ORM 更能泛化,PRM 又勝過多數決投票,能承受「大得多的分布偏移」。
課堂討論整理出的注意事項#
以下三點都來自學生提問,後續研究也都證實了:
- 將兩者結合。有人問 PRM 會不會因好看的步驟沒能推進答案而造成損害,她回答:「很多較新的方法會把兩者結合……因為你會希望同時得到兩邊的好處。」而且 PRM 會引入一個決策閾值——每個系統都需要調整的新超參數。
- **PRM 的作弊是訓練時的問題,不是推論時的問題。**有人問 PRM 如何避免獎勵略過過程、直接跳到「x = 14」的解答。只要你僅用 PRM 來評分,生成器就不會受它影響,仍可要求它逐步推理。當你用 PRM 微調生成器時,才會出現這種失敗模式——「模型會有點停止推理,只生成 PRM 喜歡的最終答案。」這正是獎勵駭客行為,講師在描述一篇確實如此做的論文前一張投影片,精確地點出這個名稱。她提出的防範方式是,人工步驟標籤會懲罰被略過的步驟——但第 3 節會看到,這種防範會消失。
- **PRM 會看到先前的步驟。**它會根據問題與之前的步驟,評估目前的步驟;如此一來,「這個步驟跳過了推理」才有辦法表達。
3. 移除人工標註(Math-Shepherd,2024)#
Math-Shepherd: Verify and Reinforce LLMs Step-by-Step Without Human Annotations. PRM 勝過 ORM;PRM 標籤需要人工成本;因此,我們可以用機械方式定義步驟標籤。
定義:推理步驟的品質,是該步驟有可能導向正確最終答案。從給定步驟開始,抽樣 n 條後續推理並完成解答,再以已知的最終答案核對。
- 硬估計 — 只要任一條後續推理得出正確答案,就將此步驟標為成功。
- 軟估計 — 以後續推理中得出正確答案的比例作為標籤。
若 n = 3 且三條後續推理有兩條正確,硬估計 = 1,軟估計 = 2/3。生成的 PRM 有兩種用途:作為測試時選擇器(抽樣候選解答,再選 PRM 分數最高者),以及作為獎勵模型,用來透過 RL 微調生成器。
硬估計與軟估計的比較結果:隨著 n 增加,軟估計看起來較好;但無論如何,最佳結果都是在 n = 4 時取得,因此兩種選擇差異不大,最後採用硬估計,因為計算較簡單。
結果:在 GSM8K 和 MATH-500 上,三個介於 34B–70B 的開放模型皆勝過自我一致性(多數決投票)與 ORM 基線(逐字稿中可辨識 Llama 70B 和 DeepSeek 67B;第三個名稱因 ASR 雜訊而無法辨讀)。它在 MATH 上也勝過以 PRM800K 訓練的驗證器——這是較難的基準,差距也更大——此為論文的核心主張:不需人工標註的步驟標籤勝過 80 萬筆人工標註。此外,使用模型自己的 Math-Shepherd PRM 對 Mistral 7B 執行 RL,勝過以 ORM 執行 RL;再於經 RL 訓練的模型上加上驗證,結果更好。不過「他們的最佳化在某個時間點就停滯了」,而 RL 帶來的提升小於測試時擴展的提升。
Mirhoseini 說明此研究為何適合放在自我改進課程中:「你讓模型自己產生標註,訓練 PRM,然後用 PRM 改善生成器」——這是帶有獎勵訊號的Recursive Self-Improvement,連獎勵訊號本身也由系統內部製造,而不只是推理軌跡。
弔詭之處:自動化推翻了監督原本的理由#
課堂提出三項缺點,Mirhoseini 也都予以確認:
- **小型 n 會懲罰不尋常的正確推理路徑。**只有沿著罕見路徑才有用的步驟,需要很大的 n 才能被看見;若 n = 3,它的分數就是零。這是涵蓋率長尾問題(潛在能力餘裕)轉移到了標註流程——現在標註者也有了與選擇器相同的盲點。
- **困難題目完全沒有訊號。**如果從任何步驟開始的 rollout 都無法得到正確答案,每個步驟的分數都是零,該題也就毫無貢獻。最缺乏標籤的,正是最需要標籤的地方。
- **第三點,也為整段脈絡畫下句點。**如果一條推理軌跡經過錯誤的中間步驟卻得到正確答案,該步驟就會被標為正向。Mirhoseini 說:「希望你有更多樣本時,其中一條軌跡會顯示出錯誤之處,但無法保證。」
第三點是整段發展的點睛之筆。第 2 節指出,過程監督的理由是避免結果監督獎勵那些透過幻覺鏈得出正確答案的解答。Math-Shepherd 的步驟標籤,定義上就是看該步驟是否能導向正確答案。為過程監督提供理由的假陽性,正是自動化重新引入的標籤雜訊——增加 rollout 數量可以限制它,卻無法消除它。課堂清楚說明了這兩面,卻從未將它們並列;本文補上了這層解讀。
實際後果是,「PRM」這個名稱指稱兩種差異很大的對象——由人類認可的過程判斷,以及對結果可達性的蒙地卡羅估計——兩者介面相同,語義卻不同。第二種 PRM 是經過變異數縮減與較佳信用分配的 ORM,而不是檢查解題過程的工具。
她提出的解套方法#
有人問 PRM 能否設計成獎勵自我修正,她的回答超越了問題本身,也銜接至第 3 講的第四篇論文:讓步驟判斷納入 rollout 無法提供的更多訊號。用提供給判斷者的評分規準來評估步驟;讓判斷者使用工具——例如對步驟中的方程式執行計算機或 CAS;並將測試時擴展與代理式迴圈用在驗證本身。「有一些方法能帶來更多監督與更多訊號……來改善驗證流程。」每種做法都能針對同一個步驟提供不同種類的弱訊號,這正是弱驗證器集成採用的前提。
4. 驗證驗證器(DeepSeek-Math V2,2025 年底)#
課程的最後一講(CS329A Self-Improving AI Agents — Part 9: Future Research Areas、Aakanksha Chowdhery,於 2025-12-05 授課、2026-08-03 發布,practitioner-opinion)回到這段發展脈絡,提出上述弔詭所暗示的新階段:若問題在於驗證器的判斷未受檢驗,那就檢查判斷本身,而非分數。
此處的場景是定理證明,也是最難為 ORM 辯護的場景。最終答案比對無法證明任何證明過程正確——「即使答案正確,推理過程也可能不正確」——而嚴謹的逐步推導就是整個產出。講師說明 LLM-as-a-judge 為何在此失敗,講得具體而值得保留:經過量化推理訓練的模型會生成數學上無效的證明,接著又認證它們有效;相較之下,專家閱讀同一份證明時,不用參照解答也能指出*「下一步並非從上一步推導而來」*。因此,要蒸餾的人類能力是不依賴參考答案找出問題,而不是評分。
課堂介紹的架構,只在熟悉的生成器/驗證器組合上增加一個區塊:
| 區塊 | 輸入 | 輸出 |
|---|---|---|
| 生成器 | 問題 | 證明 |
| 驗證器(LLM 判斷者) | 證明,沒有參考解答 | 找出的問題 + 分數(課堂說分數範圍是 0.5–1,可能是 ASR 將 0–1 或 0/0.5/1 評分規準辨識錯誤,本文不採用此數值) |
| 元驗證器 | 驗證器的分析 | 找出的問題真的存在嗎?分數是否能由這些問題推導而來? |
以人工標註的證明問題作為起始資料後,這個迴圈接著會自動產生自己的標籤:元驗證器學會評分分析後,人類就不再是問題標籤的來源。驗證器改善生成器,生成器產出更難的證明,而更難的證明又改善驗證器。此方法以 DeepSeek-V3 基礎模型為基礎,並以 GRPO(Group Relative Policy Optimization (GRPO))作為 RL 基礎架構。
**元驗證器真正要處理的是捏造的批評。**Mirhoseini 表示,驗證器「推理鏈錯誤時,也可能給出正確分數……它們可能會捏造錯誤」,這是在第 2 節將假陽性論點往上一層套用。第 2 節指出,結果標籤會獎勵推理鏈錯誤的解答;第 4 節則指出,批評的判斷可能正確,理由卻是編造出來的。兩者的工具形狀相同(監督過程,而非結論),但目標從解答的推理,轉移到了驗證器的推理。
課堂介紹的結果,也是本文唯一採用的數字:迴圈執行八次迭代,證明分數的 pass@1 單調上升;在 IMO 2024 shortlist 的 best-of-32 設定下,證明分數約為 42%。課堂也提到 CMO 題目。資料是透過 ASR 辨識投影片內容,請將 42% 視為近似值,並歸因於課堂。講師指出,這是開放原始碼版本,對照的是本學期稍早另一位客座講師介紹的封閉 Gemini 結果。
為什麼這部分放在本文,而不放在弱驗證器集成。Weaver 對不可靠驗證器的解法是加權使用更多驗證器;此處則是監督單一驗證器。兩者是同一缺陷的兩種可行解法,彼此相輔相成,而非互相競爭——元驗證器完全可以評分集成中的每個成員,只是本文來源沒有嘗試這種做法。講師提出將方法泛化至其他領域的三步檢查表:讓 LLM 驗證器在沒有參考解答的情況下找出問題;加入元驗證區塊,抑制捏造出的問題;再讓生成器有誘因透過刻意推理提升品質。她對這套方法的限制,也正是整段發展反覆遇到的限制——它仍「受限於驗證相對困難的領域」,也就是迴圈能在證明可以被討論之處閉合,卻無法在獎勵要等上一週才到來之處閉合(可驗證性論點)。
課堂留下的運算資源分配問題#
不論是未經提示提及,還是接受提問後回答,同一個問題都懸而未決:**在固定運算預算下,生成器與驗證器之間應如何分配資源?**要多抽樣幾個解答,還是把每個解答評得更仔細?Mirhoseini 沒有答案,並將此列為課程專題。她也說明了任何研究者都需要遵循的方法前提:「通常 ORM 和 PRM 應來自同一份資料,才能公平地比較兩者」——這是運算量受控的基準測試從獎勵模型一側提出的要求,而本文討論的三篇論文都沒有完全符合。
相關文章#
-
可驗證性論點 — 本文介紹的是其驗證器階梯的第 4 級,也是在此處,「模型評分」不再只是單一類別。約 400 個樣本後精確率下降,這是生成與驗證落差中另一個獨立部分,與共識式盲點並存
-
弱驗證器集成 — 第 3 講的第四篇論文,以及後續提出的做法:不要訓練更好的驗證器,而是把現有的不完美驗證器結合起來。PRM 和 ORM 是其集成的三種驗證器類別中的兩種。這是同一缺陷的另一種解法,也是第 4 節做法的互補方案:加權整合多個驗證器,對比監督單一驗證器——本文沒有將兩者結合
-
Group Relative Policy Optimization (GRPO) — 第 4 節迴圈所用的 RL 基礎架構:DeepSeek-Math V2 以 DeepSeek-V3 為基礎,搭配 GRPO;經元驗證的驗證器分數則取代結果獎勵
-
看似成功的失敗 — 過程監督希望抓出的假陽性,在代理程式一側的案例;Math-Shepherd 的弔詭之處,是同一種失敗經由標註者再次進入系統
-
獎勵駭客行為 — 講師親自說明這條界線:只用 PRM 來評分,生成器便無法鑽漏洞;把 PRM 當作RL 獎勵,生成器就可能跳過它原本要評價的推理
-
在有雜訊的驗證器下停止 — 上述分數退化的控制理論說明:雜訊驗證器的接受率可能持續上升,但它接受的結果卻越來越差;解法是停止規則,而非更好的驗證器
-
長時程代理程式失敗特徵 — 課堂脈絡之外,另一個獨立提出的第五級:Scout 是以 SFT 針對黃金答案條件式鏈式思考訓練的 4B 驗證器,再以專門設計用來對抗「全部標為正確」這種退化策略的獎勵進行 GRPO;第 2 節預測的過度標記失敗正是它要處理的問題。它在步驟層級失敗定位上勝過六個大得多的前沿判斷模型,且能遷移至未見過的領域——與 Math-Shepherd 和 DeepSeek-Math V2 呈現相同的「小型訓練式驗證器勝過大型判斷模型」模式,但處理的是長時程代理程式軌跡,而非數學
-
Turn-Level Credit Assignment — 2026 年的後續研究,明確以本文介紹的所有方法作為對照:以凍結的參考模型預測黃金答案的可預測性,進行密集的逐回合信用分配,不使用步驟標籤、判斷者或訓練式 PRM。它回答了「步驟標籤成本高」這個問題,卻不依賴結果可達性,因此不會繼承第 3 節的弔詭
-
潛在能力餘裕 — 這些選擇器試圖轉化為準確率的涵蓋率,以及據報 PRM 能觸及、多數決投票卻無能為力的少見正確答案情境
-
LLM-as-a-Judge — 未經訓練的同類做法:提示式判斷者是課堂提到的零成本 PRM,只要「請 LLM 評估一個步驟」就能取得,也是 PRM800K 的自舉起點
-
Inference-Time Architecture Search — Archon 的驗證器與單元測試評估器運作,正是將這些模型當作可組合的層,而非最終選擇器
-
Large-Scale Test-Time Compute — 本文談的是其中的選擇器旋鈕,以及選擇器施加的上限:只有在驗證器仍能區分候選答案時,增加抽樣才有用
-
運算量受控的基準測試 — 課堂提出卻沒有回答的生成器與驗證器預算分配問題
-
Azalia Mirhoseini — 授課講師;驗證是她的實驗室致力處理的瓶頸
-
CS329A: Self-Improving AI Agents (Stanford) — 課程第 3 講,也就是驗證專題講座
-
Execution Feedback 的 RL(RLEF) — 完全依賴結果獎勵、沒有學得的驗證器:隱藏測試套件回傳一個位元,這正是本文整段研究討論存在的原因,因為通常無法取得這種測試套件。CS329A 第 4 講沒有回答過程監督是否勝過它,而是明確將問題交由本文所述的辯論處理
-
在代理程式軌跡上進行樹狀搜尋(LATS) — 講師親自提出的對照:Math-Shepherd 的訓練式驗證器評分推理步驟並引導搜尋;LATS 評分的是執行動作後抵達的世界狀態,用的是提示式 0–1 判斷者加上樣本頻率項,而非訓練式 PRM
-
推理軌跡自舉(STaR) — 同一種假陽性,早四年出現,而且完全沒有評估工具:STaR 以抵達正確答案的推理鏈進行訓練,而其合理化步驟則以已提供答案所生成、且從未過濾的推理鏈進行訓練。課堂提出的修正方式正是用 PRM 評估該步驟——也就是本文主題,作為補丁套用在比它更早的方法上
-
離線多步驟工具使用 RL(SWiRL) — 以提示式判斷者評估提議的工具呼叫,建立過程監督;也為這段發展帶來新資料點:經過過程篩選的訓練資料,在 RL 上勝過經結果篩選的資料;但在 SFT 上順序反轉,因為結果篩選只保留模型已能解決的題目
-
在提交預算下進行選擇 — 將結果獎勵模型僅作為測試時選擇器使用:AlphaCode 2 的評分模型估計正確性在 [0, 1] 之間,並在行為群集內重新排序。它也指出本文研究未明說的一項訓練限制——評分器需要使用符合生成器題目分布的資料,而且不能看到相同題目,因為資料汙染與遺忘會將影響推向相反方向
-
型別化決策驗證器 — 本文發展脈絡在實際市場上的案例。跨供應商共享基準以同一組 2,018 筆測試資料評估 13 個訓練式或提示式答案驗證器(包括重現版本與參考 LLM 判斷者):前兩名在統計上打成平手,表面特徵基線勝過 13 個系統中的 8 個,而同一模型家族內的規模大小與表現並非單調關係——這呼應了本文「候選答案超過數百個後精確率下降」以及「較大的生成器搭配較小的驗證器」兩項發現,只是切入面向不同(跨供應商比較,而非候選數量擴展)
開放問題#
- 在固定的推論預算下,生成器樣本數與驗證器運算量的最佳分配為何?這個答案是否會隨問題難度改變,如同順序與平行執行比例的變化?課堂將其列為開放專題。
- 以蒙地卡羅方式標註的 PRM(Math-Shepherd 風格),是否真的保留了過程監督相較於 ORM 的假陽性優勢,還是只保留信用分配優勢?課堂主張人工標註 PRM 有此優勢,同時承認其標籤雜訊;本文來源中沒有研究將兩者分開測量。
- 在現代模型中,較大的生成器搭配較小驗證器的非對稱配置仍然成立嗎?現代模型有充足的現成獎勵模型,而生成器的能力也遠勝當年測量這項結果的 2021 年模型組合。
資料來源#
- CS329A Self-Improving AI Agents — Part 3: Robust Verification — Stanford CS329A 第 3 講,Azalia Mirhoseini(於 2025-09-29 授課、2026-08-03 發布,
practitioner-opinion,YouTube 自動字幕逐字稿,約 10,700 字)。涵蓋四篇中的前三篇論文:Training Verifiers to Solve Math Word Problems(OpenAI 2021、GSM8K)、Let's Verify Step by Step(OpenAI 2023、PRM800K)、Math-Shepherd(2024)。用於說明訓練方法、雙損失/純量預測頭架構、逐句與逐 token 消融實驗、約 400 個樣本後精確率下降、生成器/驗證器大小的非對稱性、過程監督避免假陽性的論點、PRM800K 的主動選取技巧、ORM/PRM/多數決投票的排序及泛化結果、Math-Shepherd 的硬/軟估計與確認的三項缺點,以及學生提問中對 PRM 作弊與運算預算分配的討論。raw/中沒有收錄這三篇論文——所有數字都透過 ASR 從投影片讀取,皆為約略值,應歸因於課堂而非論文。兩處逐字稿缺陷已於相關段落標明:「convincing wrong answers」的描述前後矛盾(見第 2 節),以及 Math-Shepherd 基線表格中的第三個模型名稱無法辨識。practitioner-opinion,但只有對第 4 篇論文有全面 COI(見弱驗證器集成);前三篇出自其他研究團隊 - CS329A Self-Improving AI Agents — Part 9: Future Research Areas — Stanford CS329A 第 9 講,Future Research Areas(兩位授課者,於 2025-12-05 授課、2026-08-03 發布,
practitioner-opinion,自動字幕逐字稿,約 10,500 字)。涵蓋上方第 4 節:定理證明情境與結果比對在此為何毫無證明力、LLM 判斷者的失敗模式(模型會生成無效證明並驗證為有效)、要蒸餾的人類能力(不依賴參考解答找出問題)、生成器/驗證器/元驗證器架構及其兩個元問題、先以人工標註作起始資料再進入自動標註的迴圈、DeepSeek-V3 + GRPO 基礎架構、八次迭代下 pass@1 上升,以及 IMO 2024 shortlist 的 best-of-32 約 42% 數字,和三步泛化方法。raw/中沒有收錄此論文;所有數字皆為透過 ASR 從投影片讀取。逐字稿的兩處缺陷已於相關段落標明:驗證器分數範圍辨識為「0.5 and 1」,以及「once you seed the data … you can automate that kind of labeling」是唯一說明如何消除人工標註瓶頸的內容。沒有講師與該論文的作者關係衝突——該論文出自 DeepSeek - Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set — Proto_AGI(
mayafree),HuggingFace 社群文章,於 2026-09-20 發布,empirical。僅用於相關文章段落:涵蓋 13 個系統的跨供應商答案驗證器基準測試,與本文的精確率下降及生成器/驗證器大小發現,在不同面向上互相呼應。完整討論見型別化決策驗證器
Cited by 24
- The Verifiability Thesis×4
cs329a 03 robust verification — Stanford CS329A lecture 3 (Azalia Mirhoseini, delivered 2025-09-29,…
- CS329A: Self-Improving AI Agents (Stanford)×3
Process Vs Outcome Reward Models — lecture 3's first three papers: the 2021→2024 arc from outcome…
- Large-Scale Test-Time Compute×3
cs329a 03 robust verification — Stanford CS329A lecture 3 (Azalia Mirhoseini, delivered 2025-09-29,…
- Offline Multi-Step Tool-Use RL (SWiRL)×3
Process Vs Outcome Reward Models — SWiRL's per-step judge is process supervision with a prompt in…
- Weak-Verifier Ensembling×3
Process Vs Outcome Reward Models — the three papers Weaver stops iterating on; ORMs and PRMs are…
- Aakanksha Chowdhery×2
Verifiers are unreliable and can invent their errors · DeepSeek-Math V2 — Process Vs Outcome Reward…
- Tree Search over Agent Trajectories (LATS)×2
Process Vs Outcome Reward Models — the verifier lineage LATS defines itself against: Math-Shepherd…
- RL from Execution Feedback (RLEF)×2
Process Vs Outcome Reward Models — RLEF is a pure outcome reward (tests pass or don't) with no step…
- Rationale Bootstrapping (STaR)×2
The second row is the one the classroom pushed hardest on, and the answer was a concession plus a…
- Selection Under a Submission Budget×2
The scoring model is a fine-tuned Gemini Pro that estimates the probability a sample is correct, in…
- Azalia Mirhoseini
Process Vs Outcome Reward Models — the four-year verifier literature she teaches Weaver as the…
- Compute-Controlled Benchmarking
Process Vs Outcome Reward Models — the same demand arriving from the reward-modelling side, stated…
- Failures That Look Like Success
Process Vs Outcome Reward Models — this failure class as a training-data defect rather than a…
- Group Relative Policy Optimization (GRPO)
Process Vs Outcome Reward Models — where GRPO shows up as a substrate rather than a subject:…
- Inference-Time Architecture Search
Process Vs Outcome Reward Models — what the verifier and unit-test-evaluator operations are made…
- Latent Capability Overhang
Process Vs Outcome Reward Models — the selectors trying to convert this coverage into accuracy, and…
- LLM-as-a-Judge
Process Vs Outcome Reward Models — the trained siblings: an outcome or process reward model is a…
- Long-Horizon Agent Failure Signature
Process Vs Outcome Reward Models — Scout is a small trained step-level verifier that beats much…
- Model Capability & Training
Process Vs Outcome Reward Models — The four-year arc of trained LLM verifiers as taught in CS329A…
- Open Questions Backlog
Process Vs Outcome Reward Models ×3 (oldest 43d) — Under a fixed inference budget, what is the…
- Reward Hacking
Process Vs Outcome Reward Models — the boundary stated by a lecturer one slide before describing a…
- Stopping Under a Noisy Verifier
Process Vs Outcome Reward Models — the same shape observed a decade earlier and left undiagnosed:…
- Turn-Level Credit Assignment
Process Vs Outcome Reward Models — the lineage TRACE defines itself against, and why the…
- Typed Decision Verifiers
Process Vs Outcome Reward Models — the historical arc of trained answer/outcome verifiers this…
Related articles
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Weak-Verifier Ensembling
Weaver (Stanford, 2025): stop training a better verifier and combine the imperfect ones you have — normalize a heteroge…
- The Verifiability Thesis
LLMs automate what you can *verify* as computers automate what you can *specify*; RL verification rewards → jagged peak…
- Inference-Time Architecture Search
Archon (Mirhoseini's lab, 2024): treat test-time scaling as an architecture-design problem — search over layered pipeli…
