資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview
- CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling
- CS329A Self-Improving AI Agents — Part 3: Robust Verification
- CS329A Self-Improving AI Agents — Part 5: Planning and Multi-Step Reasoning
- CS329A Self-Improving AI Agents — Part 9: Future Research Areas
摘要#
Azalia Mirhoseini 是 Stanford CS 系的助理教授,也是 CS329A: Self-Improving AI Agents 的共同授課教師。她在 Stanford 任職前的經歷依序是:Google Brain,接著是 Anthropic(參與 Claude)與 Google DeepMind(參與 Gemini);她也是 Anthropic Constitutional AI 論文(Bai 等人,2022)的共同作者,該論文列於此處多個來源的參考文獻中。
在這個知識庫裡,她的名字出現兩次:一次是講授 CS329A 推論擴展部分的講者;而更早、也更常出現的,是其他來源在引用「重複取樣」時所援引論文的資深作者。
Large Language Monkeys,以及它為何不斷被引用#
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling(Brown、Juravsky、Ehrlich、Clark、Le、Ré 與 Mirhoseini,arXiv 2407.21787,2024)是她在課堂上視為推論時擴展起點的實驗室成果:對固定模型多次取樣,再用驗證器或選擇器從樣本中挑選;而涵蓋率——至少有一個樣本解出的問題比例——會隨樣本數以對數線性方式持續攀升,直到 10,000 個樣本。她在課堂上的說法點出其意涵:「模型『其實已經知道的遠比你只問一次時所能得到的多得多。』」本知識庫在潛在能力餘裕頁面收錄了這項結果及其數據。
此論文也列於此處至少四個其他來源的參考文獻中(Rethinking the Evaluation of Harness Evolution for Agents、SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery、Life After Benchmark Saturation: A Case Study of CORE-Bench、Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution)。這正是這個頁面存在的實際原因:在這個人名有專頁之前,這個引用就已經是整個文獻庫中的關鍵支柱。CodeMonkeys(Ehrlich、Brown、Juravsky、Clark、Ré 與 Mirhoseini,arXiv 2501.14723,2025)是她在課堂上提到的軟體工程續篇——讓模型為自己生成的程式碼產生單元測試,再用測試作為選擇器,由可驗證性來閉合自身迴路。
實驗室的其他研究脈絡:Archon 與 AI 作為編譯器#
第二講在上述 Monkeys 研究脈絡之外,又介紹了她實驗室的兩個方向。
Archon(推論時架構搜尋)是第三步:既然已確立取樣能帶來選擇器無法完全掌握的涵蓋率,就把整個推論流程視為一種架構,並對它進行搜尋。它的 ITAS 最佳化器會在推論呼叫預算內,組合多個模型池中的生成/融合/評論/排序/驗證/單元測試操作,並報告開源堆疊平均 pass@1 超越 GPT-4o 與 Claude 3.5 Sonnet 14.1%。她強調的結果是融合勝過預言機選擇——這是她研究脈絡中唯一繞過驗證瓶頸,而非試圖突破它的方法。課程助教是共同作者。
AI 作為編譯器是她說自己最感興趣的方向:將高階來源程式(PyTorch)轉成能考慮硬體的低階程式碼(CUDA),而驗證成本為零,因為可以在任意輸入上比較輸出。KernelBench 是其基準測試;和其他領域一樣,這裡的涵蓋率也會隨樣本數增加而提升。這個概念可推廣到任何語言到語言的轉換,因為參考實作本身就是驗證器——參見可驗證性論點與LLM-as-Compiler Knowledge Base。
Weaver——弱監督驗證器集成——是實驗室對她下文所述瓶頸的解方:不是用數千個驗證器,而是「10 或 20 個」,在弱監督下組合,並坦承這「從運算角度來看成本非常高」。第二講預告了這項工作,第三講則正式介紹,並列為第四篇、也是最後一篇論文。做法是對異質的 ORMs、PRMs 與 LLM 評審組成的池進行評分 → 加權 → 選擇,設下品質底線以排除弱成員,並以約 1% 的標籤資料為各驗證器擬合權重;報告結果顯示,開放權重堆疊可達到與 o3-mini 相當的表現,後續工作再將整個池蒸餾成約 400M 的評分器,保留約 97% 的準確率。完整討論(包括本知識庫的 empirical 評審測量結果所反駁的獨立性假設)見弱驗證器集成。利益衝突狀況相同:她是自己所教這項研究的資深作者。
規劃研究線:SPRINT 與 SWiRL#
第五講又介紹了實驗室的兩篇論文;它們是這個系列中首批完全不以驗證為主題的研究。兩者建立訓練資料的方式相同——讓一個模型為另一個模型的軌跡加上註解,再用這些註解訓練模型——而且報告了類似的泛化結果,她明確指出這是跨專案的共同模式。
SPRINT(軌跡內平行規劃(SPRINT))取用 DeepSeek-R1 推理軌跡,讓 GPT-4o 將它們切分成步驟,並標記每個步驟的計畫與執行片段,推斷依賴 DAG,將彼此獨立的步驟重新打包成並行回合,再以結果對 7B 蒸餾模型進行監督式微調,讓它能同時輸出互相獨立的計畫。報告結果包括:額外提升了原本並非目標的約 3.5 個準確率點、使用的循序 token 少於 32B 模型,以及從數學任務遷移到 countdown 和 GPQA-diamond。
SWiRL(離線多步驟工具使用 RL(SWiRL),講座當時是 COLM 2025 預告)訓練多步驟工具使用,將所有工具呼叫都移出 RL 迴圈:透過反覆提示離線生成軌跡,讓 LLM 評審為每個提議的動作打分——評估的是查詢,絕不是結果——並在凍結的上下文中最佳化每步的期望獎勵。它提出的兩項可遷移發現是:RL 與 SFT 在過程和結果篩選上的反轉現象,以及跨工具遷移(搭配計算機的 GSM8K 能提升搭配搜尋引擎的 HotpotQA 表現)。
揭露模式。 她以第一人稱完整敘述這兩項研究——「我們開始這個專案時」、「我們不需要把 LLM 訓練成評審」——讓聽講者一聽便知道作者身分,讀投影片的人卻看不到明確說明。這和第二講介紹 Archon 的情形相同;第三講介紹 Weaver 時,她則有明確說明。
效率研究線:每瓦智能(第 9 講)#
她在課程最後一講的部分(2025-12-05 發表,與他人共同主講)是整個系列中唯一不討論能力的內容,也是她在驗證與規劃之外,於此介紹的第三條研究線。這項研究由她與 Stanford 的 Christopher Ré 及 John Hennessy 合作,提出一項指標——每瓦智能 = 平均任務準確率 ÷ 平均功耗——及支撐該指標的研究:超過 20 個模型,≤20B 個啟用參數,企業級與消費級加速器,約 1M 筆聊天和推理查詢,並將所有內容開源。課堂介紹的重點是:自 2023 年以來,本地模型的涵蓋率提升 3.1×;Apple M4 Max 的每瓦智能約低 1.5×,相較於 B200;而這項指標在兩年間提升 5.3×,可分解為 3.1× 模型 × 1.7× 硬體。完整討論(包括以本知識庫 2026 年來源評估的前瞻性主張)見推論效率即能力。
背後的論點關乎模型路由:目前幾乎所有推論都交由雲端加速器處理,多數單輪查詢不需要前沿模型,而消費級記憶體容量已足以容納量化模型;因此,她提出的發展方向是依查詢複雜度分流的本地/雲端混合服務引擎,以及節能架構與核心程式,並稱能源是「我們未來最有價值的資源」。
她也提到實驗室的推論系統研究——Hydragen 與 Tokasaurus——作為基礎設施方向的押注:測試時擴展在結構上屬於吞吐量與延遲工作負載,有別於單輪聊天,因此需要專屬的服務最佳化;而且「未來這些技術會愈來愈重要」。
揭露情況,這是整個系列中她做得最好的一次。 她介紹指標研究時說:「我們最近和 Ré 教授及 John Hennessy 教授合作做了一項研究」,介紹系統研究時則說:「我的實驗室做了其中一些工作」——直接點出作者身分,而不是像第二講介紹 Archon、第五講介紹 SPRINT/SWiRL 時只用代名詞。這項差異反映了研究的呈現方式:談到目前實驗室的工作時會點名;在綜述中當作典型引用介紹的研究,則只用代名詞。仍有一處情形相反:她在這一講把 SWiRL 當課程材料來談(「我們讀過 SWiRL」),沒有再次說明那是她的研究。
她在課堂上表達的立場(2025 年底,practitioner-opinion)#
- 驗證是這個領域的瓶頸。 她的實驗室有一篇結合驗證器的論文;她認為「穩健驗證很難」,這正是自我改進飛輪無法無止盡運轉的原因。
- 模型偏好自己的軌跡。「即使軌跡來自更好的模型,它們往往還是更喜歡自己生成的軌跡」——她將此作為觀察提出,沒有附上引用。參見Same-Model Review Blindness的說明。
- 溫度有實用上限。 超過約 1.2 後,讓重複取樣奏效的多樣性就會變成胡言亂語;要再提高多樣性,就得用其他技巧。
- 她最後點出的缺口是持續學習。 人類解決問題時會愈來愈熟練;模型則先取得一批離線軌跡,之後某個時間點再進行微調。「能學會新技能嗎?能學會如何學習嗎?這是一種重要能力,而我們基本上目前還沒有。」她描述理想化解法的方式值得保留,因為它也說明了替代方案的代價:無限且完美的上下文就等同於持續學習;但它之所以不是答案,是因為上下文資料中的推理品質,早在上下文視窗用盡之前就會衰退,即使視窗「有一百萬,甚至幾百萬」。她提出 Cartridges(Ré 的實驗室)作為中間方案——把學習放進 KV 快取,而不是權重。
- 但在技能遷移上,權重勝過記憶儲存。 被問到實務上更新權重和更新記憶儲存哪個比較容易時,她承認記憶對知識來說比較容易——「最簡單、最天真的做法,就是建一個 LLM 可以學著去看的資料庫」——然後劃出界線:通常想教的是在新領域進行推理,而且「額外的記憶系統不太能做到這一點」。她舉的例子是機器人領域跨具身形態的泛化,再多檢索也無法達成。這是少見的明確表述,指出記憶與微調的界線在哪裡,而且出自一位兩者都不從事的研究者。
- 環境是代理指標,而自建環境是容易的那一半。 有學生認為 Absolute Zero 意味著代理程式會自行建立環境;對此她指出,遊戲與玩具任務的模擬環境一直都能建立。現在環境之所以難,是因為它們必須合理地代理真實世界的回饋;至於「用代理程式建立,還是用軟體建立」,並不重要。
- 難度調適取樣當時尚未發表。 有人問能否依問題難度調整樣本數,她與 Chowdhery 回答,當時沒有已發表研究做到這點,只有由獎勵模型引導的後續方法——2026 年的來源後來已填補這項空缺(大規模測試時運算)。
相關連結#
- CS329A: Self-Improving AI Agents (Stanford) — 共同授課教師;推論擴展與驗證兩講由她主講
- 潛在能力餘裕 — Large Language Monkeys 是該頁所述現象在 2024 年的實證先驅
- 大規模測試時運算 — 她的重複取樣研究線是此主題中心的平行取樣分支
- 可驗證性論點 — 她提出的瓶頸;CodeMonkeys 是以驗證器為先的代理程式設計
- 推論時架構搜尋 — Archon,她實驗室研究脈絡中的第三步:搜尋組合式推論架構,以及融合勝過預言機的結果
- 弱驗證器集成 — Weaver,她實驗室的第四步:組合不完美的驗證器,而不是訓練更好的驗證器,並將整個驗證器池蒸餾成小型評分器
- 過程與結果獎勵模型 — 她在課堂上介紹 Weaver 作為後繼工作的四年驗證器研究脈絡
- Aakanksha Chowdhery — 共同授課教師;兩人在 Google Brain 相識,第四講由她主講
- Alignment Fine-Tuning (AFT) — 收錄 Constitutional AI(Bai 等人,2022)的頁面;她的共同授課教師在第四講介紹該研究,卻未揭露彼此的關聯
- 軌跡內平行規劃(SPRINT) — SPRINT,她實驗室在此介紹的第五項研究:透過註解找出推理軌跡中隱藏的 DAG,再將其訓練回 7B 模型
- 離線多步驟工具使用 RL(SWiRL) — SWiRL,她實驗室的第六項研究:將工具移出迴圈的多步驟工具使用 RL,以及 RL 和 SFT 之間的篩選反轉現象
- 代理程式軌跡樹搜尋(LATS) — 第五講中唯一不是她的論文,也是她唯一從結構角度提出批評的論文
- 推論效率即能力 — 她的第三條研究線,也是課程最後的重點:每瓦智能、本地推論論點,以及認為測試時擴展需要專屬服務堆疊的 Hydragen/Tokasaurus 押注
資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview — CS329A 第一講(2025-09-22 發表,2026-08-03 刊出,
practitioner-opinion):她的自我介紹、Large Language Monkeys 的講解與結果、溫度限制,以及對驗證器的立場 - CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling — CS329A 第二講(2025-09-26 發表,2026-08-03 刊出,
practitioner-opinion),由她獨自授課:涵蓋率冪律及其長尾條件、生成與驗證的落差、Archon、AI 作為編譯器/KernelBench 方向,以及驗證器集成的預告。她是此處介紹的所有實驗室成果之共同作者——存在持續的利益衝突 - CS329A Self-Improving AI Agents — Part 5: Planning and Multi-Step Reasoning — CS329A 第五講(2025-10-06 發表,2026-08-03 刊出,
practitioner-opinion),由她獨自講授規劃:LATS、SPRINT 與 SWiRL,後兩者來自她的實驗室,並以第一人稱敘述,沒有明確點名揭露作者身分。也提到 Claude Sonnet 4.5 系統卡中,關於提示模型進行 100+ 次工具呼叫的旁註,以及「基本上所有 LLM 現在本質上都是推理模型」的立場 - CS329A Self-Improving AI Agents — Part 3: Robust Verification — CS329A 第三講(2025-09-29 發表,2026-08-03 刊出,
practitioner-opinion),由她獨自講授驗證:從 OpenAI 的 GSM8K 驗證器到 Weaver 的四篇論文脈絡、她對 PRM 遊戲化只屬訓練時問題的看法、尚未解決的生成器與驗證器預算分配,以及重複取樣應移往訓練時、代價是降低解答多樣性的結尾觀點。第四篇論文存在完全利益衝突——她是資深作者,且有明確說明 - CS329A Self-Improving AI Agents — Part 9: Future Research Areas — CS329A 第九講(2025-12-05 發表,2026-08-03 刊出,
practitioner-opinion;前瞻方向評級為prediction),由多人共同主講:她負責介紹與 Ré 及 Hennessy 合作的每瓦智能研究,包括指標、需求與本地記憶體趨勢、≤20B 啟用參數研究設計、3.1×/1.5×/5.3× 發現,以及模型與硬體的效能拆解;也介紹四個前瞻方向(本地與雲端混合路由、節能架構與核心程式、透過 Hydragen 和 Tokasaurus 建立測試時擴展服務基礎設施,以及能源作為稀缺資源),並在結尾問答討論持續學習、無限上下文、Cartridges、權重與記憶儲存的比較,以及環境作為代理指標。另有不可驗證領域的分類(可驗證性論點)。以姓名揭露利益衝突——是整個系列中最明確的揭露,也是唯一一講中她點名合作研究者,而非只用第一人稱複數;仍有一處遺漏:談到 SWiRL 時將其當作課程教材,未重申作者身分
Cited by 18
- CS329A: Self-Improving AI Agents (Stanford)×10
Lecture 5 (Azalia Mirhoseini solo, delivered 2025-10-06) is the syllabus item lecture 1 promised —…
- The Verifiability Thesis×6
cs329a 03 robust verification — Stanford CS329A lecture 3 (Azalia Mirhoseini, delivered 2025-09-29,…
- Latent Capability Overhang×5
Brown states the overhang in budget terms in 2026. The same claim was already on a slide two years…
- Aakanksha Chowdhery×4
Aakanksha Chowdhery is an adjunct professor at Stanford and co-instructor of CS329A, and works in…
- Inference-Time Architecture Search×4
Azalia Mirhoseini — the lab; Archon is the third result in the Monkeys line after Large Language…
- Large-Scale Test-Time Compute×4
cs329a 03 robust verification — Stanford CS329A lecture 3 (Azalia Mirhoseini, delivered 2025-09-29,…
- Tree Search over Agent Trajectories (LATS)×3
> Evidence. cs329a 05 planning multi step reasoning (Azalia Mirhoseini solo, delivered 2025-10-06,…
- Intra-Trace Parallel Planning (SPRINT)×3
> Evidence. cs329a 05 planning multi step reasoning (Azalia Mirhoseini solo, delivered 2025-10-06,…
- Offline Multi-Step Tool-Use RL (SWiRL)×3
> Evidence. cs329a 05 planning multi step reasoning (Azalia Mirhoseini solo, delivered 2025-10-06,…
- Process vs Outcome Reward Models×3
CS329A lecture 3 (cs329a 03 robust verification, Azalia Mirhoseini, delivered 2025-09-29, published…
- Same-Model Review Blindness×3
Filed here because it is the nearest neighbour and because the signs disagree. Azalia Mirhoseini,…
- Weak-Verifier Ensembling×3
cs329a 03 robust verification — Stanford CS329A lecture 3, Azalia Mirhoseini (delivered 2025-09-29,…
- Inference Efficiency as Capability×2
Every section above measures efficiency in whatever unit its source happened to use — gigabytes,…
- Recursive Self-Improvement×2
A third usage, older than the two above and pointed at a different object. Stanford's CS329A is…
- Agent Loop Pattern
cs329a 01 course overview — Stanford CS329A lecture 1 (Azalia Mirhoseini & Aakanksha Chowdhery,…
- Claude's Constitution / Model Spec
Constitutional AI (Bai et al. 2022) — the originating use of the term: 16 principles as…
- RL from Execution Feedback (RLEF)
The lecture's second discussion question is the one that connects RLEF to real software work: what…
- Entities — People, Orgs, Tools & Projects
Azalia Mirhoseini — Stanford CS assistant professor and co-instructor of CS329A; previously Google…
Related articles
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Process vs Outcome Reward Models
The four-year arc of trained LLM verifiers as taught in CS329A lecture 3: OpenAI's GSM8K verifier (score the finished s…
- Aakanksha Chowdhery
Adjunct professor at Stanford, co-instructor of CS329A, and a researcher at Reflection AI; previously Google Brain, whe…
- The Verifiability Thesis
LLMs automate what you can *verify* as computers automate what you can *specify*; RL verification rewards → jagged peak…
