H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

CS329A:自我改進的 AI Agents(Stanford)

Stanford 的研究所課程,主題為自我改進的代理程式,由 Azalia Mirhoseini 和 Aakanksha Chowdhery 授課(2025 年秋季,2026 年 8 月發布)。核心論點:測試時運算會產生訓練資料,進而改進下一個模型。本文彙整全部九堂已發布的講課,每堂都轉動同一根軸線:1 從 scaling laws 走向 agents;2 覆蓋率冪次定律與生成-驗證落差;3 四年來受訓的驗證器;4 回饋從何而來;5 規劃發生在哪裡;6 訓練時擴展,其中 majority@K 上升而 pass@K 沒有;7 將搜尋作為篩選;8 METR 的指數持續時間曲線對照 GDPval 的線性勝率;9 迴圈尚未解決的三項輸入——推理鏈多樣性、驗證器可靠性、任務選擇——以及每瓦智慧

Article metadata
Publication details
Published:August 17, 2026
Filed:Entity
Domain:Entities
Tags:EntityDocumentCourseTest Time ComputeRecursive Self Improvement
Reading:54 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

CS329A:自我改進的 AI Agents(Stanford)插圖

資料來源#

摘要#

CS329A — Self-Improving AI Agents 是 Stanford 的 CS 研究所課程,由 Azalia Mirhoseini(CS 助理教授)和 Aakanksha Chowdhery(兼任教授;Reflection AI)授課。2025 年秋季班是第二屆;講課自 2025-09-22 起錄製,並於 2026 年 8 月發布到 YouTube,因此其中每項最新技術水準的主張讀起來都比這份 wiki 的其餘內容落後一年。整個系列應視為截至 2025 年底的 practitioner-opinion——可作為了解 2026 年本文來源之前領域面貌的定時基準,也是課堂層級的論點陳述,而 wiki 其他地方只以研究論文形式呈現這些論點。

這門課對「為何它是一門課,而非 LLM 概論」的定位是:聊天機器人和推理模型仍是單輪互動——「它們互動起來很有趣,但不一定真的替你完成任務」——而 agents 能把目標到完成工作的整個迴圈接起來。講師明確點出的自我改進部分,是這個飛輪:測試時擴展產生經過驗證的軌跡,這些軌跡成為微調資料,改進後的模型又能在測試時進一步擴展。「模型透過測試時擴展,再把結果帶回訓練流程,能變得多好,並沒有界限。」

第一講的脈絡#

第一講以六個步驟,快速回顧領域如何走到 agents:

  1. Scaling laws——測試損失會隨運算量、資料和參數量平順下降;參數規模曲線從 BERT(340M)→ GPT-2(1.5B)→ GPT-3(175B)→ PaLM(540B)→ GPT-4(「估計……數兆」),但須注意,純粹擴大參數「大約在 2024 年開始碰到某種飽和點」。
  2. 少樣本與湧現——零樣本/少樣本提示免去每項任務都要微調;某些能力(模組化算術、單字重組)只會在超過某個規模門檻後出現,而不是平順地逐步提升。
  3. 思維鏈——典型的湧現行為,也是講師所說「直到今天仍然成立」的現象:低於規模門檻時,示範推理過程對 LaMDA/GPT/PaLM 毫無幫助;高於門檻後則有所助益。(逐字稿中的具體參數門檻受 ASR 轉錄錯誤影響,因此此處不引用。)
  4. ChatGPT 真正的差異——不是規模,而是後訓練流程:高品質資料 SFT → 指令微調(人類範本加上合成資料,包括思維鏈微調)→ RLHF,以根據人類偏好配對資料訓練的獎勵模型取代迴圈中的人類,並可拆解為加權軸線(正確性、助益性、具體性、無害性)。參見 Alignment Fine-Tuning (AFT)。ChatGPT 於 2022 年 11 月推出,5 天內達到 100 萬名使用者。
  5. 推論作為第三條前沿——Mirhoseini 的 Large Language Monkeys 結果(Latent Capability Overhang),接著是 o1/DeepSeek 將取樣覆蓋率轉成 pass@1(Large-Scale Test-Time Compute)。
  6. 從聊天機器人到 agents——目標 → 計畫 → 在環境中行動 → 讀取回饋 → 修正 → 停止(或回報失敗),再加上工具與記憶。具名的工作流程模式,幾乎就是 Anthropic 的 Building Effective Agents 分類:提示串接、路由、平行化與彙整、協調器與工作者、評估器/裁判、驗證器。

課程指出的方向(2025 年底)#

以下三項主張應視為時間標記,而非當下事實:

  • 靜態圖,而非開放迴圈。「在大多數情境裡,工作流程仍然非常靜態……對開放式問題來說,手動建構一張模仿人類做法的圖會比較容易。」開放式 agent 迴圈只是「初見成效」,而且僅限於程式碼和深度研究。這就是 Agent Loop Pattern 和 Agentic Loops Overtake Bespoke Systems 所記錄領域正在離開的先前狀態。
  • **Coding agents 才剛變得可靠。**終端迴圈式 coding agent「去年還不太可靠,現在才剛開始變得可靠」——原因是模型能力更強,加上有可驗證獎勵的 RL,而非新架構。「我認為整個典範基本上還是一樣的。」
  • Agents 接下來需要的能力:規劃、多步推理、自我修正——也正是這門課的課綱。

課程對價值落點的押注是:重複且可驗證的工作——程式碼遷移、版本升級、重構、資料工程與倉儲遷移、單元測試——以及客戶支援(轉錄、知識輔助、智慧回覆、通話摘要)和長篇報告生成;更具前瞻性的案例則是 AI 作為科學家(點子生成、實驗迭代、論文撰寫)。談到科學案例中的幻覺,講師提出少見的觀點:點子生成是一項能從廣泛且部分不可靠的提案分布獲益的任務,「跳脫框架越遠」正是目的。可對照 Autonomous Scientific Discovery 和 Research Taste as the Human Bottleneck。

第二講的脈絡:測試時運算擴展#

第二講(由 Azalia Mirhoseini 單獨授課,2025-09-26 發表)深入說明上述第五個步驟,分成三幕——每一幕談一篇論文,探討的都是同一個問題。

  1. **Large Language Monkeys,形式化說明。**重複取樣不只是觀察到的現象,也遵循擴展定律:跨模型家族與四個數量級的參數規模,覆蓋率相對於樣本數呈現冪次定律。接著,這堂課說明其機制——只有在基準測試包含一條長尾難題分布時,這項定律才成立——以及其結果:運算資源正從預訓練移往推論,可在離線情境中不斷投入。詳見 Latent Capability Overhang。
  2. **量化生成-驗證落差。**多數決在 10–50 個樣本時便停滯,但覆蓋率仍持續攀升;獎勵模型排序器幾乎無法縮小差距;基準測試越難,落差越大。其機制在於,最難解出的題目每 10,000 次只解出 1–3 次,因此任何根據頻率選答案的機制,都會在結構上看不見最值得找出的答案。詳見 The Verifiability Thesis。
  3. **建構式解答。**Snell 等人比較平行、序列和 PRM 引導搜尋,並分析難度分組的結果(Large-Scale Test-Time Compute);接著是 Archon 搜尋組合式推論架構,結果發現fusion 的表現甚至勝過 oracle selection(Inference-Time Architecture Search)。

這堂課自己總結的核心是:重複取樣有效,而且驗證器的品質是關鍵變數——一名學生提出這點,Mirhoseini 表示認同,並提供每題 10,000 個樣本的已發布資料集,作為縮小落差的課程專題。

其中兩項有時間背景的立場值得記下。Mirhoseini 說,簡單和中等難度問題上,額外測試時運算勝過額外預訓練,但最難的問題仍由較大模型勝出,這項主張「仍在研究中,我相信截至今天仍是正確觀察」——這是 2025 年底的判斷,記錄於 Large-Scale Test-Time Compute;2026 年的來源後來也測得相同趨勢,但尚未定論這項取捨。她也把弱監督驗證器集成——10 或 20 個驗證器,而不是數千個,從運算角度來看「成本非常高」——視為所屬實驗室目前解決驗證瓶頸的做法,並預告系列後續講次會談到。

第三講的脈絡:穩健驗證#

第三講(由 Azalia Mirhoseini 單獨授課,2025-09-29 發表)是課程對第二講所診斷瓶頸的回答。它不是概論,而是以四年演進為架構:四篇論文逐一修補前一篇的限制,最後談到她自己實驗室的研究。

  1. 為答案打分——OpenAI 2021 年的 GSM8K 驗證器:取樣 100 個完成結果,以最終答案是否吻合來標記,並訓練語言模型搭配逐 token 正確性預測頭來預測標籤。驗證器資料量足夠時,表現勝過監督式微調。
  2. 為步驟打分——Let's Verify Step by Step(2023)和 PRM800K 的 80 萬筆人工步驟標籤。真正的關鍵不在信用分配,而在假陽性:結果標記的驗證器會獎勵靠幻覺得到正確答案的解法,過程標記的驗證器則不會。
  3. 不靠人類為步驟打分——Math-Shepherd(2024)將某個步驟的標籤定義為從該步驟開始的軌跡中,能得到正確答案的比例(或是否存在此類軌跡),再將所得 PRM 用作測試時選擇器和 RL 獎勵。
  4. 停止訓練驗證器——Weaver(Stanford,2025):標準化一組異質的 ORM、PRM 和 LLM 裁判;根據約 1% 的標籤剔除表現不佳者;以 Snorkel 式弱監督學習各驗證器的權重;最後將整個集合蒸餾成約 400M 參數的評分器。

步驟 1–3 見 Process vs Outcome Reward Models;步驟 4 見 Weak-Verifier Ensembling。這堂課補充了 wiki 原本沒有的三件事:

  • **受訓驗證器的精確率會隨候選數增加而下降。**準確率在約 400 個樣本時達到高點,到 800 個時反而下降,因為近乎相同的候選答案更難區分——這是生成-驗證落差的另一個成因,與多數決看不見共識盲點不同,也解釋了 2021 年的系統為何以 100 個樣本推出。
  • **這段演進本身就包含一項未被指出的反駁。**過程監督之所以存在,是因為結果標籤會獎勵依靠幻覺得到正確答案的推理鏈;Math-Shepherd 的自動步驟標籤則以該步驟能否得到正確答案來定義。自動化標註重新引入了當初設計標註機制要避免的同一種失敗。Mirhoseini 分別說出這兩點,卻從未把它們放在一起討論。
  • **生成器與驗證器的運算預算如何分配,被點名為尚未解決的問題。**在固定運算預算下,該多取樣一些解答,還是對每個解答評分得更仔細?她兩度將此列為課程專題,兩次都沒有答案。

她在結尾提出的立場,均應作為有日期的 practitioner-opinion 看待:重複取樣應該逐漸移到訓練時進行,讓 pass@1 承擔主要工作——「這是我們想走的方向」——但也提醒,將模型磨練成只給出一個答案,可能會犧牲讓取樣有效的解答多樣性與創造力。至於生成器和驗證器是否該出自同一模型家族,她沒有可引用的研究,只有一項觀察:模型「喜歡自己的生成結果」(Same-Model Review Blindness)——這與她自己實驗室跨實驗室驗證器集的做法相牴觸。

第四講的脈絡:回饋從何而來#

第四講(由 Aakanksha Chowdhery 單獨授課,2025-10-03 發表)首次離開驗證主題,改問另一個問題。第二、三講問的是訊號有多好;第四講問的是訊號從何而來,並以三篇論文的答案為架構:

論文回饋來源改進項目
ReAct推論時的環境,不需訓練落地性——推理-行動交錯(ReAct)
RLEF作為 RL 獎勵的直譯器程式碼正確性——執行回饋式 RL(RLEF)
Constitutional AI模型依據人類撰寫的原則自行評判無害性——Alignment Fine-Tuning (AFT)

Chowdhery 自己的說法是:「這三種技巧都是讓模型自我改進的方法。但這些技巧的差異在於,回饋從何而來?」 對照 The Verifiability Thesis 來看,三者按照免費取得驗證器的程度排列——回傳觀察結果的環境、回傳一個位元的測試套件,以及作為受訓模型本身的評論者。第三種是課程對完全沒有外部檢查領域的唯一解答,其代價在結果中一目了然:無害性提高,助益性下降;論文的貢獻是呈現 Pareto 前緣,而非全面勝出。

有兩點超越了各自論文的範圍。**交錯模式已被吸收。**Chowdhery 兩度表示,現在的思考模型會不經提示就採用 ReAct,因為它們曾以這類軌跡蒸餾——Harness Shrinkage as Models Improve 在一個具名的基本模式上觀察到了這點。另一點是,執行回饋培養的是修復能力,而非正確能力:RLEF 的錯誤分析顯示,後續回合會修正特定失敗,卻完全沒有壓力要求第一回合就答對。

她一貫的提醒貫穿三篇論文:模型對自己知道什麼校準得並不好,所以應用程式不該根據模型自己的信心來決定是否使用工具——替代做法是「讓模型使用正確的一組工具,這樣你才有落地的知識」。談到自我批評時,她也主動補充 Constitutional AI 結果並未呈現的事:「很多時候讓模型批評自己會更難。因此,有時讓其他模型形成共識來批評這些模型,效果會更好。」參見 Same-Model Review Blindness。

**利益衝突,四講中第三次。**Constitutional AI 是 Mirhoseini 的論文(Bai 等人,2022),由她的共同授課者講授,卻未揭露;ReAct 實驗使用 PaLM,而 Chowdhery 是其主要作者;她推薦的列舉有效動作技巧則來自她描述為自己參與的 Google 機器人研究合作。課程講授講師自身研究的模式,如今看來已是結構性安排,而非偶發。

第五講的脈絡:規劃可以放在三個地方#

第五講(由 Azalia Mirhoseini 單獨授課,2025-10-06 發表)回應了第一講預告的課綱項目——agents 接下來需要什麼:規劃、多步推理、自我修正。三篇論文最後呈現三種不同答案,說明規劃發生在哪裡;然而,講課從未明確把這點作為主軸:

論文規劃放置處付出的代價
LATS(ICML 2024)推論時放在 harness 中:對軌跡執行 MCTS——對 Agent 軌跡進行樹搜尋(LATS)增加推論成本,但未測量;需要可逆環境
SPRINT(2025)放進權重中,成為軌跡的結構:同時輸出彼此獨立的計畫——軌跡內平行規劃(SPRINT)一次 SFT 訓練;尚未證明能縮短實際耗時
SWiRL(COLM 2025)放進權重中,成為步驟的品質:對離線軌跡進行逐步裁判獎勵——離線多步工具使用 RL(SWiRL)每一步都仰賴作為唯一訊號的裁判

課程一直探討的兩條軸線在這裡都看得見。在驗證軸線上,LATS 以 LLM 裁判的分數加上逐節點多數決來引導搜尋;SWiRL 的每個獎勵都是提示裁判給出的——所以這堂課對第二講瓶頸的實際回答就是:「使用裁判,但別測量它。」在自我改進軸線上,SPRINT 和 SWiRL 都是飛輪的實例,但帶有不尋常的訓練內容:第二個模型為第一個模型的軌跡加上標註(GPT-4o 將 DeepSeek-R1 的推理切分成計畫/執行 DAG;裁判為每個提議的工具呼叫評分),再將標註轉成訓練資料。改進的不是答案,而是流程的形狀。

兩項 wiki 原本沒有的發現。SWiRL 的以過程篩選的資料,比以結果篩選的資料更適合 RL;用於 SFT 時,結果剛好相反——因為結果篩選只保留模型已能解出的問題,而模仿學習無法承受以錯誤答案收尾的軌跡。另一項是跨工具遷移:使用計算機在 GSM8K 上訓練,能提升使用搜尋引擎的 HotpotQA 表現,增幅大約與直接在 HotpotQA 上訓練相同。SPRINT 也報告了數學遷移至 countdown 和 GPQA-diamond 的相同趨勢。兩篇論文最後都得到同一解讀——能泛化的是一種推理方式,而非任務或工具。

**利益衝突,第四及第五次。**三篇論文中有兩篇出自 Mirhoseini 自己的實驗室。她以第一人稱敘述兩篇研究——「我們開始這項專案時」、「我們不需要訓練一個 LLM 來擔任裁判」——以代名詞透露作者身分,卻始終不點名;第二講的 Archon 也有相同模式。LATS 是例外:不是她的研究,也是她唯一從結構上批評的論文(缺少成本分析,且假設環境可逆)。

有一段旁白值得留作 2025 年底的時間標記:她指出 Claude Sonnet 4.5 system card 值得注意,因為其中的提示「鼓勵模型盡可能多次使用工具,至少 100 次」;她將之解讀為領域已跨過 8–10K token 的問題,進入單一任務需要呼叫一百次工具的階段。參見 Large-Scale Test-Time Compute 和 Task Time-Horizon Scaling。

第六講的脈絡:迴圈閉合了,但它沒有帶來什麼#

第六講(由 Aakanksha Chowdhery 單獨授課,2025-10-10 發表)是課程自第一講以來逐步鋪陳的主題——訓練時擴展。講師用一句話定義,並說這句話就是整堂課的內容:「取得模型輸出,套用測試時擴展後加以篩選,再用這些結果進一步微調——這大致就是訓練時擴展。」此前談的都是測試時;飛輪的後半段在此有了具體做法。

三篇論文不是三種答案,而是一條階梯,依照你願意建構多大規模的 RL 迴圈排列:

論文迴圈訊號入門成本
STaR(2022)離線:生成、篩選、微調、重複——理由引導的自我訓練(STaR)對最終答案標記 1/0;失敗案例另加提示過的理由約 100 條種子理由,不需 RL 基礎設施
DeepSeekMath(2024)線上、群組相對、無裁判——群組相對策略最佳化(GRPO)經群組正規化的獎勵模型分數經過初步訓練的基礎模型和篩選過的語料
DAPO(2025)線上,另為長思維鏈加上四項修正——同一頁面相同訊號,並丟棄退化群組控制熵、回應長度與截斷

這堂課自己提出的選擇規則,是最容易帶到其他情境的一點:有約 100 個推理範例但沒有 RL 基礎設施時用 STaR;有夠好的基礎模型和有限 GPU 時用 GRPO;推理鏈變長時用 DAPO,而推理鏈變長在實務上就是「問題更難」。

**最重要的結果是負面的,也是全課最值得引用的一句話。**DeepSeekMath 的 RL 提升了 majority@K,卻沒有提升 pass@K——「模型其實變得更一致,而非根本上更聰明。」對照 Latent Capability Overhang(同一實驗室的 Large Language Monkeys 研究,其中覆蓋率是全部重點),兩者並不衝突,而是互補:重複取樣從長尾中讀出既有能力,RL 後訓練則把機率質量移到模型原本就能找到的答案上。兩者都沒有擴大可解問題的集合。一名學生提問時,Chowdhery 自己也這麼說——根本能力出現飛躍,「通常是靠某種突破或規模擴展」。這是課程自身的自我改進論點,同時也受到課程講師本人的限制,就出現在飛輪終於閉合的這一講。參見 Large-Scale Test-Time Compute。

這堂課補充了 wiki 原本沒有的三個較小發現:

  • **截至 2025 年底,RL 在訓練運算中所占比例。**有人問現在前沿模型的訓練中,RL 相較於根據網路擷取文字做下一 token 預測,占了多少比例。Chowdhery 估計,約一年前是 1%,現在或許約 5%——但她不是在描述 Anthropic 未公開的比例;此外,Grok 4 宣稱 RL 占 50%,成效卻「沒有相應提升」,因為「瓶頸在於獎勵不夠強,或獎勵中有雜訊」。這是該軸線少見的公開數字,也是少見的廠商主張剛提出便受到評估。
  • **清楚說明 RL 和 SFT 的差異。**只要有強獎勵訊號,RL 就能用較少範例逐步爬升,但要做好需要實際投入;若已有高品質資料,SFT 速度較快,而且「不會帶來推理能力,也不會提升推理能力」。
  • 她點出的未解問題,也就是課程專題清單:為何只有 majority@K 上升;推理軌跡中可見的回溯和自我修正,究竟是新興行為,還是既有行為在統計上變得更常見;以及從失敗中學習仍未解決——有少數論文嘗試處理,但領域目前慣常做法仍是篩掉失敗案例。

**利益衝突:五講以來首次沒有論文涉及。**STaR 出自 Stanford,但不是講師的研究(Zelikman 和 Goodman 的實驗室;講課只說「一位 Stanford 的作者」);DeepSeekMath 和 DAPO 分別來自 DeepSeek 和 ByteDance-Seed。唯一間接提及自身研究,且對自己不利:Minerva 在 PaLM 上的結果被用作 DeepSeek 超越的基準,而 Chowdhery 是 PaLM 的主要作者。值得精確記錄,因為它打破了模式——第二至第五講未揭露的情況,與當時講授誰的論文相關,而非講師一貫的習慣。

第七講的脈絡:兩種搜尋,以及背後的篩選問題#

第七講(由 Aakanksha Chowdhery 單獨授課,2025-10-17 發表)是課程的作業預告講次——前半預告作業 2(在人類評估程式碼生成基準 HumanEval 上重複取樣),後半預告作業 3(深度研究 agent)——兩半看似無關,直到開場白點出共同軸線:

「我們大致知道解答存在於模型的搜尋空間中,但如何從模型輸出的搜尋空間中篩選出答案,就是我們這堂課大致要談的內容。」

課程迄今談到的測試時運算都會產生候選結果。這堂課探討的是要保留哪些結果,並分別討論兩種不同限制的情境:

部分系統稀缺資源相關文章
程式碼AlphaCode(2022)→ AlphaCode 2(2023)提交名額——100 萬個樣本、10 次嘗試提交預算下的選擇
檢索RAG → agentic RAG → Search-o1(2025)模型能妥善推理的上下文——10–20 份文件已經太多推理鏈中的檢索

程式碼部分提供了 wiki 首個直接衡量選擇階段代價的數字。AlphaCode 的流程主要在做選擇——先以範例測試篩選 100 萬個樣本,再用另一個受訓的測試輸入生成器,將存活者分群為語意等價的群組,最後每群提交一個。講課也定義了衡量這項成本的指標:10@k 對比 pass@k,也就是生成 k 個後提交十個,對比生成 k 個並全數提交。解題率約為30% 對上超過 40%。從 ASR 轉錄中清楚保留下來的兩個發現是:取樣預算增加時,解題率的對數線性擴展在提交次數受限時仍成立(選擇只會壓低曲線,不會使曲線變平);而且在每一種預算下,分群都能帶來穩定幅度的提升,因為只有十次機會時,唯一值得最佳化的就是行為上的多樣性。接著,AlphaCode 2 將生成器換成經微調的 Gemini Pro 系列,再加上一個學習式評分模型,以 100 個樣本達到 AlphaCode 用 1,000,000 個樣本才能達到的解題率。Chowdhery 的原則是:「讓模型本身變得更好,比擴大樣本數稍微容易一些。」

檢索部分補上了 Deep Research Agents 尚未說明的源頭脈絡。共有三階段:RAG 在開始思考前只檢索一次,而且「在多步推理中肯定會碰到問題」;agentic RAG 會在推理鏈中、特殊 token 之間執行搜尋,再將整份文件插入回去;Search-o1 加上文件內推理模組,根據目前查詢逐份閱讀文件,只附加擷取出的片段。區分這些方法的證據是文件數量曲線——加入更多文件後,直接推理和 RAG 的表現持平或下降,而 Search-o1 的表現則上升。這指出需要修正的失敗發生在基於檢索雜訊做長上下文推理,而非檢索本身。搜尋觸發條件是講課中最敏銳的觀察:知識缺口會先在推理軌跡中的遲疑用語(「或許」、「或者」、「等等」)顯現,之後才反映在答案裡;Search-o1 會計算這些標記來衡量自身效果。

這堂課對課程既有立場的兩項調整。

  • 它**反對課程第二講的取捨,但所處情境不在第二講討論範圍內。**第二講主張,在簡單和中等難度的問題上,額外測試時運算勝過額外預訓練;但在這裡,同一門課認為,競技程式設計中,採用較好的基礎模型勝過增加 10,000 倍的取樣預算。兩者並不矛盾——難題向來是例外——但課程從未把它們放在一起比較。
  • 它**從內部界定自身擴展定律的適用範圍。**有人問能否直接取樣一兆次,Chowdhery 認同,只有「對數線性趨勢持續」時,這筆帳才算得過去,並點出假設:「你大致是假設只要增加取樣量,多樣性就會繼續增加……若多取樣 10 倍,最後卻沒有更多樣的解法,那麼表現實際上不會改善。」Latent Capability Overhang 中的「多樣性是燃料」,在此被表述成曲線的上限,而分群則是偵測上限的工具。

還有一點值得記錄:結尾討論以一個具體機制重申課程一貫的校準立場——將輸出 token 的對數機率彙總後會發現「模型往往過度自信」;模型實際答對率為 50%,聽起來卻像有 80% 把握(這些數字是舉例,並非測量結果),在行為上的表現是受到更正時拒絕改變想法(Confident But Unsure)。講課也提到 Search-R1 是 Search-o1 提示式迴圈的 RL 版本,並明確表示不會涵蓋——課程時間不夠。

**利益衝突:論文乾淨,七講中第二次。**AlphaCode 和 AlphaCode 2 出自 DeepMind,Search-o1 出自 Renmin University,Search-R1 也不是她的研究。還有兩項較小的疑點:AlphaCode 2 被一位前 Google Brain 研究者描述為「這項研究是在 Google 進行的」,但她沒有說自己曾在那裡任職;Large Language Monkeys 則被歸功於「Azalia 上一講談過這個」——指共同授課者的講課,而非她的研究。因此,未揭露的模式確實與講授誰的論文有關:第六和第七講都沒有講師署名論文,也是唯二沒有疑點的講次。

**還有一項播放清單的佐證。**一段旁白——「這是上次講課提到的 AI scientist 式工作」——證實開放式演化課程(ADAS、The AI Scientist、AlphaEvolve)於 2025-10-13 授課,只是沒有收錄在已發布的九部影片中。因此,下文所說的「經過篩選的子集」首次獲得當事人直接佐證,而不只是根據課綱推論。

第八講的脈絡:三把尺,以及其中一把如何反駁另外兩把#

第八講(由 Aakanksha Chowdhery 單獨授課,2025-11-17 發表)是課程的評估講次,也是第一講以「如何得知」作為核心問題。三項基準測試分別回答agentic evaluation 應衡量什麼;而中間那項的存在,就是為了反駁第一項:

基準測試衡量內容呈現的趨勢
METR time horizons在可靠度固定下,任務所需的時間——任務時間範圍擴展每約 7 個月翻倍(2025 年底的數字)
GDPval(OpenAI)與實際從事該工作的專業人士相比,在真實有償工作上的勝率——GDPval Benchmark大致呈線性成長,兩年內約從 12% 上升至 48%<sup>†</sup>
DeepScholar-Bench(Stanford/Berkeley)研究綜整品質:檢索、關鍵事實、引文可驗證性——Deep Research Agents沒有任何系統超過約 19%

<sup>†</sup> **2026-09-10 根據原始論文修正。**GDPval 論文(arXiv 2510.04374,已作為基準線來源納入)只用 OpenAI 的三個模型擬合線性趨勢,終點是 GPT-5 high 的 38.8%;約 48% 是 Claude Opus 4.1 在另一張沒有時間軸的圖上的分數;專家標準則是 4 年經驗者的最低值,平均為 14 年經驗,而非「10 年」。講課中其他數字大致忠實反映當時說法——哪些數字成立、哪些不成立,請參見 GDPval Benchmark。

**這堂課自己的論點是在降溫,而提出者正是課程講師。**Chowdhery 點出指數曲線引發的外推想像——「好,AI 現在能做一小時的工作,那接下來就能做幾小時了」——並提出 GDPval 作為反例:面對實際需要數小時到數週的工作,模型的實用性有限,而且效用依職業而異,不能只用時間範圍彙總。這門以自我改進飛輪為論點的課程,在評估講次中踩下煞車,這與第六講以 majority@K 上升、pass@K 不升來限定主張,是同一種做法。

這堂課補充了 wiki 原本沒有的三件事。

  • METR 數字的建構方式,而 wiki 過去只引用最終數字:三組測試套件(SWAA / HCAST / RE-Bench,約 170 項任務)、有約 5 年經驗的人類基準測試者為成功嘗試計時、幾何平均難度,以及擬合成功率與時間的曲線。此外還有80% 欄位——可靠度 50% 時為 59 分鐘,可靠度 80% 時則縮成數十分鐘——以及 METR 自述的三項限制;其中最鮮明的是,模型對應的是低上下文承包商的時間(比維護者慢 5–18 倍),而非拿來評分時採用的專家時間。
  • GDPval 本身:數月來,這份 wiki 只透過 Artificial Analysis Elo 衍生指標,在六、七個模型頁面引用 GDPval。現在補上設計、各職業結果和失敗分析——主要錯誤類別是指令遵循;典型情況是模型承諾參考提供的參考檔案,最後卻沒有這麼做。
  • **第三項仍有顯著進步空間的基準測試。**DeepScholar-Bench 每月更新,利用截止日期後的 arXiv 論文生成相關研究段落,沒有任何系統超過約 19%。其失敗模式更值得參考:找到相關論文卻漏掉基礎文獻;即使提供正確來源,關鍵事實涵蓋率仍只有約 50%;而且沒有系統同時擅長綜整品質與引文可驗證性。

**綜合分析才是這堂課的貢獻,並非哪一項基準測試本身。**三者的失敗彼此呼應:模型缺少的是嵌入其中的專家所擁有的上下文——程式碼庫、默會規格、領域的基礎文獻——而這三項基準測試以不同方式,都是把這些上下文交給模型、再觀察還剩下什麼問題的工具。參見 Context Advantage, Not Taste。她在結尾表示,可靠度的長尾最難處理,原因「混合了資料問題與模型能力的根本問題」;而她對 AGI 的定義是飛輪走到盡頭時的情況:「當 AI 能自己建構下一代模型時,我們甚至不必待在現場」——她也表示目前還沒到那一步。

**利益衝突:論文乾淨,連續第三次。**METR 是獨立評估者,GDPval 出自 OpenAI,DeepScholar-Bench 出自 Stanford/Berkeley 團隊——都不是講師的研究。還有一項無傷大雅的疑點:一位 Stanford 兼任教授稱第三篇論文「來自 Stanford」,卻沒有說明自己並非作者。既有發現仍然成立:未揭露情況與講授誰的論文有關;第六、七、八講都由 Chowdhery 單獨授課,未講授講師署名的研究,也因此連續三講沒有疑點。

第 9 講的脈絡:迴圈尚未解決的三項輸入,以及運作成本#

第 9 講(兩位講師共同授課,於 2025-12-05 開講)是最後一堂課,內容做了兩件乍看不太相關的事:Chowdhery 回顧三篇 2025 年探討自我改進迴圈的論文,接著 Mirhoseini 提出一項效率指標。兩者的連結只說過一次,卻是這堂課真正的論旨——「我們可以做到自我改進,但現在需要進行大量推論,而智慧是有代價的。」 飛輪是個高度仰賴推論的機制,因此這門課最後談的是前八堂課所需付出的電費。

回顧部分依據迴圈輸入端仍由人提供或不可靠之處來組織,每個問題對應一篇論文。Chowdhery 明確列出三項,而非讓聽眾自行推斷:

瓶頸論文作法對應內容
推理鏈不再多樣,迴圈因此陷入停滯Multiagent Finetuning(MIT/Google,ICLR 2025)將一個基礎模型微調成生成與評論專家;進行辯論、摘要、多數決,再重新訓練Rationale Bootstrapping (STaR)
驗證器不可靠,甚至會捏造自己的錯誤DeepSeek-Math V2(2025 年底)以元驗證器評分驗證器的分析——它指出的問題是否存在?給出的分數是否合理?Process vs Outcome Reward Models
訓練提示由人類專家靜態整理Absolute Zero(2025)模型在 1 − success rate 可學習性獎勵下提出自己的任務,並以執行結果把關Rationale Bootstrapping (STaR)

效率部分探討的是每瓦特智慧——以準確度除以耗電量,研究來自 Mirhoseini 與 Christopher Ré、John Hennessy 在 Stanford 的合作:本機模型(啟用參數 ≤20B)涵蓋絕大多數單輪聊天與推理查詢;Apple M4 Max 的效率約比 B200 低 1.5 倍;兩年間效率提升 5.3 倍,可拆解為模型提升 3.1 倍 × 硬體提升 1.7 倍。她提出的方向是混合本機/雲端路由,並將能源視為關鍵資源。

這堂課補上了其他八堂課都沒有提供的四件事。

  • 解釋課程反覆觀察到的停滯機制。 第 6 講指出 STaR 式迴圈會停滯,卻沒說明原因;第 7 講指出,只有多樣性持續增加,採樣預算才有價值;第 3 講指出,聚焦 pass@1 可能會犧牲多樣性。第 9 講第四次點出同一個變數,終於測量了它的替代指標——即使溫度很高,單一模型生成的內容仍會趨同;將嵌入向量的不相似度與準確度一同繪製,就能看出這點。多樣性才是貫穿九堂課的真正主軸,但課程從未專門安排一講來談它。
  • 依照課程本身的推論,推進驗證器脈絡的下一階段。 第 3 講留下了一個未被點明的反駁:流程監督之所以存在,是因為結果標籤會獎勵幻覺式推理鏈;而 Math-Shepherd 的自動步驟標籤,定義依據是能否得到最終結果。DeepSeek-Math V2 攻擊的是更上一層——驗證器的推理過程,而非它給出的分數;這正是那個關鍵暗示所指之處,也是第 3 講未提出的方向。
  • 為「可驗證」增加第二個座標。 被問到哪些問題不在可驗證範圍內時,Mirhoseini 舉出的例子——晶片設計模擬、濕實驗室化學——都是有完美驗證器、但驗證需時數天的領域;然而 RL 迴圈需要數千個步驟。慢到無法置於迴圈中的驗證器就不算驗證器;這和創意寫作的主觀性是不同的失效模式,而 wiki 過去把兩者都歸在同一個標題下。請參閱可驗證性論點。
  • 兩次提到規模效應,兩位講師卻都沒有追問。 Absolute Zero 指出,較大的模型從自提課程中獲益更多;Mirhoseini 也以 SWiRL 的結果佐證,較大的模型*「更能吸收這類資料飛輪」*。因此,自我改進是規模的互補項,而非替代品——苦澀的教訓出現在這套原本意在繞過資料瓶頸的方法之中。

談到尚未解決之處,兩位講師少見地直言不諱。 Mirhoseini 列出的未解問題中,包含最根本的一項:測試時擴展為何有效——「究竟發生了什麼,才讓這些正確答案產生?」——以及如何將成功軌跡蒸餾回權重,還有持續學習。她將持續學習描述為一種不匹配,而非缺少的功能:人類工作時會愈來愈熟練,模型卻只能先拿到一批離線資料,之後才進行微調。她提出的理想解法也說明了替代方案的代價——無限且完美的上下文就等同於持續學習;但我們無法做到,因為模型在上下文視窗滿載之前,就已經無法妥善推理其中的資料。

利益衝突:在連續三堂課沒有此情況後,講師再次介紹自己參與的研究;這是整個系列中揭露最充分的一次。 Chowdhery 介紹的三篇論文都來自其他團隊(MIT/Google、DeepSeek、Tsinghua)——這是她連續第四堂課沒有利益衝突。Mirhoseini 則介紹自己的研究並明確說出來歷:「這是我們最近的一項研究,與 Ré 教授和 John Hennessy 教授合作完成」;談到 Hydragen 和 Tokasaurus 時也說是*「我的實驗室做了其中一些工作」。對照第 2 講和第 5 講:她以第一人稱介紹實驗室的論文,卻沒有說明作者身分。更精確的整體觀察:揭露程度的落差不只取決於教的是誰的論文,也取決於如何呈現*——目前實驗室正在做的工作會明確點名作者,調查環節中引用的經典論文則以代名詞帶過。還有兩項小小的遺漏:她討論 SWiRL 作為課程教材時,沒有再次說明自己是作者之一;而 Chowdhery 用第二人稱將 KernelBench 歸於共同授課者(「在你的[實驗室]」),讓教室裡的人知道,讀者卻無從得知。

課程總結#

九堂課、四位講者的內容,始終圍繞著第 1 講提出且從未放棄的一個論旨:測試時運算會產生經過驗證的軌跡,這些軌跡成為訓練資料,能力更強的模型便能在測試時進一步擴展。 綜觀彙整後的系列,這門課花了八堂課不斷限定自己的論旨,而且每次都提出測量結果,而非含糊帶過。

這些限定條件按特定順序層層疊加。第 2 講證明,採樣可以擴大涵蓋範圍,卻沒有任何篩選器能保留所有內容。第 3 講顯示,訓練好的驗證器在候選答案達數百個後會退化。第 6 講測量迴圈的效益,結果發現majority@K 持續上升,而 pass@K 持平——一致性提高了,能力卻沒有。第 7 講從內部界定採樣曲線的上限:只有多樣性持續存在,曲線才會延伸。第 8 講將一項基準測試與領域最愛的外推方式比較,發現任務時間呈指數增加時,經濟效益勝率卻只呈線性上升。第 9 講補上早先幾堂課不斷環繞的機制——多樣性崩塌——並指出模型本來愈大,整個方法的效果就愈好。

合併來看,課程自身的證據顯示,飛輪是效能複利機制,而非啟動機制:它把模型原本已能觸及的能力,轉化為穩定產出的成果;基礎模型規模愈大,效益愈高,而驗證器的成本與誠實度則始終是限制條件。兩位講師都直接說出最終版本——Chowdhery 對 AGI 的定義(「當 AI 能打造下一代模型時,我們甚至不必待在現場」),以及她對目前狀態的評語:AI 是共同研究者——但兩人都沒宣稱課程的方法能達成這個目標。請對照遞迴式自我改進和Intelligence Explosion Dynamics,這個 wiki 的 2026 年來源以不同工具論證了相同的發展脈絡。

儘管發表時距今已有一年,這個系列仍值得留在 wiki 中,原因有三。這是此處唯一一個按脈絡教導基礎文獻的來源——從 2021 到 2025 年的驗證器演進、STaR→GRPO→DAPO 的階梯、RAG→Search-o1——而非只引用 2026 年論點所需的個別論文。系列內容也一再受到講師本人的界定,這是廠商資料所沒有的特點,因此標註日期的 practitioner-opinion 分級仍有價值。再者,2025 年底的時間戳記,讓它能作為可供比較的舊貌基準:靜態工作流程圖是常態,程式碼代理「才剛開始變得可靠」,RL 約占訓練運算量的 5%,開放式迴圈僅限程式碼與深度研究。2026 年的文集都可以拿來檢驗這些說法。

課程一直延後處理、而這個 wiki 也無法根據現有來源解答的問題是:九堂課中沒有一堂在缺乏廉價驗證器的領域裡實際跑過迴圈。 Mirhoseini 點出了該做的實驗——在可驗證的合成資料上盡可能推進自我改進,再測量成果能否轉移至沒有自動驗證的領域——並稱這是*「一項極度耗費運算資源的研究實驗」*,至今沒有人做過。

課程架構與行政資訊(2025 年秋季)#

評分3 份作業 = 50%;課程專題 = 50%
專題分組2–4 人(可 1 人),提供 API 點數
里程碑提案(10 月上旬)→ 期中簡報(約兩週後,預期實驗已執行)→ 期末報告 → 海報展示,12 月 12 日下午 4–6 點,並邀請業界人士參加
希望的專題新的評估資料集或基準測試;代理系統可靠性研究;以現有基準測試進行爬山式最佳化;延伸或質疑指定論文中的某項決策
不接受的專題文獻回顧;「只是拼湊出來的應用程式」;「超越現場寫程式的東西」
客座講座前沿實驗室研究人員,主題涵蓋後訓練演進及多模態/機器人代理

本次開課新增第三份作業;一份作業涵蓋 LLM-as-a-judge(LLM-as-a-Judge,LLM 作為評審),另一份則是長篇報告生成器。前一年度的專題曾產出論文。

講次紀錄#

九堂已發布課程,彙整日期為 2026-08-17。

#講題講者原始影片彙整日期
1Course Overview兩位講師CS329A Self-Improving AI Agents — Part 1: Course Overview2026-08-17
2Test-Time Compute ScalingMirhoseiniCS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling2026-08-17
3Robust VerificationMirhoseiniCS329A Self-Improving AI Agents — Part 3: Robust Verification2026-08-17
4Learning from Feedback with Tools and CodeChowdheryCS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code2026-08-17
5Planning and Multi-Step ReasoningMirhoseiniCS329A Self-Improving AI Agents — Part 5: Planning and Multi-Step Reasoning2026-08-17
6Train-Time Scaling and Scaling RLChowdheryCS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL2026-08-17
7Self-Improvement with Search & Deep Research AgentsChowdheryCS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents2026-08-17
8Agentic Evaluations and Long-Horizon TasksChowdheryCS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks2026-08-17
9Future Research Areas兩位講師CS329A Self-Improving AI Agents — Part 9: Future Research Areas2026-08-17

截至 2026-08-17,已發布系列已完整收錄——九部 YouTube 影片都已彙整。這門課若有後續內容,只能來自以下列出的未發布課程。

已發布的播放清單並不包含哪些內容。 九部 YouTube 影片是課綱 20 堂課中的精選子集(第 1–6、8、17、20 堂),所以實際授課內容多於錄影內容。缺少的課程也屬於這個 wiki 的範疇:開放式演化課程(ADAS、The AI Scientist、AlphaEvolve)、軟體工程的代理框架,以及為代理增添記憶——另外還有六堂客座講座與三天期中簡報,可能是因講者授權而未公開。各講次的講者資訊來自 Stanford 自行提供的影片說明:第 2、3、5 講由 Mirhoseini 單獨授課;第 4、6、7、8 講由 Chowdhery 單獨授課;第 1、9 講則由兩人共同授課。

相關連結#

  • Azalia Mirhoseini — 共同授課者;她實驗室的 Large Language Monkeys 是課程中推論擴展的核心例子
  • Aakanksha Chowdhery — 共同授課者;提供涵蓋範圍→pass@1 的論述,以及第 1 講中代理工作流程的部分
  • Large-Scale Test-Time Compute — 課程的核心主軸,作為參數與資料之後的第三個擴展前沿來講授
  • Recursive Self-Improvement — 課程所說的「自我改進」:測試時運算 → 合成資料 → 微調的飛輪
  • The Verifiability Thesis — 課程指出的瓶頸,在講座中稱為生成器-驗證器落差
  • Latent Capability Overhang — Large Language Monkeys 是本頁 2024 年的實證先例
  • Agent Loop Pattern — 課程用來區分代理與聊天機器人的目標/行動/回饋/停止定義
  • Inference-Time Architecture Search — 第 2 講提出的建設性答案:Archon,以及勝過完美篩選器的融合結果
  • Process vs Outcome Reward Models — 第 3 講介紹的前三篇論文:從結果標籤、人類步驟標籤到自動生成標籤的 2021→2024 年演進,以及三種方法都未能排除的誤報
  • Weak-Verifier Ensembling — 第 3 講的第四篇論文,也是課程中講師實驗室提出的解法:結合不完美的驗證器,而非訓練更好的單一驗證器
  • Reasoning–Acting Interleaving (ReAct) — 第 4 講的第一篇論文:ReAct,即課程視為工具呼叫起源的思考/行動/觀察交替模式
  • RL from Execution Feedback (RLEF) — 第 4 講的第二篇:以直譯器作為獎勵函數,採用公用/私有兩層測試拆分,每個回合給予一次優勢值
  • Alignment Fine-Tuning (AFT) — 第 4 講第三篇論文的落點:以 Constitutional AI 作為取代 RLHF 人類標註者的 AI 回饋,以及由此換得的有用性/無害性前沿
  • Tree Search over Agent Trajectories (LATS) — 第 5 講的第一篇論文:LATS,以 MCTS 搜尋代理軌跡,使用評審加頻率的價值函數;其可逆性假設使適用範圍限於模擬器
  • Intra-Trace Parallel Planning (SPRINT) — 第 5 講的第二篇:SPRINT,找出推理軌跡中隱藏的 DAG 並訓練模型輸出,意外提升準確度
  • Offline Multi-Step Tool-Use RL (SWiRL) — 第 5 講的第三篇:SWiRL,多步驟工具使用 RL 將所有工具呼叫移至離線執行;RL 與 SFT 在流程/結果篩選上的方向正好相反
  • Rationale Bootstrapping (STaR) — 第 6 講的第一篇論文:STaR,課程所提飛輪的精簡版本;合理化步驟使模型能以尚無法自行解決的問題進行訓練
  • Group Relative Policy Optimization (GRPO) — 第 6 講的第二、三篇:GRPO 的起源,以及 DeepSeekMath 將其主要成果歸功於哪些因素;另有 DAPO 改善長思維鏈 RL 的四項修正,以及 Qwen-32B 的消融階梯
  • Selection Under a Submission Budget — 第 7 講的程式碼部分:AlphaCode 與 AlphaCode 2;衡量篩選階段成本的 10@k 與 pass@k 指標;以分群作為多樣性篩選器;以及用一百個樣本達到與一百萬個樣本相同解題率的學習式評分模型
  • GDPval Benchmark — 第 8 講中間部分,也是 wiki 用來介紹該基準測試的核心頁面;此前 wiki 只引用過它的 Elo 衍生指標。此測試以經濟價值工作對照十年資歷專業人士的勝率評分;在 METR 的時間跨度呈指數上升時,該勝率則呈線性上升
  • Task Time-Horizon Scaling — 第 8 講第一部分:文集中唯一描述 METR 時間跨度如何構建的內容、50% 與 80% 可靠度的落差,以及將此指標解讀為低上下文承包者表現的觀點
  • Deep Research Agents — 第 8 講最後部分:DeepScholar-Bench,一個即時相關研究基準測試,沒有任何系統超過約 19%,而且相關性經常被誤當成重要性
  • Inference Efficiency as Capability — 第 9 講的後半段,也是課程唯一一堂探討運作飛輪成本的課:每瓦特智慧、本機推論論點,以及效率兩年提升 5.3 倍的模型 3.1 倍 × 硬體 1.7 倍拆解
  • Retrieval Inside the Reasoning Chain — 第 7 講的檢索部分:RAG → 代理式 RAG → Search-o1 的階梯;以保留語氣的詞彙觸發知識落差判定;以及讓新增文件帶來幫助而非造成干擾的逐文件壓縮

尚待解答的問題#

  • 課程所述的飛輪(測試時運算 → 合成資料 → 更好的模型)能否跨出具有廉價驗證器的領域,還是會如可驗證性論點所預測,恰好在那裡停滯?**完整系列已部分回答(第 9 講於 2025-12-05 開講):答案是課程從未測試此事,但說明了原因並指出實驗方向。**它補上三件事。(1) 講師用這些明確措辭提出問題,並將其保留為未解問題:「只靠可驗證領域,我們能將自我改進前沿推進多遠……而這些成果能在多大程度上泛化至沒有自動驗證的其他領域?」這是 Mirhoseini 本人的說法,她稱之為「一項極度耗費運算資源的研究實驗」,至今尚未執行。(2) 九堂課中的所有遷移證據都留在可驗證範圍內:程式碼→數學(Absolute Zero)、計算機→搜尋引擎(SWiRL)、數學→倒數遊戲與 GPQA(SPRINT)、數學→GSM8K(Multiagent Finetuning)。四篇論文得到一致發現——自我生成資料能遷移一種推理方式——卻沒有任何一篇跨入缺乏自動檢查的領域。(3) **障礙如今被拆解成兩個不同問題。**驗證器緩慢的領域(晶片設計、濕實驗室化學)受限於延遲,無法跟上數千個 RL 步驟;建議的修補方式是離線訓練替代獎勵模型來預測模擬器——做得到,但受限於資料。主觀領域(創意寫作)沒有可用來建立替代模型的真值,若要建模就可能引發獎勵鑽漏洞。前者是工程問題,後者才是此論點真正的邊界;目前仍未解答的,是替代模型途徑是否有效,而此處沒有任何來源測量過這件事。

已解答的問題#

  • 講師表示預訓練與 RL 之間的問題——RL 是增加能力,還是只展現預訓練已有的能力——「沒有單一共識」。本系列後續課程有解開這個問題嗎?還是九堂課都沒有定論?**完整系列已給出答案(2026-08-17,九堂課全數彙整):九堂課都沒有定論,最後一講將此列為開放研究方向,而非已有結論的問題。**以下分三部分評估,因為原問題暗含了第 1 講的預期:課程終究會得出答案。
  • 說得對:課程確實對所教的方法提出立場,並以測量結果而非個人意見佐證。第 6 講的 DeepSeekMath 結果顯示,32 個樣本下 RL 提升了 majority@K,卻沒有提升 pass@K;Chowdhery 將此推廣至 STaR、GRPO 與 DAPO:「這些方法都還無法改善根本能力……也無法教會模型解決新的問題」,真正的能力躍升則來自*「突破或擴展規模」*。第 7 講的多樣性上限,以及第 3 講中約 400 個樣本後驗證器效能衰退的結果,都指向相同方向。依課程提供的證據,展現既有能力的解釋更站得住腳。
  • 說錯了:以為剩下的課程會為一般性問題定論。課程沒有做到,而第 9 講開頭就直說了——Mirhoseini 列出的第一項開放方向正是最根本的問題:「我們為何看到這種特性……究竟發生了什麼,才讓這些正確答案產生?」;她也一併提出如何將成功軌跡蒸餾回權重。這門以飛輪為論旨的課程,最後以追問飛輪為何有效作結。
  • 理由不對,但結論正確:第 6 講之後記錄的部分答案,依據的是單篇論文對數學任務的消融實驗,且是從投影片讀出的結果。答案經得起檢驗——但不是因為那項消融實驗足以定論,而是因為另外五項有測量數據的課程結果各自指向同一方向,也因為第 9 講提出了第三個可能的關鍵變數:多樣性崩塌;它既不是預訓練,也不是 RL。事實證明,誠實的提問方式並非「RL 是否增加能力」,而是「迴圈的關鍵輸入是什麼」;依課程最後一講的答案,那就是推理鏈的多樣性、驗證器可靠度,以及任務供應——這些都不屬於預訓練與 RL 的二分軸線。**已有答案:**請參閱上文第 6 講和第 9 講的脈絡,以及 wiki 對此議題在 2026 年的整理大型測試時運算。

資料來源#

  • CS329A Self-Improving AI Agents — Part 1: Course Overview — 第 1 講,於 2025-09-22 開講、2026-08-03 發布(practitioner-opinion;YouTube 自動字幕逐字稿,約 11.7k 字)。回顧擴展定律與湧現、ChatGPT 的後訓練技術堆疊、Large Language Monkeys、推理模型、聊天機器人→代理的轉變、工作流程模式分類、應用概覽,以及課程行政資訊
  • CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling — 第 2 講,由 Azalia Mirhoseini 單獨授課,於 2025-09-26 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 9.7k 字)。涵蓋率冪律及其長尾條件、驗證方法分類、生成與驗證的落差及多數決為何無法彌合落差、Snell 等人對平行搜尋/序列搜尋/PRM 引導搜尋的研究及其難度分類與預訓練取捨,以及 Archon 架構搜尋系統
  • CS329A Self-Improving AI Agents — Part 3: Robust Verification — 第 3 講,由 Azalia Mirhoseini 單獨授課,於 2025-09-29 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 10.7k 字)。四年來探討驗證的四篇論文:2021 年 GSM8K 結果驗證器及其約 400 個樣本後精確度衰退;Let's Verify Step by Step/PRM800K 與支持流程監督的誤報論點;Math-Shepherd 以 rollout 自動產生步驟標籤及其三項已確認缺點;以及 Weaver 的弱監督驗證器集成與約 400M 的蒸餾結果。另有關於 CodeMonkeys、推理模型、pass@1 的最終目標及其多樣性成本的總結討論
  • CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code — 第 4 講,由 Aakanksha Chowdhery 單獨授課,於 2025-10-03 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 12.9k 字)。三篇論文依回饋來源分類:ReAct 的思考/行動/觀察交替模式及其 HotpotQA/FEVER/WebShop 結果,並分析幻覺轉為檢索失效的變化;RLEF 的執行回饋 RL,包含兩層測試拆分、回合層級價值函數與逐回合修復分析;以及 Constitutional AI 的批判-修訂 SFT、RLAIF 偏好模型與有用性/無害性 Pareto 前沿。另討論模型校準、嘈雜的環境回饋、將程式碼代理擴展到超出上下文視窗,以及憲法修訂作為持續學習問題
  • CS329A Self-Improving AI Agents — Part 5: Planning and Multi-Step Reasoning — 第 5 講,由 Azalia Mirhoseini 單獨授課,於 2025-10-06 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 11.3k 字)。三篇規劃論文:LATS 對代理軌跡進行六階段 MCTS,採用評審加自我一致性的價值函數、UCT 選擇和反思步驟,並坦承成本與可逆性限制;SPRINT 的 GPT-4o 標註流程將 DeepSeek-R1 軌跡轉成規劃/執行 DAG、7B SFT、約 3.5 個百分點的準確度增益、約 40% 的序列 token 減量,以及遷移至倒數遊戲/GPQA-diamond 的結果;SWiRL 的離線合成軌跡、逐步 LLM 評審獎勵、RL 期間不使用工具的目標、RL 與 SFT 在流程/結果篩選上的方向反轉,以及跨工具 GSM8K↔HotpotQA 泛化。三篇中有兩篇出自她的實驗室,講解時以第一人稱提及,未點名揭露
  • CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL — 第 6 講,由 Aakanksha Chowdhery 單獨授課,於 2025-10-10 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 13k 字)。三篇論文構成訓練時擴展的階梯:STaR 的生成/篩選/微調迴圈及其合理化步驟、GPT-J 結果、三項明示假設,以及 V-STaR/Quiet-STaR 後續方法;DeepSeekMath 在 DeepSeek-Coder 基礎模型上,以 Common-Crawl 相對 arXiv 的資料篩選、以四份模型複本的記憶體論點說明省略 PPO 評論家、MATH 46.8 → 51.7,以及 majority@K 而非 pass@K 的發現;DAPO 的 clip-higher/動態採樣/token 層級損失/寬鬆超長懲罰,以及 Qwen-32B 在 AIME 上從約 30 提升至約 50 的累積階梯。另討論 SFT 與 RL 的選擇準則、2025 年底 RL 占訓練運算量的估計及以 Grok 4 說法對照評估,以及收尾的未解問題清單。第一堂課沒有講師與論文作者身分衝突
  • CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents — 第 7 講,由 Aakanksha Chowdhery 單獨授課,於 2025-10-17 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 12.1k 字)。兩個部分以同一主軸串連(如何從模型的搜尋空間中整理出答案):AlphaCode 使用 700GB GitHub 預訓練、經 GOLD 正則化的 CodeContests 微調、每題 100 萬個樣本、範例測試篩選,以及透過學習式測試輸入生成器進行語意等價分群;Codeforces 前 54% 的結果與各賽事間的變異討論;10@k 與 pass@k 定義,以及模型規模 × 預算掃描中約 30% 對比超過 40% 的篩選差距。接著介紹 AlphaCode 2 微調後的 Gemini Pro 系列、CodeContests v2、學習式評分模型、95% 篩選率、前 10 分群重排、100 個樣本等同 100 萬個樣本,以及 43% 對比 25% 的結果與第 85 百分位。再來是 RAG → 代理式 RAG → Search-o1 的階梯,包含文件推理模組、保留語氣詞觸發條件、化學範例、文件數量曲線、GPQA 對角線比較與多跳問答主張;最後討論對數機率校準與過度自信。課堂討論涵蓋依難度調整樣本預算、提示注入與 STaR,以及評分模型污染。第二堂沒有講師與論文作者身分衝突,但有兩項未揭露的細節——AlphaCode 2 由一位前 Google Brain 研究人員以*「這項研究是在 Google 做的」帶過,而 Large Language Monkeys 則歸功於共同授課者的講座*,而非其作者身分
  • CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks — 第 8 講,由 Aakanksha Chowdhery 單獨授課,於 2025-11-17 開講、2026-08-03 發布(practitioner-opinion;自動字幕逐字稿,約 12.9k 字)。三項基準測試提供三把代理評估的尺:METR 時間跨度——SWAA/HCAST/RE-Bench 測試組合(約 170 項任務)、約五年資歷的人類基準測試者與幾何平均難度評分、在 50% 可靠度下 GPT-2 → GPT-4 → Claude 3.7 Sonnet 的發展階梯、80% 可靠度的落差、GPT-4 與 o1 的失效類型(規劃、工具選擇、算術、過早放棄、重複迴圈),以及三項明示限制,其中包括模型表現所追隨的承包者與維護者差距(5–18 倍);接著是 GDPval——九個 GDP 最高的產業、44 種職業、約 1,320 項任務(其中約 220 項公開)、O*NET 數位任務篩選、任務特徵列表、勝率從 12.4% 升至 47.6%,並明確對照 METR 的指數增長,呈現線性增長;另分析各模型的優勢、指令遵循失敗、GPT-5 品質分布,以及規格不足的消融實驗;最後是 DeepScholar-Bench——以每月更新的截稿日期之後 arXiv 論文生成相關研究,涵蓋 22 個領域,三個評分面向獲得約 70–80% 的人類驗證,系統表現上限不到 19%,以及四種失效模式。結尾綜合討論為何單一指標不足,並以問答探討可靠度長尾、分散式系統作為困難領域,以及她認為 AI 是共同研究者而非 AI 科學家的判斷。所有數字均由投影片經 ASR 讀取,相關頁面都有加註保留語氣;其中三項被標記為有誤(任務數量、GPT-5 品質比例、成本/速度說法)。連續第三堂課沒有講師與論文作者身分衝突——論文來自 METR、OpenAI 及 Stanford/Berkeley 團隊——但有一項無傷大雅的遺漏:一位 Stanford 兼任教授說 DeepScholar-Bench「來自 Stanford」,卻沒有說明自己不是作者
  • CS329A Self-Improving AI Agents — Part 9: Future Research Areas — 第 9 講,兩位講師共同授課,於 2025-12-05 開講、2026-08-03 發布(practitioner-opinion;前瞻方向採 prediction 等級——完整閱讀原始資料後,已將其匯入時標記的 prediction 等級更正,因為四分之三的課程都在回顧已發表結果;自動字幕逐字稿,約 10.5k 字)。最後一堂課分為兩部分。Chowdhery 的部分:先回顧課程,再以三篇論文說明迴圈尚未解決的三項輸入——Multiagent Finetuning(單模型自我訓練中的多樣性崩塌、從同一基礎模型訓練生成/評論專家、結合摘要的辯論、NLL 對比嵌入向量不相似度的投影片,以及 GSM8K 遷移檢查)、DeepSeek-Math V2(定理證明是結果匹配無法證明任何事的領域、無需參考解答即可辨識問題、生成器/驗證器/元驗證器架構、DeepSeek-V3 + GRPO 基礎、在 pass@1 下迭代八次,以及 2024 年 IMO 短名單上約 42% 的 best-of-32)、以及 Absolute Zero(專家供應論點、演繹/溯因/歸納任務類型、1 − average success rate 可學習性獎勵、執行/安全/確定性有效性檢查、多樣性條件式任務緩衝區,以及程式碼→數學遷移)。Mirhoseini 的部分:與 Ré 和 Hennessy 合作提出的每瓦特智慧指標與研究、需求與本機記憶體趨勢、三項發現,以及 3.1 × 1.7 = 5.3 倍的拆解;四項未來方向(混合本機/雲端路由、節能架構與核心、測試時擴展服務基礎架構、以能源為稀缺資源)。最後的問答涵蓋不可驗證領域的分類與替代獎勵權宜解法、KernelBench 的效能剖析梯度、持續學習與長期記憶、無限上下文與 Cartridges、技能遷移應採權重或記憶儲存庫,以及作為代理指標的環境。三篇論文都不在 raw/ 中;所有數字均由 ASR 讀取投影片而來,而每瓦特智慧的主要涵蓋率數字在逐字稿中途被截斷——Inference Efficiency as Capability 所載約 88.7% 來自原始資料對該論文的描述,並已標明來源。其他逐字稿缺陷在提及處均有標記:溯因任務類型的描述與演繹完全相同;驗證器分數範圍轉寫為「0.5 and 1」;資料中心需求數字的單位混亂。利益衝突:在連續三堂沒有此情況後,再次介紹講師參與的研究,並以姓名揭露——Mirhoseini 介紹自己的每瓦特智慧研究,點名合作作者,也說明 Hydragen 和 Tokasaurus 是她實驗室的成果。系列整體觀察因而更為精確,而非被推翻:揭露程度的落差追隨的是研究如何呈現,不只是研究屬於誰——目前實驗室正在做的工作會明確點名作者,調查環節中引用的經典論文則以代名詞帶過
§ end
Cited by 29
Related articles
  • Aakanksha Chowdhery

    Adjunct professor at Stanford, co-instructor of CS329A, and a researcher at Reflection AI; previously Google Brain, whe…

  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Azalia Mirhoseini

    Stanford CS assistant professor and co-instructor of CS329A; previously Google Brain, Anthropic (Claude) and Google Dee…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Process vs Outcome Reward Models

    The four-year arc of trained LLM verifiers as taught in CS329A lecture 3: OpenAI's GSM8K verifier (score the finished s…