H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

Aakanksha Chowdhery

史丹佛大學兼任教授、CS329A 共同授課教師,也是 Reflection AI 研究員;先前任職於 Google Brain,曾擔任 PaLM 論文的主要作者,並共同撰寫 self-consistency 研究。在 CS329A 中,她以 coverage→pass@1 的框架區分重複取樣與推理模型訓練,並指出 generator–verifier gap 是這個領域的瓶頸;她的個人授課依回饋來源梳理自我改進(4),透過 STaR/GRPO/DAPO 完成迴路,同時界定其上限——RL 提升的是 majority@K,而非 pass@K(6);她將搜尋重新界定為篩選,並指出更好的基礎模型勝過更多樣本(7);接著以三把尺相互比較,運用 GDPval 的線性勝率趨勢為 METR 的指數趨勢踩煞車(8)。第 9 講以迴路中三個尚未解決的輸入為課程收尾:推理鏈多樣性、驗證器可靠性、任務選擇

Article metadata
Publication details
Published:August 17, 2026
Filed:Entity
Domain:Entities
Tags:EntityPersonResearcherStanfordReasoning
Reading:21 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Aakanksha Chowdhery 的插圖

資料來源#

摘要#

Aakanksha Chowdhery 是史丹佛大學兼任教授,也是 CS329A 的共同授課教師,並在 Reflection AI 從事研究。她先前任職於 Google Brain,在那裡認識了共同授課教師 Azalia Mirhoseini;她是 PaLM 論文的主要作者,也是 Pathways 的共同作者,並共同撰寫 self-consistency 研究(Wang et al. 2022)。每當本文語料的參考文獻提到先取樣再彙整,這項研究就會再次出現。

她負責 CS329A 第 1 講中關於預訓練與擴展的部分,以及從聊天機器人到代理的整個部分。

她值得獨立成篇的框架:涵蓋率不等於能力#

當被問到推理模型是否真的能做出基礎模型做不到的事時,Chowdhery 提出了維基其他地方以基準測試規則表達的區分:

「如果你只有一個剛完成預訓練的基礎模型,它也能做一些推理。但同時,它會生成不同種類的推理鏈,而且不太知道哪一個才正確。因此,我們在訓練時或測試時擴展中會談到的許多內容,歸根究柢都是學會哪一個才正確。所以 pass@1 準確度會提升……相較之下,pass@k 或涵蓋率,才是你在重複取樣結果中看到的東西。」

這是 Compute-Controlled Benchmarking 報告規則背後的機制面(「只有 pass@k 看得到的提升,提升的是嘗試次數,不是能力」):訓練迴路正是把前者轉變為後者的關鍵。相關內容詳見 Large-Scale Test-Time Compute。

她也謹慎說明,這並沒有解決哪些問題,並在聽眾追問時直言:能力躍升究竟源自 RL,還是來自多樣化的預訓練資料,「沒有單一共識」;「兩種過程都有幫助」;而這個迴路「還沒有完全弄清楚——這只是生命初現的跡象,而且開始商業化」。身為教授這些內容的授課者,她明確拒絕過度宣稱,這點相當少見。

generator–verifier gap#

她用這個名稱指稱課程中的瓶頸:模型能低成本地生成——「一大堆胡言亂語或合理的推理軌跡」——真正卡住的是告訴你哪些結果正確的回饋。若驗證可機械化(數學、程式碼、規則明確的領域),迴路就能閉合;若不可機械化(她舉的例子是創意寫作),人類回饋就會成為瓶頸,模型改進也會停滯。參見 The Verifiability Thesis 與 Verification as the New Bottleneck。

關於代理(2025 年末,practitioner-opinion)#

  • 代理與聊天機器人的差別在於有一個目標:規劃、對環境採取行動、讀取回饋、修正,並決定何時停止——或回來說明目標無法達成。工具與記憶是由目標推導而來,而非相反。
  • 真正部署的系統仍是手工打造的靜態工作流程圖;開放式迴路只在程式設計與深度研究中呈現「生命初現」的跡象(Agent Loop Pattern)。
  • 釐清使用者意圖是代理的重要步驟,不是禮貌而已:「使用者通常沒有把問題說清楚」,代理必須先釐清,才能知道要依據什麼來驗證(Unknowns as the Agentic Bottleneck)。
  • 程式設計代理變得可靠,是靠更好的模型和帶有可驗證獎勵的 RL,而不是新架構——「整個典範非常相似」。

第 4 講:依回饋來源梳理自我改進#

她的第一場個人授課(2025-10-03)是課程從「驗證器有多好」轉向「訊號究竟來自哪裡」的關鍵,內容以三篇論文、三種答案編排:環境(ReAct)、解譯器(RLEF),以及模型本身(Constitutional AI,見 Alignment Fine-Tuning (AFT))。這套分類法出自她之手,也是最有用的部分——她是依序轉述各篇論文,而非進行衡量。

有三個立場值得歸於她:

  • Grounding 是因應校準不佳的權宜之計,並未解決問題本身。 當被追問模型如何決定何時搜尋時,她不接受這個提問框架:要求模型評估自身信心時,「校準並不好……這仍是正在解決的研究問題」,所以應用程式應繞過這個問題,把使用工具設為預設行為,而非依賴自我評估來決定是否啟用。參見 Confident But Unsure 與 Trained Calibration。
  • 自我批評是 AI 回饋中較弱的一種。 她在總結 Constitutional AI 後續文獻時主動提出:「很多時候,要模型批評自己反而更難。因此,讓其他模型形成共識、共同批評這些模型,有時效果更好,因為模型可能過度自信。」她的共同授課者明確表示直覺相反(模型「喜歡自己生成的內容」),而本維基的衡量結果支持 Chowdhery 的看法。
  • 工作流程才是領域特有的部分,這就是 ReAct 無法泛化的原因。 當被問到 RL 後訓練是否讓 ReAct 抽象過時時,她回答:若能定義搜尋空間,是;但「所有任務的搜尋空間都沒有明確定義」則否——會計代理、法律代理和財務代理各自遵循不同步驟,而難以自動化的是步驟順序,不是 token 生成。這和她在第 1 講中對代理與工作流程圖的區分一致,如今她進一步指出,這正是工作流程圖仍須手工打造的原因。

COI,未揭露,規模雖小卻確實存在。 她教授的 ReAct 結果使用 PaLM,而她是該模型論文的主要作者;她推薦的列舉有效動作技巧,來自「另一篇我們與 Google 機器人研究夥伴合作的論文」,也就是她自己的研究;Constitutional AI 則是她共同授課者的論文。她在講座中都沒有標示這些關係。

第 6 講:迴路閉合,但她也界定其上限#

她的第二場個人授課(2025-10-10)正是這門課開設的目的——訓練時擴展,定義為「取用模型輸出的結果,套用這種測試時擴展後進行篩選,再用這些結果進一步微調」——並以三階梯呈現:STaR、接著是 DeepSeekMath/GRPO,最後是 DAPO。完整脈絡見 CS329A: Self-Improving AI Agents (Stanford);真正屬於她個人觀點的是,她明確說出了上限。

她在第 1 講提出的框架指出,訓練迴路能將涵蓋率轉變為 pass@1。第 6 講補上這句話的另一半,而且對課程的論點沒那麼有利:DeepSeekMath 的 RL 提升了 majority@K,而非 pass@K,因此「模型實際上變得更一致,而不是從根本上更聰明」——她接著把這個結論推廣到剛教完的三篇論文:「這些方法都還無法提升根本能力,也無法教會模型解決新問題,或大幅泛化到領域外」,能力的重大躍升反而來自「突破或擴展」。相關內容詳見 Large-Scale Test-Time Compute。

另外兩個立場也值得歸於她:

  • 訓練中 RL 所占比例,以及與之對照評估的供應商說法。 當被問到目前前沿模型訓練中,RL 相對於在爬取文字上進行 next-token prediction 的占比時,她估計約為一年前的 1%,現在可能約 5%——並明確說明這不是在描述 Anthropic,因為該公司並未公布相關數據——還指出 Grok 4 聲稱使用 50% RL,但「實際上沒有帶來相稱的提升」,因為「獎勵不夠強,或是獎勵有雜訊」。這是少數公開的此類數字之一,她同時也指出了其限制。參見 Effective Compute Scaling。
  • SFT 與 RL,作為選擇依據。 只要有強烈的獎勵訊號,RL 就能用較少範例逐步爬升,但要做好得投入實際工作;若已有高品質資料,SFT 是更快的途徑,而且「不會帶來推理能力,也不會提升推理能力」。

本講論文沒有 COI——是六場整理出的講座中第一場。STaR 出自另一個史丹佛實驗室,DeepSeekMath 和 DAPO 則來自業界實驗室。唯一的自我指涉較為間接,而且對她不利:PaLM 是 Minerva 改進、DeepSeekMath 勝過的模型,而她正是 PaLM 論文的主要作者。

第 7 講:兩種情境下,將搜尋視為篩選#

她的第三場個人授課(2025-10-17)是作業講解,開場便以全課最精簡的說法,指出測試時運算仍有哪些未解之處:「我們大致知道解答存在於模型的搜尋空間中,但要如何從模型輸出的搜尋空間中篩選出答案?」內容分成兩部分——AlphaCode / AlphaCode 2(Selection Under a Submission Budget),以及 RAG → agentic RAG → Search-o1 的階梯(Retrieval Inside the Reasoning Chain)——完整脈絡見 CS329A: Self-Improving AI Agents (Stanford)。

以下三個立場屬於她:

  • 提升基礎模型,比提高取樣預算更便宜。「讓模型變得更好,是比擴大樣本數稍容易的一條路」——一名學生提議將對數線性曲線外推到一兆個樣本時,她如此回應;AlphaCode 2 以 100 個樣本達到 AlphaCode 使用 1,000,000 個樣本的解題率,則是證據。請注意,這是同一門課程;五講之前,課程才在簡單與中等難度題目上支持相反取捨。她談的是難題,但沒有明說。
  • 擴展定律受多樣性限制,而非運算量。「你大致上是假設取樣越多,多樣性就會持續增加……若多取樣 10×,卻沒有得到更多樣化的解答,那實際上就不會進步。」這是本文語料中最清楚說明分群何以有雙重用途的說法——它既能挑選提交結果,也能衡量額外預算是否帶來任何收穫(Latent Capability Overhang)。
  • 她點出了過度自信的運作機制。 當被問到輸出機率是否與正確性相關時,她指出,彙整後的 log-probabilities 會系統性地過度自信——模型正確率 50%,聽起來卻像有 80% 把握(只是示意,不是測量結果)——並且在行為上表現為模型被糾正時「不改變想法」。她稱「知道自己知道什麼」是正在積極研究的領域,並把它列為一項專題。這與她在第 4 講拒絕根據自評信心來決定是否使用工具的立場一致;參見 Confident But Unsure。

本講論文也沒有作者身分相關 COI——這是連續第三場。AlphaCode 與 AlphaCode 2 出自 DeepMind,Search-o1 出自 Renmin University。仍有兩項未揭露的關聯:她說 AlphaCode 2 是「這項研究是在 Google 完成的」,卻沒提到自己曾任職於 Google Brain;她將 Large Language Monkeys 歸功於「Azalia 講過這篇」,指的是共同授課者的講座,而非共同授課者的作者身分。

第 8 講:代理評估的三把尺,以及較保守的一把#

她的第四場、也是最後一場個人授課(2025-11-17)檢視三個基準測試——METR 的時間跨度(Task Time-Horizon Scaling)、OpenAI 的 GDPval,以及 DeepScholar-Bench(Deep Research Agents)——整體論點是沒有任何單一數字足以完成評估:持續時間、經濟價值與綜整品質是三條軸線,而且「你仍需要讓能解決這些任務的人類來驗證它們」。

以下兩個立場是她提出的,而非論文提出的:

  • 她以 GDPval 阻止自己所在領域慣用的外推。「看到指數趨勢時,人們往往會假設,好,現在 AI 能做一小時的工作,接下來就能做幾個小時」——她用 GDPval 大致線性的勝率曲線來反駁。出自一門以自我改進飛輪為論點的課程授課者之口,這是刻意踩下的煞車。
  • 人類剩下的工作是設計問題,而非解題。「人類基本上是在設計一組問題,然後模型就可以去解決」——她在一堂課中引述三項彼此獨立的發現支持此說:模型符合的是低上下文承包商所需的時間,而非維護者所需的時間;GDPval 提示若規格不足,模型就無法判斷該做什麼;DeepScholar-Bench 系統能找出相關論文,卻會漏掉專家理應知道的基礎論文。參見 Context Advantage, Not Taste。

當被問到兩年後自己的工作會是什麼樣子時,她避開 AGI 的框架,改為提出一個定義:「當 AI 能自行打造下一代模型時,我們甚至不必在場」——她說目前的狀態是 AI co-scientist,是很強的腦力激盪夥伴,還不是那樣。她認為最難的問題是可靠性的長尾,並將其歸因於「資料問題與模型根本能力問題兩者的混合」;她也指出分散式系統是模型仍然吃力的領域。

連續第三講沒有作者身分 COI——METR 是獨立評估者,GDPval 出自 OpenAI,DeepScholar-Bench 則來自史丹佛與柏克萊的研究團隊,並非任一位授課者的研究。唯一尚存的關聯是,一位史丹佛兼任教授把第三篇論文描述為「出自史丹佛」,卻未說明自己不是作者;這種遺漏往無害的方向偏移。

第 9 講:她留給全班的三個瓶頸#

結尾講座(2025-12-05)由兩人共同授課——她負責檢視三篇 2025 年論文,Mirhoseini 則談效率——她挑選的內容不同於一般「未來方向」演講,按照自我改進迴路中三項仍由人類提供或不可靠的明確輸入來編排,每項各對應一篇論文:

瓶頸論文作法
推理鏈的多樣性不足,無法維持迴路運作Multiagent Finetuning — Rationale Bootstrapping (STaR)從一個基礎模型培養出專家模型
驗證器不可靠,甚至會捏造自己的錯誤DeepSeek-Math V2 — Process vs Outcome Reward Models以中介驗證器評分驗證器的分析
訓練提示仍由人類專家靜態整理Absolute Zero — Rationale Bootstrapping (STaR)模型在可學習性獎勵下自行提出任務

她對三者的總結,也是課程以一句話收尾的論點:「要實現真正的泛化與推理,我們確實需要推理鏈有足夠多樣性……需要更好的驗證……第三點則是資料本身的選擇。」這三點都談的是迴路的輸入,而非迴路的演算法;一門講自我改進的課程以此作結,值得注意。

以下兩個立場屬於她個人:

  • 可驗證性是問題分解的特性,不是領域的特性。 她舉的 KernelBench 例子,是問答中最有力的說明:編譯器和執行檢查能免費驗證一個 GPU kernel,但如果要讀取大型串接程式的效能剖析結果,就無法如此驗證——因此實務上應把問題拆成模型能處理的部分,其餘部分則交給模型一個參考知識庫。她說到一半還提到,自己「現在確實是在描述一個課堂專題」。參見 The Verifiability Thesis。
  • 規模項,她說了兩次。 Absolute Zero 的研究結果和 Mirhoseini 的 SWiRL 經驗都顯示,較大的模型更能吸收合成資料飛輪的效益——這代表自我改進與擴展互補,而非繞過擴展的途徑。兩位授課者都沒有明說這個結論。

COI:相隔三場沒有授課者著作的講座後,相關作品再次出現——但在課程另一半。 她談的三篇論文分別出自 MIT/Google、DeepSeek 與 Tsinghua,所以她負責的部分連續第四講都沒有 COI;利益衝突出現在 Mirhoseini 談每瓦智慧的段落,並在那裡具名揭露。她尚存的一項關聯無傷大雅:她把 KernelBench 歸於「你[實驗室]裡的史丹佛研究」,以第二人稱歸功於共同授課者,讓教室裡的人知道這層關係,讀者卻無從得知。

相關連結#

  • CS329A: Self-Improving AI Agents (Stanford) — 共同授課教師;擴展史與代理兩部分由她負責
  • Process vs Outcome Reward Models — 第 9 講的中間那篇論文:DeepSeek-Math V2 的中介驗證器,是課程自第 3 講以來在驗證脈絡中一直暗示的階梯
  • GDPval Benchmark — 第 8 講的中間部分;直到 2026-09-10 為止,也是維基唯一介紹這個基準測試的內容。如今主要論文已納入語料,她對投影片的解讀可以接受檢驗,而且大致站得住腳:任務、職業、產業與黃金子集的數量、約 $400 的任務價值、參考檔案與規格明確的比例、兩端的勝率、GPT-5 失敗嚴重程度分布,以及成本與速度比率,都和自動字幕逐字稿中的口頭說法相符。三項內容不符——產業選擇規則、O*NET 數位篩選條件,以及把兩張不同圖表混為一談、誤讀成一條從 12% 到 48% 的線性趨勢。這對仔細授課者的基準測試摘要有多大參考價值,是很好的校準例子:大多數內容都可信,但方法論部分最不可靠
  • Task Time-Horizon Scaling — 第 8 講的第一部分:本文語料中唯一說明 METR 時間跨度實際如何建構的內容,以及她指出的三項限制
  • Context Advantage, Not Taste — 她在第 8 講綜整中得出的論點,源自三個原本並非為了測試這件事而設計的基準測試
  • Selection Under a Submission Budget — 第 7 講的程式設計部分;她提出的「更好的模型勝過更多樣本」原則,以及多樣性上限,都在此展開
  • Retrieval Inside the Reasoning Chain — 第 7 講的檢索部分:從 RAG 到 Search-o1 的階梯,以及作為知識缺口觸發訊號的保留語氣 token
  • Confident But Unsure — 她在兩講中兩度指出校準失靈,每次都選擇繞過,而非提出解法
  • Rationale Bootstrapping (STaR) — 第 6 講的第一篇論文,也是維基中最早一個真正改動權重的自我改進迴路
  • Group Relative Policy Optimization (GRPO) — 第 6 講的第二與第三部分:GRPO 的起源,以及 DAPO 為長推理鏈 RL 提出的四項修正
  • Effective Compute Scaling — 她對 RL 占比的估計,以及對 Grok 4 的評估,都收錄於此
  • Reasoning–Acting Interleaving (ReAct) — 她在第 4 講的逐步講解,是本維基對這個模式的定義
  • RL from Execution Feedback (RLEF) — 同一講中關於程式設計的部分
  • Same-Model Review Blindness — 她主張偏好跨模型批評,這與共同授課者所說模型偏愛自身生成內容的主張相矛盾
  • Azalia Mirhoseini — 共同授課教師;兩人在 Google Brain 相識
  • Compute-Controlled Benchmarking — 她對 coverage 與 pass@1 的區分,是從訓練角度表述該頁面的規則
  • The Verifiability Thesis — 她所說的 generator–verifier gap,與課程用語表達的是同一論點
  • Large-Scale Test-Time Compute — coverage→pass@1 的轉換在此展開

資料來源#

  • CS329A Self-Improving AI Agents — Part 1: Course Overview — CS329A 第 1 講(2025-09-22 授課,2026-08-03 發布,practitioner-opinion):擴展定律史、ChatGPT 後訓練技術堆疊、coverage 與 pass@1、generator–verifier gap、從聊天機器人轉向代理及工作流程模式
  • CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code — CS329A 第 4 講(2025-10-03 授課,2026-08-03 發布,practitioner-opinion),她的第一場個人授課:ReAct / RLEF / Constitutional AI 的回饋來源分類法、上述關於校準與自我批評的立場,以及結尾討論為何工作流程而非 token 生成才是領域特有部分。她對 PaLM 和她提及的機器人合作研究存在未揭露的 COI
  • CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL — CS329A 第 6 講(2025-10-10 授課,2026-08-03 發布,practitioner-opinion),她的第二場個人授課:以 STaR / DeepSeekMath / DAPO 為主的訓練時擴展階梯、三篇論文共同受到的 majority@K 而非 pass@K 限制、SFT 與 RL 的選擇依據、2025 年末對 RL 占比的估計及與 Grok 4 的比較,以及結尾的未解問題清單。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於 raw/。這是她第一場所教論文沒有作者身分利益衝突的講座
  • CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks — CS329A 第 8 講(2025-11-17 授課,2026-08-03 發布,practitioner-opinion),她的第四場個人授課:METR 時間跨度的方法與限制、GDPval 的設計及勝率趨勢,以及明確的線性與指數趨勢對比、DeepScholar-Bench 的三條軸線與低於 19% 的上限、跨基準測試綜整,以及結尾問答中關於可靠性長尾與她個人兩年展望的討論。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於 raw/。沒有作者身分利益衝突——連續第三場
  • CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents — CS329A 第 7 講(2025-10-17 授課,2026-08-03 發布,practitioner-opinion),她的第三場個人授課:以篩選為核心的框架、AlphaCode / AlphaCode 2 的講解,涵蓋 10@k 與 pass@k 指標及篩選瓶頸落差、「更好的模型勝過更多樣本」原則與外推對數線性擴展的多樣性上限、RAG → agentic RAG → Search-o1 階梯及保留語氣 token 觸發條件與逐文件壓縮,以及結尾關於 log-probability 校準的討論。數值來自自動字幕逐字稿中的投影片判讀;論文均未收錄於 raw/。沒有作者身分利益衝突,但有兩項未揭露的關聯(把 AlphaCode 2 描述為「這項研究是在 Google 完成的」;Large Language Monkeys 則歸功於共同授課者的講座,而非她的作者身分)
  • CS329A Self-Improving AI Agents — Part 9: Future Research Areas — CS329A 第 9 講(2025-12-05 授課,2026-08-03 發布,practitioner-opinion),與 Azalia Mirhoseini 共同授課:她負責課程回顧與三項瓶頸的調查,涵蓋 Multiagent Finetuning、DeepSeek-Math V2 和 Absolute Zero,另有結尾關於不可驗證領域的問答和 KernelBench 分解論點。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於 raw/。她介紹的論文沒有作者身分利益衝突——連續第四場;本場利益衝突出現在共同授課者負責的效率部分,並在該處揭露。另有一項關聯:KernelBench 被她以第二人稱歸功於共同授課者
§ end
Cited by 24
Related articles
  • CS329A: Self-Improving AI Agents (Stanford)

    Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Latent Capability Overhang

    Noam Brown's claim that already-released models can do far more than anyone has extracted, because nobody spends enough…

  • Process vs Outcome Reward Models

    The four-year arc of trained LLM verifiers as taught in CS329A lecture 3: OpenAI's GSM8K verifier (score the finished s…