資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview
- CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code
- CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL
- CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents
- CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks
- CS329A Self-Improving AI Agents — Part 9: Future Research Areas
摘要#
Aakanksha Chowdhery 是史丹佛大學兼任教授,也是 CS329A 的共同授課教師,並在 Reflection AI 從事研究。她先前任職於 Google Brain,在那裡認識了共同授課教師 Azalia Mirhoseini;她是 PaLM 論文的主要作者,也是 Pathways 的共同作者,並共同撰寫 self-consistency 研究(Wang et al. 2022)。每當本文語料的參考文獻提到先取樣再彙整,這項研究就會再次出現。
她負責 CS329A 第 1 講中關於預訓練與擴展的部分,以及從聊天機器人到代理的整個部分。
她值得獨立成篇的框架:涵蓋率不等於能力#
當被問到推理模型是否真的能做出基礎模型做不到的事時,Chowdhery 提出了維基其他地方以基準測試規則表達的區分:
「如果你只有一個剛完成預訓練的基礎模型,它也能做一些推理。但同時,它會生成不同種類的推理鏈,而且不太知道哪一個才正確。因此,我們在訓練時或測試時擴展中會談到的許多內容,歸根究柢都是學會哪一個才正確。所以 pass@1 準確度會提升……相較之下,pass@k 或涵蓋率,才是你在重複取樣結果中看到的東西。」
這是 Compute-Controlled Benchmarking 報告規則背後的機制面(「只有 pass@k 看得到的提升,提升的是嘗試次數,不是能力」):訓練迴路正是把前者轉變為後者的關鍵。相關內容詳見 Large-Scale Test-Time Compute。
她也謹慎說明,這並沒有解決哪些問題,並在聽眾追問時直言:能力躍升究竟源自 RL,還是來自多樣化的預訓練資料,「沒有單一共識」;「兩種過程都有幫助」;而這個迴路「還沒有完全弄清楚——這只是生命初現的跡象,而且開始商業化」。身為教授這些內容的授課者,她明確拒絕過度宣稱,這點相當少見。
generator–verifier gap#
她用這個名稱指稱課程中的瓶頸:模型能低成本地生成——「一大堆胡言亂語或合理的推理軌跡」——真正卡住的是告訴你哪些結果正確的回饋。若驗證可機械化(數學、程式碼、規則明確的領域),迴路就能閉合;若不可機械化(她舉的例子是創意寫作),人類回饋就會成為瓶頸,模型改進也會停滯。參見 The Verifiability Thesis 與 Verification as the New Bottleneck。
關於代理(2025 年末,practitioner-opinion)#
- 代理與聊天機器人的差別在於有一個目標:規劃、對環境採取行動、讀取回饋、修正,並決定何時停止——或回來說明目標無法達成。工具與記憶是由目標推導而來,而非相反。
- 真正部署的系統仍是手工打造的靜態工作流程圖;開放式迴路只在程式設計與深度研究中呈現「生命初現」的跡象(Agent Loop Pattern)。
- 釐清使用者意圖是代理的重要步驟,不是禮貌而已:「使用者通常沒有把問題說清楚」,代理必須先釐清,才能知道要依據什麼來驗證(Unknowns as the Agentic Bottleneck)。
- 程式設計代理變得可靠,是靠更好的模型和帶有可驗證獎勵的 RL,而不是新架構——「整個典範非常相似」。
第 4 講:依回饋來源梳理自我改進#
她的第一場個人授課(2025-10-03)是課程從「驗證器有多好」轉向「訊號究竟來自哪裡」的關鍵,內容以三篇論文、三種答案編排:環境(ReAct)、解譯器(RLEF),以及模型本身(Constitutional AI,見 Alignment Fine-Tuning (AFT))。這套分類法出自她之手,也是最有用的部分——她是依序轉述各篇論文,而非進行衡量。
有三個立場值得歸於她:
- Grounding 是因應校準不佳的權宜之計,並未解決問題本身。 當被追問模型如何決定何時搜尋時,她不接受這個提問框架:要求模型評估自身信心時,「校準並不好……這仍是正在解決的研究問題」,所以應用程式應繞過這個問題,把使用工具設為預設行為,而非依賴自我評估來決定是否啟用。參見 Confident But Unsure 與 Trained Calibration。
- 自我批評是 AI 回饋中較弱的一種。 她在總結 Constitutional AI 後續文獻時主動提出:「很多時候,要模型批評自己反而更難。因此,讓其他模型形成共識、共同批評這些模型,有時效果更好,因為模型可能過度自信。」她的共同授課者明確表示直覺相反(模型「喜歡自己生成的內容」),而本維基的衡量結果支持 Chowdhery 的看法。
- 工作流程才是領域特有的部分,這就是 ReAct 無法泛化的原因。 當被問到 RL 後訓練是否讓 ReAct 抽象過時時,她回答:若能定義搜尋空間,是;但「所有任務的搜尋空間都沒有明確定義」則否——會計代理、法律代理和財務代理各自遵循不同步驟,而難以自動化的是步驟順序,不是 token 生成。這和她在第 1 講中對代理與工作流程圖的區分一致,如今她進一步指出,這正是工作流程圖仍須手工打造的原因。
COI,未揭露,規模雖小卻確實存在。 她教授的 ReAct 結果使用 PaLM,而她是該模型論文的主要作者;她推薦的列舉有效動作技巧,來自「另一篇我們與 Google 機器人研究夥伴合作的論文」,也就是她自己的研究;Constitutional AI 則是她共同授課者的論文。她在講座中都沒有標示這些關係。
第 6 講:迴路閉合,但她也界定其上限#
她的第二場個人授課(2025-10-10)正是這門課開設的目的——訓練時擴展,定義為「取用模型輸出的結果,套用這種測試時擴展後進行篩選,再用這些結果進一步微調」——並以三階梯呈現:STaR、接著是 DeepSeekMath/GRPO,最後是 DAPO。完整脈絡見 CS329A: Self-Improving AI Agents (Stanford);真正屬於她個人觀點的是,她明確說出了上限。
她在第 1 講提出的框架指出,訓練迴路能將涵蓋率轉變為 pass@1。第 6 講補上這句話的另一半,而且對課程的論點沒那麼有利:DeepSeekMath 的 RL 提升了 majority@K,而非 pass@K,因此「模型實際上變得更一致,而不是從根本上更聰明」——她接著把這個結論推廣到剛教完的三篇論文:「這些方法都還無法提升根本能力,也無法教會模型解決新問題,或大幅泛化到領域外」,能力的重大躍升反而來自「突破或擴展」。相關內容詳見 Large-Scale Test-Time Compute。
另外兩個立場也值得歸於她:
- 訓練中 RL 所占比例,以及與之對照評估的供應商說法。 當被問到目前前沿模型訓練中,RL 相對於在爬取文字上進行 next-token prediction 的占比時,她估計約為一年前的 1%,現在可能約 5%——並明確說明這不是在描述 Anthropic,因為該公司並未公布相關數據——還指出 Grok 4 聲稱使用 50% RL,但「實際上沒有帶來相稱的提升」,因為「獎勵不夠強,或是獎勵有雜訊」。這是少數公開的此類數字之一,她同時也指出了其限制。參見 Effective Compute Scaling。
- SFT 與 RL,作為選擇依據。 只要有強烈的獎勵訊號,RL 就能用較少範例逐步爬升,但要做好得投入實際工作;若已有高品質資料,SFT 是更快的途徑,而且「不會帶來推理能力,也不會提升推理能力」。
本講論文沒有 COI——是六場整理出的講座中第一場。STaR 出自另一個史丹佛實驗室,DeepSeekMath 和 DAPO 則來自業界實驗室。唯一的自我指涉較為間接,而且對她不利:PaLM 是 Minerva 改進、DeepSeekMath 勝過的模型,而她正是 PaLM 論文的主要作者。
第 7 講:兩種情境下,將搜尋視為篩選#
她的第三場個人授課(2025-10-17)是作業講解,開場便以全課最精簡的說法,指出測試時運算仍有哪些未解之處:「我們大致知道解答存在於模型的搜尋空間中,但要如何從模型輸出的搜尋空間中篩選出答案?」內容分成兩部分——AlphaCode / AlphaCode 2(Selection Under a Submission Budget),以及 RAG → agentic RAG → Search-o1 的階梯(Retrieval Inside the Reasoning Chain)——完整脈絡見 CS329A: Self-Improving AI Agents (Stanford)。
以下三個立場屬於她:
- 提升基礎模型,比提高取樣預算更便宜。「讓模型變得更好,是比擴大樣本數稍容易的一條路」——一名學生提議將對數線性曲線外推到一兆個樣本時,她如此回應;AlphaCode 2 以 100 個樣本達到 AlphaCode 使用 1,000,000 個樣本的解題率,則是證據。請注意,這是同一門課程;五講之前,課程才在簡單與中等難度題目上支持相反取捨。她談的是難題,但沒有明說。
- 擴展定律受多樣性限制,而非運算量。「你大致上是假設取樣越多,多樣性就會持續增加……若多取樣 10×,卻沒有得到更多樣化的解答,那實際上就不會進步。」這是本文語料中最清楚說明分群何以有雙重用途的說法——它既能挑選提交結果,也能衡量額外預算是否帶來任何收穫(Latent Capability Overhang)。
- 她點出了過度自信的運作機制。 當被問到輸出機率是否與正確性相關時,她指出,彙整後的 log-probabilities 會系統性地過度自信——模型正確率 50%,聽起來卻像有 80% 把握(只是示意,不是測量結果)——並且在行為上表現為模型被糾正時「不改變想法」。她稱「知道自己知道什麼」是正在積極研究的領域,並把它列為一項專題。這與她在第 4 講拒絕根據自評信心來決定是否使用工具的立場一致;參見 Confident But Unsure。
本講論文也沒有作者身分相關 COI——這是連續第三場。AlphaCode 與 AlphaCode 2 出自 DeepMind,Search-o1 出自 Renmin University。仍有兩項未揭露的關聯:她說 AlphaCode 2 是「這項研究是在 Google 完成的」,卻沒提到自己曾任職於 Google Brain;她將 Large Language Monkeys 歸功於「Azalia 講過這篇」,指的是共同授課者的講座,而非共同授課者的作者身分。
第 8 講:代理評估的三把尺,以及較保守的一把#
她的第四場、也是最後一場個人授課(2025-11-17)檢視三個基準測試——METR 的時間跨度(Task Time-Horizon Scaling)、OpenAI 的 GDPval,以及 DeepScholar-Bench(Deep Research Agents)——整體論點是沒有任何單一數字足以完成評估:持續時間、經濟價值與綜整品質是三條軸線,而且「你仍需要讓能解決這些任務的人類來驗證它們」。
以下兩個立場是她提出的,而非論文提出的:
- 她以 GDPval 阻止自己所在領域慣用的外推。「看到指數趨勢時,人們往往會假設,好,現在 AI 能做一小時的工作,接下來就能做幾個小時」——她用 GDPval 大致線性的勝率曲線來反駁。出自一門以自我改進飛輪為論點的課程授課者之口,這是刻意踩下的煞車。
- 人類剩下的工作是設計問題,而非解題。「人類基本上是在設計一組問題,然後模型就可以去解決」——她在一堂課中引述三項彼此獨立的發現支持此說:模型符合的是低上下文承包商所需的時間,而非維護者所需的時間;GDPval 提示若規格不足,模型就無法判斷該做什麼;DeepScholar-Bench 系統能找出相關論文,卻會漏掉專家理應知道的基礎論文。參見 Context Advantage, Not Taste。
當被問到兩年後自己的工作會是什麼樣子時,她避開 AGI 的框架,改為提出一個定義:「當 AI 能自行打造下一代模型時,我們甚至不必在場」——她說目前的狀態是 AI co-scientist,是很強的腦力激盪夥伴,還不是那樣。她認為最難的問題是可靠性的長尾,並將其歸因於「資料問題與模型根本能力問題兩者的混合」;她也指出分散式系統是模型仍然吃力的領域。
連續第三講沒有作者身分 COI——METR 是獨立評估者,GDPval 出自 OpenAI,DeepScholar-Bench 則來自史丹佛與柏克萊的研究團隊,並非任一位授課者的研究。唯一尚存的關聯是,一位史丹佛兼任教授把第三篇論文描述為「出自史丹佛」,卻未說明自己不是作者;這種遺漏往無害的方向偏移。
第 9 講:她留給全班的三個瓶頸#
結尾講座(2025-12-05)由兩人共同授課——她負責檢視三篇 2025 年論文,Mirhoseini 則談效率——她挑選的內容不同於一般「未來方向」演講,按照自我改進迴路中三項仍由人類提供或不可靠的明確輸入來編排,每項各對應一篇論文:
| 瓶頸 | 論文 | 作法 |
|---|---|---|
| 推理鏈的多樣性不足,無法維持迴路運作 | Multiagent Finetuning — Rationale Bootstrapping (STaR) | 從一個基礎模型培養出專家模型 |
| 驗證器不可靠,甚至會捏造自己的錯誤 | DeepSeek-Math V2 — Process vs Outcome Reward Models | 以中介驗證器評分驗證器的分析 |
| 訓練提示仍由人類專家靜態整理 | Absolute Zero — Rationale Bootstrapping (STaR) | 模型在可學習性獎勵下自行提出任務 |
她對三者的總結,也是課程以一句話收尾的論點:「要實現真正的泛化與推理,我們確實需要推理鏈有足夠多樣性……需要更好的驗證……第三點則是資料本身的選擇。」這三點都談的是迴路的輸入,而非迴路的演算法;一門講自我改進的課程以此作結,值得注意。
以下兩個立場屬於她個人:
- 可驗證性是問題分解的特性,不是領域的特性。 她舉的 KernelBench 例子,是問答中最有力的說明:編譯器和執行檢查能免費驗證一個 GPU kernel,但如果要讀取大型串接程式的效能剖析結果,就無法如此驗證——因此實務上應把問題拆成模型能處理的部分,其餘部分則交給模型一個參考知識庫。她說到一半還提到,自己「現在確實是在描述一個課堂專題」。參見 The Verifiability Thesis。
- 規模項,她說了兩次。 Absolute Zero 的研究結果和 Mirhoseini 的 SWiRL 經驗都顯示,較大的模型更能吸收合成資料飛輪的效益——這代表自我改進與擴展互補,而非繞過擴展的途徑。兩位授課者都沒有明說這個結論。
COI:相隔三場沒有授課者著作的講座後,相關作品再次出現——但在課程另一半。 她談的三篇論文分別出自 MIT/Google、DeepSeek 與 Tsinghua,所以她負責的部分連續第四講都沒有 COI;利益衝突出現在 Mirhoseini 談每瓦智慧的段落,並在那裡具名揭露。她尚存的一項關聯無傷大雅:她把 KernelBench 歸於「你[實驗室]裡的史丹佛研究」,以第二人稱歸功於共同授課者,讓教室裡的人知道這層關係,讀者卻無從得知。
相關連結#
- CS329A: Self-Improving AI Agents (Stanford) — 共同授課教師;擴展史與代理兩部分由她負責
- Process vs Outcome Reward Models — 第 9 講的中間那篇論文:DeepSeek-Math V2 的中介驗證器,是課程自第 3 講以來在驗證脈絡中一直暗示的階梯
- GDPval Benchmark — 第 8 講的中間部分;直到 2026-09-10 為止,也是維基唯一介紹這個基準測試的內容。如今主要論文已納入語料,她對投影片的解讀可以接受檢驗,而且大致站得住腳:任務、職業、產業與黃金子集的數量、約 $400 的任務價值、參考檔案與規格明確的比例、兩端的勝率、GPT-5 失敗嚴重程度分布,以及成本與速度比率,都和自動字幕逐字稿中的口頭說法相符。三項內容不符——產業選擇規則、O*NET 數位篩選條件,以及把兩張不同圖表混為一談、誤讀成一條從 12% 到 48% 的線性趨勢。這對仔細授課者的基準測試摘要有多大參考價值,是很好的校準例子:大多數內容都可信,但方法論部分最不可靠
- Task Time-Horizon Scaling — 第 8 講的第一部分:本文語料中唯一說明 METR 時間跨度實際如何建構的內容,以及她指出的三項限制
- Context Advantage, Not Taste — 她在第 8 講綜整中得出的論點,源自三個原本並非為了測試這件事而設計的基準測試
- Selection Under a Submission Budget — 第 7 講的程式設計部分;她提出的「更好的模型勝過更多樣本」原則,以及多樣性上限,都在此展開
- Retrieval Inside the Reasoning Chain — 第 7 講的檢索部分:從 RAG 到 Search-o1 的階梯,以及作為知識缺口觸發訊號的保留語氣 token
- Confident But Unsure — 她在兩講中兩度指出校準失靈,每次都選擇繞過,而非提出解法
- Rationale Bootstrapping (STaR) — 第 6 講的第一篇論文,也是維基中最早一個真正改動權重的自我改進迴路
- Group Relative Policy Optimization (GRPO) — 第 6 講的第二與第三部分:GRPO 的起源,以及 DAPO 為長推理鏈 RL 提出的四項修正
- Effective Compute Scaling — 她對 RL 占比的估計,以及對 Grok 4 的評估,都收錄於此
- Reasoning–Acting Interleaving (ReAct) — 她在第 4 講的逐步講解,是本維基對這個模式的定義
- RL from Execution Feedback (RLEF) — 同一講中關於程式設計的部分
- Same-Model Review Blindness — 她主張偏好跨模型批評,這與共同授課者所說模型偏愛自身生成內容的主張相矛盾
- Azalia Mirhoseini — 共同授課教師;兩人在 Google Brain 相識
- Compute-Controlled Benchmarking — 她對 coverage 與 pass@1 的區分,是從訓練角度表述該頁面的規則
- The Verifiability Thesis — 她所說的 generator–verifier gap,與課程用語表達的是同一論點
- Large-Scale Test-Time Compute — coverage→pass@1 的轉換在此展開
資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview — CS329A 第 1 講(2025-09-22 授課,2026-08-03 發布,
practitioner-opinion):擴展定律史、ChatGPT 後訓練技術堆疊、coverage 與 pass@1、generator–verifier gap、從聊天機器人轉向代理及工作流程模式 - CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code — CS329A 第 4 講(2025-10-03 授課,2026-08-03 發布,
practitioner-opinion),她的第一場個人授課:ReAct / RLEF / Constitutional AI 的回饋來源分類法、上述關於校準與自我批評的立場,以及結尾討論為何工作流程而非 token 生成才是領域特有部分。她對 PaLM 和她提及的機器人合作研究存在未揭露的 COI - CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL — CS329A 第 6 講(2025-10-10 授課,2026-08-03 發布,
practitioner-opinion),她的第二場個人授課:以 STaR / DeepSeekMath / DAPO 為主的訓練時擴展階梯、三篇論文共同受到的 majority@K 而非 pass@K 限制、SFT 與 RL 的選擇依據、2025 年末對 RL 占比的估計及與 Grok 4 的比較,以及結尾的未解問題清單。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於raw/。這是她第一場所教論文沒有作者身分利益衝突的講座 - CS329A Self-Improving AI Agents — Part 8: Agentic Evaluations and Long-Horizon Tasks — CS329A 第 8 講(2025-11-17 授課,2026-08-03 發布,
practitioner-opinion),她的第四場個人授課:METR 時間跨度的方法與限制、GDPval 的設計及勝率趨勢,以及明確的線性與指數趨勢對比、DeepScholar-Bench 的三條軸線與低於 19% 的上限、跨基準測試綜整,以及結尾問答中關於可靠性長尾與她個人兩年展望的討論。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於raw/。沒有作者身分利益衝突——連續第三場 - CS329A Self-Improving AI Agents — Part 7: Self-Improvement and Deep Research Agents — CS329A 第 7 講(2025-10-17 授課,2026-08-03 發布,
practitioner-opinion),她的第三場個人授課:以篩選為核心的框架、AlphaCode / AlphaCode 2 的講解,涵蓋 10@k 與 pass@k 指標及篩選瓶頸落差、「更好的模型勝過更多樣本」原則與外推對數線性擴展的多樣性上限、RAG → agentic RAG → Search-o1 階梯及保留語氣 token 觸發條件與逐文件壓縮,以及結尾關於 log-probability 校準的討論。數值來自自動字幕逐字稿中的投影片判讀;論文均未收錄於raw/。沒有作者身分利益衝突,但有兩項未揭露的關聯(把 AlphaCode 2 描述為「這項研究是在 Google 完成的」;Large Language Monkeys 則歸功於共同授課者的講座,而非她的作者身分) - CS329A Self-Improving AI Agents — Part 9: Future Research Areas — CS329A 第 9 講(2025-12-05 授課,2026-08-03 發布,
practitioner-opinion),與 Azalia Mirhoseini 共同授課:她負責課程回顧與三項瓶頸的調查,涵蓋 Multiagent Finetuning、DeepSeek-Math V2 和 Absolute Zero,另有結尾關於不可驗證領域的問答和 KernelBench 分解論點。數值來自自動字幕逐字稿中的投影片判讀;三篇論文都未收錄於raw/。她介紹的論文沒有作者身分利益衝突——連續第四場;本場利益衝突出現在共同授課者負責的效率部分,並在該處揭露。另有一項關聯:KernelBench 被她以第二人稱歸功於共同授課者
Cited by 24
- CS329A: Self-Improving AI Agents (Stanford)×11
Lecture 6 (Aakanksha Chowdhery solo, delivered 2025-10-10) is the one the course has been building…
- Large-Scale Test-Time Compute×5
Lecture 6 (cs329a 06 train time scaling rl, delivered 2025-10-10) supplies the measurement that…
- Rationale Bootstrapping (STaR)×4
The loop, as taught (Aakanksha Chowdhery, lecture 6, delivered 2025-10-10, practitioner-opinion):
- RL from Execution Feedback (RLEF)×3
cs329a 04 learning from feedback tools code — CS329A Self-Improving AI Agents — Part 4: Learning…
- GDPval Benchmark×3
This page was originally compiled (2026-08-17) entirely from Aakanksha Chowdhery's lecture 8 of…
- Reasoning–Acting Interleaving (ReAct)×3
cs329a 04 learning from feedback tools code — CS329A Self-Improving AI Agents — Part 4: Learning…
- Retrieval Inside the Reasoning Chain×3
> Evidence. cs329a 07 self improvement deep research agents (Aakanksha Chowdhery solo, delivered…
- Same-Model Review Blindness×3
Aakanksha Chowdhery — her co-instructor states the opposite instinct, in the same course, from the…
- Selection Under a Submission Budget×3
cs329a 07 self improvement deep research agents — CS329A Self-Improving AI Agents — Part 7:…
- The Verifiability Thesis×3
Stanford's CS329A arrives at Karpathy's dichotomy from the training side and gives it a different…
- Alignment Fine-Tuning (AFT)×2
cs329a 04 learning from feedback tools code — CS329A lecture 4 (Aakanksha Chowdhery, delivered…
- Deep Research Agents×2
Everything above is measured on benchmarks where good systems score respectably. DeepScholar-Bench…
- Effective Compute Scaling×2
And a late-2025 number for how much of a frontier training run is now RL. Aakanksha Chowdhery…
- Group Relative Policy Optimization (GRPO)×2
cs329a 06 train time scaling rl — Stanford CS329A lecture 6, Train-Time Scaling and Scaling RL…
- Task Time-Horizon Scaling×2
The "~seven-month doubling" this page treats as the superseded rate is recoverable in full from…
- Agent Loop Pattern
cs329a 01 course overview — Stanford CS329A lecture 1 (Azalia Mirhoseini & Aakanksha Chowdhery,…
- Azalia Mirhoseini
Aakanksha Chowdhery — co-instructor; they met at Google Brain, and lecture 4 is hers
- Claude's Constitution / Model Spec
cs329a 04 learning from feedback tools code — CS329A lecture 4 (Aakanksha Chowdhery, delivered…
- The Data Wall and the Validation Commons Are One Supply Constraint
Effective Compute Scaling records Aakanksha Chowdhery's estimate that the RL-versus-pretraining…
- Latent Capability Overhang
cs329a 01 course overview — Stanford CS329A lecture 1 (Azalia Mirhoseini & Aakanksha Chowdhery,…
- METR
cs329a 08 agentic evaluations long horizon — Aakanksha Chowdhery, Stanford CS329A lecture 8,…
- Entities — People, Orgs, Tools & Projects
Aakanksha Chowdhery — Adjunct professor at Stanford, co-instructor of CS329A, and a researcher at…
- Process vs Outcome Reward Models
The course's closing lecture (cs329a 09 future research areas, Aakanksha Chowdhery, delivered…
- Recursive Self-Improvement
cs329a 01 course overview — Stanford CS329A lecture 1 (Azalia Mirhoseini & Aakanksha Chowdhery,…
Related articles
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Latent Capability Overhang
Noam Brown's claim that already-released models can do far more than anyone has extracted, because nobody spends enough…
- Process vs Outcome Reward Models
The four-year arc of trained LLM verifiers as taught in CS329A lecture 3: OpenAI's GSM8K verifier (score the finished s…
