資料來源#
- OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
摘要#
長期程代理程式會執行數十到數百次工具操作,之後才有任何可供驗證的結果。只看結果的 RL 會把單一軌跡層級的優勢附加到所有操作上,兩方面都不合理:失敗 rollout 中真正有用的早期搜尋,會和導致失敗的錯誤得到相同負優勢;成功 rollout 中多餘的重新讀取,也會和真正找到答案的開啟操作得到相同正優勢。逐回合信用分配試圖將這個單一數值拆分給各個應得獎勵的回合。
傳統補救方式都得以新的監督依賴來換取更密集的訊號——步驟標籤、蒙地卡羅延續、LLM 評審,或分數可能偏離最終答案正確性的訓練過程獎勵模型。TRACE(Tao、Peng、Yao、Ge、Cheng、Wang、Gao、Li——UW–Madison + Microsoft Research,arXiv 2607.13988,v1 2026-07-15,empirical)是本 wiki 首個無需任何一項依賴,就能取得密集逐回合信用的來源。它注意到,在 RLVR 情境中,訓練時已經有黃金答案可用,因此可以把答案當作探針,而非訓練目標。
核心做法:以凍結參考模型作為價值函數#
TRACE 的價值函數不是學出來的。它是凍結的策略初始化副本 π_ref,只用來針對每個軌跡前綴回答一個問題:從這裡出發,黃金答案有多容易預測?
- 在工具呼叫邊界切分 rollout。
τ = (x, a₁, o₁, …, a_T, o_T, ŷ);令S_k表示截至前k組動作–觀察對、接著包含最終答案開頭的前綴。這些前綴轉移就是信用單位,因為它們能隔離各次互動如何改變可用的資訊。 - 為每個前綴評分,計算凍結模型下黃金答案對數機率的平均值,
ℓ̄_k = (1/|y*|) Σ_t log π_ref(y*_t | S_k, y*_<t) ≤ 0。一條軌跡的所有ℓ̄_k都來自單次批次前向傳遞,且從不參與最佳化。 - 轉換為對數比狀態值。 令剩餘差距為
d_k = −ℓ̄_k + ε,設定V(S_k) = log(d_0 / d_k),因此V(S_0) = 0,而V衡量歷史已彌合初始答案可能性差距的比例。 - 以自身邊界上的 TD 變化量為每回合分配信用:
δ_k = V(S_{k+1}) − V(S_k) = log(d_k / d_{k+1})。若動作及其回傳觀察讓黃金答案更可能,數值為正;轉移恰好讓剩餘差距減半時為log 2;差距不變時為零;軌跡偏離答案時則為負。 - 混合,而非取代。 工具互動 token 的逐 token 優勢為
 = α_out·A^out + α_turn·r^turn,其中α_out = 1.0、α_turn = 0.2,而A^out是一般的 GRPO 群組相對結果優勢。目標函數維持原樣,仍是經裁切的 GRPO 替代目標。驗證器仍是最終裁決者;逐回合信用只是輔助訊號。逐回合價值刻意不做群組正規化:它是軌跡內的訊號。
值得記住的設計說明是參考模型的定位:它的用途是**「不是當評審,而是當穩定探針」**。凍結模型可避免它變成另一個有自身漂移問題的學習式獎勵模型;第 4 步將模型與自身做差,因此其絕對校準誤差大多會抵消。
為何使用對數比,而不是原始對數機率差#
因為相同的絕對增益,在離答案的不同距離上意義不同:剩餘差距從 0.2 → 0.1,代表不確定性減半;從 5.1 → 5.0 則幾乎沒有變化。論文中的計算範例(§A.2)比較兩次原始增益幾乎相同的轉移:ℓ̄ −5.1187 → −1.5712(Δℓ = 3.5475)和 ℓ̄ −10.6570 → −7.1061(Δℓ = 3.5509),其對數比信用分別為1.1806 和 0.4052——前者彌合了剩餘差距中大得多的比例。
對數比也是唯一能維持望遠鏡式相消的相對差距形式:Σ_k δ_k = V(S_T) − V(S_0) = log((−ℓ̄_0 + ε)/(−ℓ̄_T + ε)),也就是說,總信用只取決於兩個端點。多餘的中間回合不會灌高總分,因此代理程式不會因為填充軌跡而獲得獎勵;線性剩餘差距正規化則不具備這項性質。針對830 個留出 rollout/3,742 個工具回合進行的離線診斷,依表現為三種公式排序(表 6,已根據 pdftotext -layout 校對):
| 原始差值 | 線性剩餘差距 | 對數比 TD | |
|---|---|---|---|
與最終 ℓ̄_T 的相關性 | 0.425 | 0.721 | 0.751 |
| 與正向結果獎勵的相關性 | 0.603 | 0.680 | 0.713 |
成對排序準確率,|Δℓ̄_0| ≤ 0.2 | 97.34% | 93.13% | 98.24% |
請留意中間欄:線性正規化解決了尺度問題,但成對排序的表現是三者中最差的,甚至低於原始差值——這正是表 5 在分析上預測的結果(「保序性:無法保證」,而且「當 d_k 很小時可能飆高」)。
K 步回溯,以及它放棄的性質#
單步 TD 信用會漏掉延遲發生的工具效果:browser.search 可能只列出候選連結,答案可能要等到稍後的 browser.open 顯示關鍵頁面後才變得更可能。因此,每個回合會取得涵蓋自身與後續幾次轉移的折扣式截斷 K 步回溯,c_k^(K) = Z_k⁻¹ Σ_{u=k}^{h_k} γ_td^{u−k} δ_u,其中 h_k = min(k+K−1, T−1);若前瞻視窗延伸至終點,還會加入終局結果補入項 λ_term·γ_td^{T−k}·A^out。論文回報的設定為:K = 3、γ_td = 0.8、λ_term = 2.0、ε_train = 10⁻¹。
論文明確指出,這種方法犧牲了最初促使作者採用對數比的端點限定精確望遠鏡式相消:望遠鏡式相消只適用於單步成分 δ_k;K 步視窗與終局補入項則以此為代價,換取延遲信用傳播與結果錨定。論證中兩項性質都很關鍵,而且無法同時滿足——值得留意,因為常被引用的是防止填充軌跡的保證。
證據顯示什麼,以及開關實際在哪裡#
控制組比較在關鍵處相當乾淨:Base / GRPO / GSPO / GiGRPO / TRACE 共用相同骨幹、瀏覽器動作空間、rollout 流程、訓練資料、終局獎勵與評估介面,因此唯一變數是策略梯度訊號的建構方式。方法採純 RL——無冷啟動 SFT、無代理式中期訓練階段、無即時網路訓練資料、無評審、無 PRM。訓練資料來自 OpenResearcher 離線語料庫中的合成多文件搜尋,刻意設計成需要串接檢索至少 2 份不可替代的文件;批次大小 128、每個提示 8 次 rollout,每條訓練軌跡最多 60 個工具回合(評估上限 80)。
表 1(已逐格對照 pdftotext -layout);論文上方區塊的四個外部代理程式明確是非控制參考點,不可視為可比較的實驗組:
| Qwen3-4B-Thinking-2507 | BC-Plus | BrowseComp | GAIA | xbench-DS | 平均 |
|---|---|---|---|---|---|
| Base | 7.2 | 3.3 | 24.2 | 19.0 | 13.4 |
| GRPO | 30.0 | 5.1 | 38.8 | 44.0 | 29.5 |
| GSPO | 29.7 | 5.4 | 36.7 | 41.0 | 28.2 |
| GiGRPO | 27.7 | 4.4 | 37.9 | 36.0 | 26.5 |
| TRACE | 35.6 | 6.7 | 44.6 | 49.0 | 34.0 |
| Qwen3-30B-A3B-Thinking-2507 | BC-Plus | BrowseComp | GAIA | xbench-DS | 平均 |
|---|---|---|---|---|---|
| Base | 8.4 | 4.4 | 34.1 | 20.0 | 16.7 |
| GRPO | 36.4 | 10.8 | 45.6 | 37.0 | 32.5 |
| GSPO | 39.7 | 11.8 | 46.6 | 35.0 | 33.3 |
| GiGRPO | 33.0 | 10.1 | 44.7 | 31.0 | 29.7 |
| TRACE | 42.6 | 12.9 | 52.0 | 45.0 | 38.1 |
除了標題數字(封閉網路 BrowseComp-Plus 7.2 → 35.6 和 8.4 → 42.6;四項基準平均分數分別為 29.5 → 34.0 和 32.5 → 38.1)之外,還有兩項次要結果值得重視。學習動態:TRACE 的獎勵曲線較早開始上升、前期斜率較陡,最後停在較高的平台;而 30B-A3B 的 TRACE 第 160 步檢查點已經勝過第 200 步的結果獎勵基準,因此這是更快學會,而非後期才拉開差距。軌跡規模:TRACE 的互動長度比 GRPO 更早、更快增加,這背後有符合獎勵設計的機制——只看結果的訓練中,早期較長但仍失敗的軌跡會整體得到低優勢,因此無法區分無益的額外互動與中間進展;局部進展訊號則能在最終答案尚未正確時,就為良好回合給予獎勵。
「邊界信用究竟有沒有影響」的證據到底在哪裡,精確說明。 這點很重要,因為很容易引用錯表:
- 表 2 是論文唯一的正式消融表,隔離的是信用的形式,而非邊界訊號是否存在:GRPO 30.0 → + 原始對數機率差 32.4 → + 線性剩餘差距正規化 34.6 → + 對數比 TD 35.5。在所有表格中,GRPO 那一列最接近「完全沒有逐回合訊號」的情況。
- 真正的開關只出現在圖 5(b),是一張長條圖(依兩階段圖像規則檢視)。文字將
K = 0定義為完全停用密集 TD 回溯,而非回溯公式的輸入值;其分數為 30.0,與 GRPO 基準在統計上沒有顯著差異。非零設定達到 34.7 和 35.6,最大設定則降至 28.9;作者認為這是過度傳播,將關聯較鬆散的後續回合雜訊帶入信用訊號。 - 另外兩個面板:逐回合獎勵係數掃描結果為 33.6 → 35.6 → 34.5 → 31.1,因此過度加權的密集訊號會實際損害表現——「局部參考模型就緒度」開始主導最終正確性,這也是逐回合信用應維持輔助地位的理由。參考檢查點面板則令人安心:沒有參考評分時為 30.0,使用步驟 0 初始化時為 35.6,使用步驟 200 更新後的檢查點則為 36.1——差距約 0.5 分,表示方法不依賴強大或特別調校過的探針,只需要穩定的探針。
引用圖 5 前應了解的來源內部矛盾,本文予以標示但不作解決。 圖 5(b) 的 x 軸標示為 k,刻度卻是小數(0、0.1、0.2、0.5);文字描述的 K 則是整數前瞻範圍,而超參數表列出的主要實驗設定為 K = 3,該軸上並沒有這個值。相對地,圖 5(a) 的係數軸標示為 1、3、5、7,而回報的逐回合獎勵權重是 α_turn = 0.2,該軸上同樣沒有這個值;每個面板的最高長條都是 35.6,正是主要實驗的分數。兩個面板的刻度似乎與回報的超參數對調,但沒有任何解讀方式能同時合理解釋兩個面板,因此無法從已發表的圖表還原數值上「中等」與「最大」K 的意義。這是 PDF 本身的缺陷,不是解析造成的假象——兩個面板的長條高度都與文字敘述完全一致。
尚未釐清之處:跳過觀察的邊界#
TRACE 將整個信用訊號放在 SAO 的跳過觀察 GAE 刻意跨越的工具呼叫邊界上,並對邊界處應有什麼訊號得出相反結論。SAO 認為,從模型的角度看,動作→觀察邊界是不連續的,因此跨越該邊界估計優勢,會迫使評論家預測外部環境狀態的價值並注入雜訊。TRACE 的設計則表示,由觀察引起的價值變化,是整條 rollout 中資訊量最高的單一量值。
這項張力確實存在,但兩者比較只是類比強度,而非消融實驗——TRACE 的基準組合請見 Group Relative Policy Optimization (GRPO),其中沒有任何一組採用 GAE 變體。以下四點說明為何不宜過度解讀:
- 機制不同。 TRACE 的價值是凍結參考模型對黃金答案的對數機率,不是根據回報訓練的評論家。因此它不會像學習式
V_ϕ那樣受到不良邊界估計污染,也不會面臨 SAO 所防範的失效模式。 - 兩者採用相同的損失做法。 兩者都會將工具觀察從策略梯度損失中遮罩掉——TRACE 在 §3.1 明確說明,SAO 也採用相同做法。分歧比表面上窄:問題不是要不要在觀察 token 上訓練,而是跨越觀察的價值差異究竟是訊號還是雜訊。
- 沒有人做過這項實驗。 TRACE 從未提及跳過觀察 GAE,也沒有執行 SAO 或任何 GAE 實驗組;它的任務、骨幹、目標與獎勵都不同。要直接回答這個問題,需要在相同任務上使用相同評論家,比較跳過觀察與跨觀察 GAE。
- TRACE 確實證明的範圍較窄,但依然有用:在長期程搜尋中,觀察會推動價值變化,而且這種變化高度集中。在一條定性軌跡中,提供關鍵片語的
browser.open獲得δ = +5.86;下一回合再次用字面上的find確認該片語,則獲得+0.00——望遠鏡式相消的性質在微型範例中清楚可見。若觀察在此任務中只是價值中性的雜訊,密集訊號就不可能比 GRPO 平均高出 4.5 分。
副產品:找出關鍵回合的工具#
即使不拿來訓練,前綴值也是一種低成本的測量方式,可以判斷哪些回合發揮作用——這是 事後失敗歸因提出的同一個問題,但答案不需評審。TRACE 將 V ≥ −0.3 定義為答案已確定的前綴,並檢視五條成功軌跡和五條失敗軌跡:每條成功軌跡都有一次工具呼叫彌合大部分差距(信用序列例如 [+6.39, +0.59, +0.10, +0.05] 和 [+1.63, −1.03, −1.04, +6.05, +0.03]);每條失敗軌跡則都先抵達答案已確定的前綴,接著在一次診斷工具呼叫後失去此狀態——機械化呈現了「何時」發生變化。懲罰也和獎勵一樣集中:browser.find 回傳 「沒有符合項目」,之後卻被過度解讀為不存在的證據,因而得到 δ = −3.48。這正是論文對此工具的總結:「工具完成不代表取得進展。」
先決條件也正是限制所在:這需要黃金答案,而部署時進行歸因恰好沒有這項資訊。它無法取代未標記軌跡的評審;它是為較簡單版本的問題提供更強的輸入。
誠實界定適用範圍#
論文本身指出了最明確的限制:凍結參考價值代理量,是以簡短且可精確比對的黃金答案有多容易預測來定義。若是產生多檔案修補程式的程式碼代理程式,或需要滿足未充分說明偏好的助理,黃金輸出對數機率是否仍能作為狀態價值代理量,並不明確;作者也指出,要將 TRACE 延伸到這些情境,可能需要完全不同的目標,例如依執行結果判定的進展訊號、結構化任務規格,以及拆解後可驗證的子目標。另外還有兩個限制:控制式消融只進行單次訓練,作者有明確說明,也在消融標題中以「在本次實驗中」保留餘地;整體評估則只涵蓋一種任務家族(搜尋)和一種模型家族(Qwen3 Thinking)。
延伸閱讀#
- Group Relative Policy Optimization (GRPO)——TRACE 本身就是加入第二項優勢的 GRPO;群組相對結果優勢與裁切替代目標都原樣保留,而 GRPO 頁面也記錄了 TRACE 控制基準組對 GRPO 及其改良方法的結果
- Single-Rollout Optimization——設計上的直接衝突:SAO 的跳過觀察 GAE 會將優勢估計導向 TRACE 放置全部訊號的邊界之外
- Asynchronous RL for LLMs——密集信用的系統成本:在單節點共置配置中,TRACE 啟動腳本預設關閉逐回合評分;若要啟用,就需要遠端參考模型評分端點,也就是在訓練拓撲中再加入一個分離式資源池
- Deep Research Agents——TRACE 訓練的代理程式類型,以及同一結果的行為面向:搜尋策略逐回合的行為
- Automated Failure Attribution——在未標記軌跡上事後提出的同一個「哪個回合發揮作用」問題,但此時無法使用黃金答案探針
- Large-Scale Test-Time Compute——逐回合信用使較長的互動預算變得可學習;TRACE 的軌跡規模曲線,是在訓練期間增加回合數的版本
- Process vs Outcome Reward Models——TRACE 所定位的研究脈絡,以及它拒絕的替代方案為何不只「昂貴」。人工步驟標籤(PRM800K)用 800K 筆標註換取真正的過程監督;低成本替代方案(Math-Shepherd)將步驟標籤定義為從該步出發後抵達正確答案的 rollout 比例,因此在難題上不會提供訊號,rollout 數量少時會懲罰罕見但正確的路徑,而且只要整條軌跡最終答對,也會把錯誤的中間步驟標成正向。TRACE 的凍結參考模型探針取得密集信用,無需支付這兩項代價
- RL from Execution Feedback (RLEF)——較粗略的前身。RLEF 會逐回合將程式碼代理程式未通過的公開測試結果放回上下文,接著以最後一個提示 token 的回合層級計算結果,並將單一優勢交給整個情節;TRACE 的貢獻正是把這個數值拆分至 RLEF 未加區分的動作–觀察邊界。RLEF 講義本身以 GSPO 作為比較對象,而本頁的控制表顯示 GSPO 的分數不高於一般 GRPO
- Reasoning–Acting Interleaving (ReAct)——信用單位的來源:TRACE 恰好在 ReAct 引入的思考/動作/觀察邊界切分 rollout;其發現價值變化集中在少數關鍵觀察上,則是 ReAct 查詢改寫如何恢復進展的量化呈現
- Offline Multi-Step Tool-Use RL (SWiRL)——本頁所界定並實際衡量的評審路線。SWiRL 以 TRACE 刻意避開的 LLM 評審依賴換取密集逐步信用,但它將成本放在離線階段:資料生成時只執行一次工具,RL 訓練期間不再執行,且評審評分的是建議的查詢,而非查詢結果。兩者的取捨是 TRACE 需要黃金答案,SWiRL 則受評審上限與凍結的離策略上下文限制
- Interactivity Benchmarks——多回合對話基準在測量方面也有同樣的缺口。OmniVChat(Alibaba Qwen,arXiv 2609.21465,
empirical)採 GSPO 以整則回覆的獎勵進行訓練——包含評分規準、格式、效率與風格分數,完全沒有逐回合拆解——並透過交給每個模型完全相同的先前片段與參考回覆、只為最終回覆評分的方式,評估多回合樣本。這就是教師強制:它讓不同系統間的多回合分數具有可比較性,也使評估在結構上無法將結果歸因給任何回合。作者自己指出,解讀上的缺口因此浮現——Gemini-3.7-Flash 的平均多回合減單回合差距 −0.114,與訓練模型的 −0.026,都是以獨立抽樣的單回合與多回合樣本計算,因此「更多回合」和「不同場景」混淆在一起;而每個多回合子類只有 50 個樣本,每個差距的解析度也只有約 ±0.05。本頁所述的凍結探針前綴值在此並不可用,原因正如「適用範圍」一節指出:目標是開放式口語回覆,而非簡短且可精確比對的黃金答案 - Tree Search over Agent Trajectories (LATS)——整個流程另一端使用相同的回溯運算:LATS 在推論時沿搜尋樹向上傳播終局回報,全程不使用梯度;本頁則在訓練過程中將單一軌跡的回報拆分至各回合
開放問題#
- 凍結探針是策略初始化的副本,而第 200 步檢查點的分數只低約 0.5 分。若探針比策略弱或架構不同,這種穩健性是否仍成立?真正的條件會不會只是探針和答案分布相同?
- 逐回合信用以黃金答案的可預測性定義,因此,若某個前綴只是因為錯誤理由(例如碰巧出現共現字串)讓正確答案變得可能,理應也會和蒐集到真實證據的前綴一樣得到獎勵。凍結探針是否存在訓練式評論家不會有的獎勵駭取管道?這是否會反映在訓練與評估之間的落差上?
- 此處所有結果都來自單一任務家族的單一隨機種子,而 K 掃描圖的座標軸本身也無法解讀。第二個團隊能否重現 GRPO < 原始差值 < 線性差距 < 對數比的排序?還是 32.4/34.6/35.5 的差異落在不同訓練執行之間的雜訊範圍內?
資料來源#
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents——TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents,Leitian Tao(UW–Madison)、Baolin Peng、Wenlin Yao、Tao Ge、Hao Cheng、Mike Hang Wang、Jianfeng Gao(Microsoft Research)、Sharon Li(UW–Madison)。arXiv 2607.13988,v1 2026-07-15,
empirical。§2.1–2.2(代理式 RL 目標、TD 預備知識)、§3.1–3.3(工具邊界狀態、對數比狀態值、K 步回溯、聯合目標式 7–12)、§4.1(設定、控制基準、超參數)、§4.2–4.3(表 1、學習動態)、§4.4 + 表 2 + 圖 5(消融)、§6(限制)、附錄 A.1(表 3–4 超參數)、A.2(表 5–6,原始/線性/對數比比較)、A.3–A.4(工具規格、合成資料流程)、A.5(定性信用軌跡)。解析註記:表 1 和表 6 在編譯時根據pdftotext -f 8/21 -layout再次校對,所有格子均一致;表 2 完全符合 §4.4 的文字說明。表 1 中Qwen3-30B-A3B-Thinking-2507區塊標題列的 docling 資料列將標題重複到第一個資料欄——這是章節標題列中的外觀文字黏連,不影響任何資料格。表 3 發生真正的table-collapse("1 8192 tokens 72,000 tokens 80 tool turns"),在匯入時根據位置還原;表 4 的表格格線也以相同方式塌縮但未觸發檢查,已逐一驗證全部 19 組配對。表 7(工具規格,本文未引用)發生自動檢查未發現的真實table-shift:browser.find的cursor說明向上混入pattern那一列——此處已直接對照 PDF 確認,內容均存在,但錯置到相鄰列。標題與表格配對已直接在 PDF 中核實:表 5 和表 6 的標題都在格線下方,而 docling 只把表 6 移到上方,因此標題交替位置是 docling 造成,兩組配對都正確。公式引擎污染:演算法 1(偽碼第 11–16 步)中的兩行因重複的\quadtoken 膨脹至 4,876 和 4,575 個字元;問題只限於該區塊,而 §3.3 的文字正確敘述相同數學式,因此未影響任何數值主張。沒有 en dash 損壞。圖 5 已依兩階段圖像規則檢視——上文的 K 開關數據與座標軸缺陷均來自圖像檢視,而非文字敘述。
Cited by 13
- Group Relative Policy Optimization (GRPO)×4
Turn Level Credit Assignment — the complementary fix: keep GRPO's group-relative outcome advantage…
- Single-Rollout Optimization×4
trace turn level credit assignment — TRACE: Turn-level Reward Assignment via Credit Estimation for…
- Asynchronous RL for LLMs×3
trace turn level credit assignment — TRACE: Turn-level Reward Assignment via Credit Estimation for…
- Automated Failure Attribution×3
Every number above is a judge reading a trace. There is another way to localize the decisive step,…
- Deep Research Agents×3
Everything above measures systems — production harnesses wrapping a fixed frontier model, where the…
- RL from Execution Feedback (RLEF)×3
What it makes RLEF is a clean ancestor of Turn Level Credit Assignment with the credit dial at its…
- Interactivity Benchmarks×2
Turn Level Credit Assignment — OmniVChat's multi-turn protocol hands every model the same history…
- Tree Search over Agent Trajectories (LATS)
Turn Level Credit Assignment — the same credit problem solved at the other end of the pipeline:…
- Model Capability & Training
Turn Level Credit Assignment — Giving a long-horizon agent per-turn reward instead of one terminal…
- Offline Multi-Step Tool-Use RL (SWiRL)
Turn Level Credit Assignment — the same dense-per-turn credit, bought the expensive way. TRACE's…
- Open Questions Backlog
Turn Level Credit Assignment ×3 (oldest 47d) — The frozen probe is a copy of the policy…
- Process vs Outcome Reward Models
Turn Level Credit Assignment — the 2026 descendant that defines itself against everything on this…
- Reasoning–Acting Interleaving (ReAct)
Turn Level Credit Assignment — what you can do with the trace once you want to train on it: TRACE's…
Related articles
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
- Offline Multi-Step Tool-Use RL (SWiRL)
SWiRL (Mirhoseini's lab, COLM 2025) trains multi-step tool use without ever calling a tool during the RL run: generate…
- RL from Execution Feedback (RLEF)
Train a coding model with the interpreter in the loop: generate code, run a small visible set of public tests, feed the…
- Group Relative Policy Optimization (GRPO)
DeepSeek's critic-free RL objective that became the 2024–25 default for LLM post-training: sample a group per prompt, b…
