H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translatedENHOWARDISM

錨定 Bellman 殘差修正(BRACE)

直接修正非同步 RL 中 critic 端的偏差;DIS/ESTR/keep-rules 修正的都是 actor。過時 critic 的目標會收斂至 V^µ,但計算 advantage 需要的是 V^π;V-trace 無法轉用,因為沒有任何視窗能同時涵蓋終端獎勵,又讓重要性權重乘積不隨軌跡長度失控。BRACE 將兩者拆開:總和一律延伸至終端步驟,重要性權重乘積則封頂於 k 個 token;接著用固定權重錨定上限以外的尾段,消除逐 token 尾段權重會引入的雜訊。在 13/16 項指標上勝過五種僅修正 actor 的方法,步驟時間只比未修正的非同步 PPO 多 1.5%,並且在固定超參數設定下,staleness 增至 50 時仍能平順退化

Article metadata
Publication details
Published:September 24, 2026
Filed:Concept
Domain:Model Capability & Training
Tags:Reinforcement LearningPost TrainingAgentic RlTraining EfficiencyValue ModelOff Policy Correction
Reading:14 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

錨定 Bellman 殘差修正(BRACE)示意圖

資料來源#

摘要#

Asynchronous RL for LLMs 介紹的每種穩定化方法——DIS、ESTR、IcePop、KPop、PPO-EWMA、AReaL——修正的都是 actor:它們重新塑造信任區域,或遮蔽意見不一致的 token,卻不改動 critic 的迴歸目標。BRACE(Zhao、Xie、Zheng 等人,Baidu,arXiv 2609.09783,v1 2026-09-09,empirical)指出,這只處理了問題的一半:在非同步情況下,critic 以從過時行為策略 µ 抽取的軌跡來擬合,因此收斂至 V^µ;但計算 advantage 時需要的是 V^π。所有 actor 端的修正都會透過作為基準並被扣除的值,繼承這項偏差。BRACE 直接取代 value 目標。該論文三位標註同等貢獻的作者中,有兩位也共同撰寫了 ESTR(同樣來自 Baidu);本文的姊妹篇將 ESTR 視為 actor 端的競爭方法。兩者是來自部分重疊作者群、互補的修正方向,不是對同一機制提出互相競爭的主張。

診斷:critic 擬合的是過時策略,而非目標策略#

論文將生成形式化為 token 層級 MDP,轉移具確定性,並有終端驗證器獎勵 r_l = R(x,y)·1_{l=T}。論文透過 λ-return 的望遠鏡恆等式證明(命題 1),以 µ 抽取的軌跡進行精確迴歸,會使 critic 趨近 V^µ_γ,而不是 V^π_γ——也就是產生資料的策略之價值函數,而非正在更新的策略。在特殊情況 γ=λ=1 下,對每個位置而言,目標都會化簡為原始回報 R;因此收斂至 V^µ 的結果是精確且清楚的,不是自舉造成的假象。

由此產生的 advantage 差距 b(s_t) = V^π(s_t) − V^µ(s_t) 並非批次層級的偏移,advantage whitening 無法消除它。直接測量的結果(圖 2a)顯示,b(s_t) 在回應開頭附近最大,並朝終端狀態遞減:差距是由後綴造成的,因為實際獎勵是在位置 t 之後依 µ 抽取,而不匹配會隨剩餘的 T−t 步累積;因此,長軌跡中的早期決策受影響最大。

為何 V-trace 的修正視窗無法轉用於長期程 LLM RL#

IMPALA 的 V-trace(Espeholt 等人,2018)是傳統 RL 中專門處理這種差距的標準方法,但 §3.2 指出,面對稀疏終端獎勵與長期程時,它因一項結構性原因而無法轉用。

若獎勵只在終端步驟出現,任何滿足 s+n ≤ T、長度為 n 的修正視窗都不含獎勵:終端殘差位於視窗之外,因此目標中 R 的直接係數恰為零;若要涵蓋終端獎勵,就必須 n ≥ T−s+1——視窗必須一路延伸到末端。

但將視窗延伸至那麼遠,會使重要性權重乘積 γ^(T−s)Π_T 失控:其對數幅度為 (T−s)·m ± O(√(T−s)·σ),其中 m = log(γλ) + E[log min(c̄, π/µ)]。對精確的重要性比率而言,Jensen 不等式強制要求 m ≤ 0,因此在實際發生的分支上,乘積會隨軌跡長度呈指數級縮小(另一種情況 m > 0 則需要 E_µ[w_t] > 1,只有推論與訓練引擎不匹配才會產生)。若要讓獎勵係數維持在接近 1,則需要 |m| = O(1/(T−s))——而非同步正是為了擺脫這種近乎 on-policy 的狀態才存在。**沒有單一視窗能同時直接涵蓋獎勵,並控制重要性權重乘積。**診斷性迴歸(β,即按視野長度分箱後,目標對回報的最小平方法斜率)也證實了這點:在未修正的目標下,β 會隨剩餘視野 T−t 遞減(圖 2b);也就是說,隨著視野增長,獎勵對 value 目標的影響可測量地減弱——恰好發生在 §3.1 所述偏差 b(s_t) 最大之處。

修正方法:將總和與乘積拆開,再錨定尾段#

BRACE 將 V-trace 混為一談的兩個量分開處理。

**k 封頂修正視野。**殘差總和仍一路延伸至 T,因此終端獎勵必定進入目標;但重要性權重乘積無論總和延伸多遠,都最多只包含 k 個因子。現在每個殘差(包括終端殘差)最多只帶有 k 個重要性因子,其幅度不再取決於軌跡長度,V-trace 中乘積暴增或趨近於零的兩種問題分支也一併消除。涵蓋與控制不再互相牴觸,因為兩者不再由同一視窗支配。

Monte-Carlo 尾段。超過上限 j = min(s+k, T) 的殘差全都帶有相同的凍結路徑權重 Π_k(s),因此在此處使用真正的逐 token 重要性權重無法加強修正,只會破壞望遠鏡關係,讓尾段每個 value 都帶有正負交替的係數,其總變差會隨 T−s−k 增長,並在迴歸標記中引入標準差為 O(√(T−s−k)) 的項。BRACE 讓尾段的每個殘差都採用相同的常數權重 1,藉此消除這個問題:尾段殘差會精確望遠鏡加總為錨定在視窗端點的實際回報,Π_k(s)[γ^(T−s)R − γ^(j−s)V(s_j)],在維持獎勵係數(因而也維持修正強度)不變的同時,移除引入的雜訊(附錄 C.1)。

由此得到的目標是修正視窗加上錨定回報:先做 k 步重要性加權 Bellman 殘差,再接上一項帶有終端獎勵的錨定項。三種退化情況可說明其特性(附錄 C.2):k=0 回到純 Monte-Carlo 目標 γ^(T−s)R;k→∞ 回到一般 V-trace;而 w_t≡1, γ=λ=1 則回到原始回報 R。命題 2 證明對任何 k 都存在唯一固定點;命題 3 則將與視窗真實目標值的偏移限制在 Θ_k‖g‖∞,其中 Θ_k 隨 k 增大而不增,且 Θ_0 = 1——因此可證明,較大的 k 不會讓視窗端點偏差變得更糟。

結果#

在四項長期程任務上,BRACE 的 16 項指標有 13 項取得最佳分數(Search-R1 上的檢索增強 QA、BrowseComp-Plus 上的網頁研究、DAPO-Math→AIME 上的數學推理,以及工具增強 GSM8K),比較對象是五種都不改動 critic 迴歸目標、僅修正 actor 的基準方法:

方法NQ†TriviaQA⋆PopQA⋆HotpotQA†2Wiki⋆Musique⋆Bamboogle⋆BCP mean@1
PPO0.2640.6110.2380.2510.2910.0850.3920.206
PPO-EWMA0.3020.6140.2490.2550.3180.0870.4160.199
AReaL0.3410.6210.2470.2740.3240.1030.4080.245
KPop0.3240.6300.2550.2700.3030.0980.3920.183
IcePop0.2800.6180.2610.2710.3070.0910.4000.231
BRACE0.3830.6250.2730.2850.3460.1070.4320.269
方法AIME24 mean@32AIME24 pass@32AIME25 mean@32AIME25 pass@32AIME26 mean@32AIME26 pass@32GSM8K-Tool mean@4GSM8K-Tool pass@4
PPO0.1100.3320.0870.3490.0820.2690.8420.938
PPO-EWMA0.1210.3750.0910.4030.0890.2970.8540.943
AReaL0.1420.3380.1030.3910.0950.3010.9260.960
KPop0.1310.3800.0930.3790.0930.3250.8890.954
IcePop0.1470.3910.1020.3930.1020.3090.9230.952
BRACE0.1440.4090.1080.4140.1030.3200.9370.968

Search-R1 的實際 staleness 為 S=9,BrowseComp-Plus 為 S=6,DAPO-Math 為 S=5,工具增強 GSM8K 為 S=13。BRACE 相較 PPO 的最大提升出現在同領域(NQ,+0.119;領域外為 +0.014 至 +0.055),而 IcePop/KPop 各自在一個 AIME 欄位勝出——BRACE 的 13/16 並非全面勝出。這項提升來自實測的 critic 偏差,而不只是 actor 目標:從 Search-R1 的第 130 步起,BRACE 維持最低的 value 偏差差距 ĝ_π(約 0.07;基準方法為 0.08–0.10,圖 4a);在 DAPO-Math 上,BRACE 的分離項 b̂ 維持在約 0.02,而 PPO 在第 170 步後逐漸升至 0.06–0.08(圖 4b)。

訓練成本(表 2,BrowseComp-Plus):同步 PPO 每步耗時 546.43 秒,速度為 58.64 tokens/s/GPU(1.00×);未修正的非同步 PPO 將時間降至每步 219.20 秒,速度為 134.79 tokens/s/GPU(2.49×);BRACE 每步耗時 222.47 秒,速度為 122.15 tokens/s/GPU(2.46×)。論文所述,BRACE 比未修正的非同步 PPO 多 1.5% 的步驟時間,數字確實如此;但其報告吞吐量比未修正的非同步 PPO 低 8.7%,論文內文沒有解釋這項不一致(只提到步驟時間數字)。兩項數字皆直接引用表格,內文未提供吞吐量差距的調和說明。

消融實驗與敏感度#

  • **不封頂修正(k→∞)。**停用上限後,會重現 V-trace 自身的失敗模式:此變體從前一百步起就落後 BRACE,並在約 0.33 處趨於平坦,而 BRACE 則達到 0.39(圖 4c,Search-R1)。
  • **移除 Monte-Carlo 尾段。**望遠鏡關係遭破壞,正負交替的尾段項重新進入標記;曲線仍接近 BRACE,但訓練後半段明顯較不穩定,最終低約 0.01(圖 4c)。
  • **Staleness 掃描,S=5 至 50(§5.3,圖 4d)。**品質隨允許的版本差距增大而下降,但每一步的降幅都逐漸縮小:S=5 達到 0.39,S=10 達到 0.35,而 S=15 至 S=50 都落在 0.29 到 0.31 之間。幾乎所有損失都在 S=15 前發生;staleness 再增加三倍(至 50),額外損失不到 0.02。
  • 上限大小 k(圖 4e,BrowseComp-Plus)。k=10 全程落後;k=20 與 k=100 整段訓練期間的差距都在 0.01 以內。只要視窗涵蓋過時 value 偏差集中的近視野區域,品質就維持平穩;只有在上限截斷該區域時才會下降。
  • 截斷水準 ρ̄、c̄(表 4,DAPO-Math)。ρ̄ 在 2 以內時品質持平,超過後才下降(移除上限後,相較預設值 ρ̄=1.2,訓練分數降低 0.017)。c̄ 則沒有同等的調整空間:每次提高都會降低品質,移除上限後,訓練分數降低 0.033,AIME24 降低 0.024——約為取消 ρ̄ 上限損失的兩倍。這是因為較大的 c̄ 會將更長的比率乘積帶入修正視窗,重現上限原本要避免的失控累積。

論文在四項任務中都固定使用 k=100, ρ̄=1.2, c̄=1.1,沒有針對各任務調參(§4.3、§D.1 內文——本文未引用附錄表 3 的逐任務設定表格,詳見下方解析備註)。

**解析備註。**附錄表 3(逐任務訓練/評估設定)在匯入時因 docling 列折疊與儲存格焊接而受損——多個標題列與數值欄位合併(例如節點數、迷你批次大小)——因此本頁與 wiki 其他位置都未引用該表。k=100、ρ̄=1.2、ρ̄c̄=1.1 與逐任務 staleness 數值 S∈{9,6,5,13} 改取自未受損的 §5.1 與 §D.1 內文,這些段落重述了相同數字。表 1、2、4 經核對無誤,數字皆直接引用。

延伸連結#

  • Asynchronous RL for LLMs——actor 端穩定化方法(DIS、ESTR、IcePop、KPop)的領域中心;BRACE 是本資料集第一個改為攻擊 critic 迴歸目標的來源,提出此頁 actor-only 分類未涵蓋的第三種正交方向
  • Single-Rollout Optimization——SAO 這股逆流已全面回歸 critic(凍結注意力層、TTUR、skip-observation GAE、scaled value pretraining);BRACE 的回歸範圍較窄、成本較低——保留 SAO 的群組式 PPO critic,只修正其迴歸所依據的 value 目標,步驟時間開銷為 1.5%,而非採用完整的 critic 工程技術組合
  • Staleness–Learning-Rate Scaling——BRACE 的 S=5 至 50 掃描呈現的是經修正的 critic staleness 容忍曲線(分數平順下降,大部分損失發生於 S=15),可與 Song 等人針對未修正非同步 GRPO 的前沿研究互補(Sη 表示執行是否崩潰,Tη 表示何時崩潰);演算法不同(帶 critic 的 PPO 與不帶 critic 的 GRPO),分析軸不同(任務分數與崩潰邊界),兩種 staleness 定義無法換算
  • Group Relative Policy Optimization (GRPO)——BRACE 的五種基準方法都是以 critic 為基礎的 PPO 變體;論文明確將整個 critic 與 actor 修正研究脈絡描述為從 GRPO 無 critic 的路線「回到以 critic 為基礎的 PPO」。這與 SAO 的逆流相同:此處攻擊的是 critic 的迴歸目標,而非取代整套 critic 訓練配方

開放問題#

  • 論文自己的未來工作段落提出了這個問題:將 BRACE 的 critic 端修正與 actor 端 keep rule(DIS、ESTR、IcePop)結合,會讓穩定性提升疊加,還是會將同一項 staleness 偏差修正兩次——一次在基準值,一次在 advantage 中——導致效果抵銷或訓練不穩?資料集內沒有來源在同一訓練迴圈中同時執行兩種修正。
  • 四項任務的回應長度從 8k 到 32k tokens 不等,但 k=100 全程固定;k 掃描(§5.3)只在 BrowseComp-Plus 上測試 k∈{10,20,100}。當回應長度與輪次遠超本文測試範圍時,固定 k 是否仍能維持這麼平穩?還是上限必須涵蓋的近視野區域本身也會隨軌跡長度增長?
  • BRACE 只在 PPO critic 上獲得驗證,其基準方法從未納入 GRPO。k 封頂 Bellman 殘差修正能否對應到不帶 critic 的群組相對目標?還是這項修正從結構上就必須有 value function 可供迴歸?

資料來源#

  • BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL — BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL,Guanqun Zhao、Zijun Xie、Binbin Zheng(同等貢獻,於 Baidu 實習)、Jiafeng Lu、Enlei Gong、Zeyu Chen(BUPT / Peking / USTC + Baidu Inc.),arXiv 2609.09783,v1 2026-09-09,24 頁,empirical。§3.1(命題 1,critic 收斂至 V^µ)、§3.2(V-trace 在覆蓋與控制之間的失敗、β 診斷)、§4.1–4.3(k 上限與 Monte-Carlo 尾段的設計、演算法 1)、§5.1(表 1 主要結果)、§5.2(消融實驗、圖 4c)、§5.3(staleness 與 k 敏感度、圖 4d/e)、§5.4(表 2 訓練成本)、附錄 A–C(證明、命題 2–3)、附錄 D.1(未受損的設定內文,用以取代受損的表 3)、附錄 F(表 4,ρ̄/c̄ 敏感度)。**解析警告,依本文慣例:**附錄表 3(逐任務設定)有 docling 列折疊與儲存格焊接損壞——多個標題列與數值欄位合併——本頁未引用該表;相同數字(k=100, ρ̄=1.2, c̄=1.1、逐任務 staleness S)改取自未受損的 §5.1 與 §D.1 內文。表 1、2、4 經核對無誤。
§ end
Cited by 7
Related articles
  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Asynchronous RL for LLMs

    Consuming rollouts for training the instant each finishes, instead of waiting for a full synchronized batch — fixes the…

  • Group Relative Policy Optimization (GRPO)

    DeepSeek's critic-free RL objective that became the 2024–25 default for LLM post-training: sample a group per prompt, b…

  • Single-Rollout Optimization

    SAO's headline move: one rollout per prompt instead of GRPO's group, fed to training the instant it finishes — cutting…

  • Staleness–Learning-Rate Scaling

    The (S, η) stability frontier of asynchronous GRPO, derived rather than proposed as a fix: the stale-rollout gradient b…