資料來源#
摘要#
Asynchronous RL for LLMs 介紹的每種穩定化方法——DIS、ESTR、IcePop、KPop、PPO-EWMA、AReaL——修正的都是 actor:它們重新塑造信任區域,或遮蔽意見不一致的 token,卻不改動 critic 的迴歸目標。BRACE(Zhao、Xie、Zheng 等人,Baidu,arXiv 2609.09783,v1 2026-09-09,empirical)指出,這只處理了問題的一半:在非同步情況下,critic 以從過時行為策略 µ 抽取的軌跡來擬合,因此收斂至 V^µ;但計算 advantage 時需要的是 V^π。所有 actor 端的修正都會透過作為基準並被扣除的值,繼承這項偏差。BRACE 直接取代 value 目標。該論文三位標註同等貢獻的作者中,有兩位也共同撰寫了 ESTR(同樣來自 Baidu);本文的姊妹篇將 ESTR 視為 actor 端的競爭方法。兩者是來自部分重疊作者群、互補的修正方向,不是對同一機制提出互相競爭的主張。
診斷:critic 擬合的是過時策略,而非目標策略#
論文將生成形式化為 token 層級 MDP,轉移具確定性,並有終端驗證器獎勵 r_l = R(x,y)·1_{l=T}。論文透過 λ-return 的望遠鏡恆等式證明(命題 1),以 µ 抽取的軌跡進行精確迴歸,會使 critic 趨近 V^µ_γ,而不是 V^π_γ——也就是產生資料的策略之價值函數,而非正在更新的策略。在特殊情況 γ=λ=1 下,對每個位置而言,目標都會化簡為原始回報 R;因此收斂至 V^µ 的結果是精確且清楚的,不是自舉造成的假象。
由此產生的 advantage 差距 b(s_t) = V^π(s_t) − V^µ(s_t) 並非批次層級的偏移,advantage whitening 無法消除它。直接測量的結果(圖 2a)顯示,b(s_t) 在回應開頭附近最大,並朝終端狀態遞減:差距是由後綴造成的,因為實際獎勵是在位置 t 之後依 µ 抽取,而不匹配會隨剩餘的 T−t 步累積;因此,長軌跡中的早期決策受影響最大。
為何 V-trace 的修正視窗無法轉用於長期程 LLM RL#
IMPALA 的 V-trace(Espeholt 等人,2018)是傳統 RL 中專門處理這種差距的標準方法,但 §3.2 指出,面對稀疏終端獎勵與長期程時,它因一項結構性原因而無法轉用。
若獎勵只在終端步驟出現,任何滿足 s+n ≤ T、長度為 n 的修正視窗都不含獎勵:終端殘差位於視窗之外,因此目標中 R 的直接係數恰為零;若要涵蓋終端獎勵,就必須 n ≥ T−s+1——視窗必須一路延伸到末端。
但將視窗延伸至那麼遠,會使重要性權重乘積 γ^(T−s)Π_T 失控:其對數幅度為 (T−s)·m ± O(√(T−s)·σ),其中 m = log(γλ) + E[log min(c̄, π/µ)]。對精確的重要性比率而言,Jensen 不等式強制要求 m ≤ 0,因此在實際發生的分支上,乘積會隨軌跡長度呈指數級縮小(另一種情況 m > 0 則需要 E_µ[w_t] > 1,只有推論與訓練引擎不匹配才會產生)。若要讓獎勵係數維持在接近 1,則需要 |m| = O(1/(T−s))——而非同步正是為了擺脫這種近乎 on-policy 的狀態才存在。**沒有單一視窗能同時直接涵蓋獎勵,並控制重要性權重乘積。**診斷性迴歸(β,即按視野長度分箱後,目標對回報的最小平方法斜率)也證實了這點:在未修正的目標下,β 會隨剩餘視野 T−t 遞減(圖 2b);也就是說,隨著視野增長,獎勵對 value 目標的影響可測量地減弱——恰好發生在 §3.1 所述偏差 b(s_t) 最大之處。
修正方法:將總和與乘積拆開,再錨定尾段#
BRACE 將 V-trace 混為一談的兩個量分開處理。
**k 封頂修正視野。**殘差總和仍一路延伸至 T,因此終端獎勵必定進入目標;但重要性權重乘積無論總和延伸多遠,都最多只包含 k 個因子。現在每個殘差(包括終端殘差)最多只帶有 k 個重要性因子,其幅度不再取決於軌跡長度,V-trace 中乘積暴增或趨近於零的兩種問題分支也一併消除。涵蓋與控制不再互相牴觸,因為兩者不再由同一視窗支配。
Monte-Carlo 尾段。超過上限 j = min(s+k, T) 的殘差全都帶有相同的凍結路徑權重 Π_k(s),因此在此處使用真正的逐 token 重要性權重無法加強修正,只會破壞望遠鏡關係,讓尾段每個 value 都帶有正負交替的係數,其總變差會隨 T−s−k 增長,並在迴歸標記中引入標準差為 O(√(T−s−k)) 的項。BRACE 讓尾段的每個殘差都採用相同的常數權重 1,藉此消除這個問題:尾段殘差會精確望遠鏡加總為錨定在視窗端點的實際回報,Π_k(s)[γ^(T−s)R − γ^(j−s)V(s_j)],在維持獎勵係數(因而也維持修正強度)不變的同時,移除引入的雜訊(附錄 C.1)。
由此得到的目標是修正視窗加上錨定回報:先做 k 步重要性加權 Bellman 殘差,再接上一項帶有終端獎勵的錨定項。三種退化情況可說明其特性(附錄 C.2):k=0 回到純 Monte-Carlo 目標 γ^(T−s)R;k→∞ 回到一般 V-trace;而 w_t≡1, γ=λ=1 則回到原始回報 R。命題 2 證明對任何 k 都存在唯一固定點;命題 3 則將與視窗真實目標值的偏移限制在 Θ_k‖g‖∞,其中 Θ_k 隨 k 增大而不增,且 Θ_0 = 1——因此可證明,較大的 k 不會讓視窗端點偏差變得更糟。
結果#
在四項長期程任務上,BRACE 的 16 項指標有 13 項取得最佳分數(Search-R1 上的檢索增強 QA、BrowseComp-Plus 上的網頁研究、DAPO-Math→AIME 上的數學推理,以及工具增強 GSM8K),比較對象是五種都不改動 critic 迴歸目標、僅修正 actor 的基準方法:
| 方法 | NQ† | TriviaQA⋆ | PopQA⋆ | HotpotQA† | 2Wiki⋆ | Musique⋆ | Bamboogle⋆ | BCP mean@1 |
|---|---|---|---|---|---|---|---|---|
| PPO | 0.264 | 0.611 | 0.238 | 0.251 | 0.291 | 0.085 | 0.392 | 0.206 |
| PPO-EWMA | 0.302 | 0.614 | 0.249 | 0.255 | 0.318 | 0.087 | 0.416 | 0.199 |
| AReaL | 0.341 | 0.621 | 0.247 | 0.274 | 0.324 | 0.103 | 0.408 | 0.245 |
| KPop | 0.324 | 0.630 | 0.255 | 0.270 | 0.303 | 0.098 | 0.392 | 0.183 |
| IcePop | 0.280 | 0.618 | 0.261 | 0.271 | 0.307 | 0.091 | 0.400 | 0.231 |
| BRACE | 0.383 | 0.625 | 0.273 | 0.285 | 0.346 | 0.107 | 0.432 | 0.269 |
| 方法 | AIME24 mean@32 | AIME24 pass@32 | AIME25 mean@32 | AIME25 pass@32 | AIME26 mean@32 | AIME26 pass@32 | GSM8K-Tool mean@4 | GSM8K-Tool pass@4 |
|---|---|---|---|---|---|---|---|---|
| PPO | 0.110 | 0.332 | 0.087 | 0.349 | 0.082 | 0.269 | 0.842 | 0.938 |
| PPO-EWMA | 0.121 | 0.375 | 0.091 | 0.403 | 0.089 | 0.297 | 0.854 | 0.943 |
| AReaL | 0.142 | 0.338 | 0.103 | 0.391 | 0.095 | 0.301 | 0.926 | 0.960 |
| KPop | 0.131 | 0.380 | 0.093 | 0.379 | 0.093 | 0.325 | 0.889 | 0.954 |
| IcePop | 0.147 | 0.391 | 0.102 | 0.393 | 0.102 | 0.309 | 0.923 | 0.952 |
| BRACE | 0.144 | 0.409 | 0.108 | 0.414 | 0.103 | 0.320 | 0.937 | 0.968 |
Search-R1 的實際 staleness 為 S=9,BrowseComp-Plus 為 S=6,DAPO-Math 為 S=5,工具增強 GSM8K 為 S=13。BRACE 相較 PPO 的最大提升出現在同領域(NQ,+0.119;領域外為 +0.014 至 +0.055),而 IcePop/KPop 各自在一個 AIME 欄位勝出——BRACE 的 13/16 並非全面勝出。這項提升來自實測的 critic 偏差,而不只是 actor 目標:從 Search-R1 的第 130 步起,BRACE 維持最低的 value 偏差差距 ĝ_π(約 0.07;基準方法為 0.08–0.10,圖 4a);在 DAPO-Math 上,BRACE 的分離項 b̂ 維持在約 0.02,而 PPO 在第 170 步後逐漸升至 0.06–0.08(圖 4b)。
訓練成本(表 2,BrowseComp-Plus):同步 PPO 每步耗時 546.43 秒,速度為 58.64 tokens/s/GPU(1.00×);未修正的非同步 PPO 將時間降至每步 219.20 秒,速度為 134.79 tokens/s/GPU(2.49×);BRACE 每步耗時 222.47 秒,速度為 122.15 tokens/s/GPU(2.46×)。論文所述,BRACE 比未修正的非同步 PPO 多 1.5% 的步驟時間,數字確實如此;但其報告吞吐量比未修正的非同步 PPO 低 8.7%,論文內文沒有解釋這項不一致(只提到步驟時間數字)。兩項數字皆直接引用表格,內文未提供吞吐量差距的調和說明。
消融實驗與敏感度#
- **不封頂修正(k→∞)。**停用上限後,會重現 V-trace 自身的失敗模式:此變體從前一百步起就落後 BRACE,並在約 0.33 處趨於平坦,而 BRACE 則達到 0.39(圖 4c,Search-R1)。
- **移除 Monte-Carlo 尾段。**望遠鏡關係遭破壞,正負交替的尾段項重新進入標記;曲線仍接近 BRACE,但訓練後半段明顯較不穩定,最終低約 0.01(圖 4c)。
- **Staleness 掃描,S=5 至 50(§5.3,圖 4d)。**品質隨允許的版本差距增大而下降,但每一步的降幅都逐漸縮小:
S=5達到 0.39,S=10達到 0.35,而S=15至S=50都落在 0.29 到 0.31 之間。幾乎所有損失都在S=15前發生;staleness 再增加三倍(至 50),額外損失不到 0.02。 - 上限大小 k(圖 4e,BrowseComp-Plus)。
k=10全程落後;k=20與k=100整段訓練期間的差距都在 0.01 以內。只要視窗涵蓋過時 value 偏差集中的近視野區域,品質就維持平穩;只有在上限截斷該區域時才會下降。 - 截斷水準 ρ̄、c̄(表 4,DAPO-Math)。
ρ̄在 2 以內時品質持平,超過後才下降(移除上限後,相較預設值ρ̄=1.2,訓練分數降低 0.017)。c̄則沒有同等的調整空間:每次提高都會降低品質,移除上限後,訓練分數降低 0.033,AIME24 降低 0.024——約為取消ρ̄上限損失的兩倍。這是因為較大的c̄會將更長的比率乘積帶入修正視窗,重現上限原本要避免的失控累積。
論文在四項任務中都固定使用 k=100, ρ̄=1.2, c̄=1.1,沒有針對各任務調參(§4.3、§D.1 內文——本文未引用附錄表 3 的逐任務設定表格,詳見下方解析備註)。
**解析備註。**附錄表 3(逐任務訓練/評估設定)在匯入時因 docling 列折疊與儲存格焊接而受損——多個標題列與數值欄位合併(例如節點數、迷你批次大小)——因此本頁與 wiki 其他位置都未引用該表。k=100、ρ̄=1.2、ρ̄c̄=1.1 與逐任務 staleness 數值 S∈{9,6,5,13} 改取自未受損的 §5.1 與 §D.1 內文,這些段落重述了相同數字。表 1、2、4 經核對無誤,數字皆直接引用。
延伸連結#
- Asynchronous RL for LLMs——actor 端穩定化方法(DIS、ESTR、IcePop、KPop)的領域中心;BRACE 是本資料集第一個改為攻擊 critic 迴歸目標的來源,提出此頁 actor-only 分類未涵蓋的第三種正交方向
- Single-Rollout Optimization——SAO 這股逆流已全面回歸 critic(凍結注意力層、TTUR、skip-observation GAE、scaled value pretraining);BRACE 的回歸範圍較窄、成本較低——保留 SAO 的群組式 PPO critic,只修正其迴歸所依據的 value 目標,步驟時間開銷為 1.5%,而非採用完整的 critic 工程技術組合
- Staleness–Learning-Rate Scaling——BRACE 的
S=5至50掃描呈現的是經修正的 critic staleness 容忍曲線(分數平順下降,大部分損失發生於S=15),可與 Song 等人針對未修正非同步 GRPO 的前沿研究互補(Sη表示執行是否崩潰,Tη表示何時崩潰);演算法不同(帶 critic 的 PPO 與不帶 critic 的 GRPO),分析軸不同(任務分數與崩潰邊界),兩種 staleness 定義無法換算 - Group Relative Policy Optimization (GRPO)——BRACE 的五種基準方法都是以 critic 為基礎的 PPO 變體;論文明確將整個 critic 與 actor 修正研究脈絡描述為從 GRPO 無 critic 的路線「回到以 critic 為基礎的 PPO」。這與 SAO 的逆流相同:此處攻擊的是 critic 的迴歸目標,而非取代整套 critic 訓練配方
開放問題#
- 論文自己的未來工作段落提出了這個問題:將 BRACE 的 critic 端修正與 actor 端 keep rule(DIS、ESTR、IcePop)結合,會讓穩定性提升疊加,還是會將同一項 staleness 偏差修正兩次——一次在基準值,一次在 advantage 中——導致效果抵銷或訓練不穩?資料集內沒有來源在同一訓練迴圈中同時執行兩種修正。
- 四項任務的回應長度從 8k 到 32k tokens 不等,但
k=100全程固定;k 掃描(§5.3)只在 BrowseComp-Plus 上測試k∈{10,20,100}。當回應長度與輪次遠超本文測試範圍時,固定k是否仍能維持這麼平穩?還是上限必須涵蓋的近視野區域本身也會隨軌跡長度增長? - BRACE 只在 PPO critic 上獲得驗證,其基準方法從未納入 GRPO。k 封頂 Bellman 殘差修正能否對應到不帶 critic 的群組相對目標?還是這項修正從結構上就必須有 value function 可供迴歸?
資料來源#
- BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL — BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL,Guanqun Zhao、Zijun Xie、Binbin Zheng(同等貢獻,於 Baidu 實習)、Jiafeng Lu、Enlei Gong、Zeyu Chen(BUPT / Peking / USTC + Baidu Inc.),arXiv 2609.09783,v1 2026-09-09,24 頁,
empirical。§3.1(命題 1,critic 收斂至V^µ)、§3.2(V-trace 在覆蓋與控制之間的失敗、β 診斷)、§4.1–4.3(k 上限與 Monte-Carlo 尾段的設計、演算法 1)、§5.1(表 1 主要結果)、§5.2(消融實驗、圖 4c)、§5.3(staleness 與 k 敏感度、圖 4d/e)、§5.4(表 2 訓練成本)、附錄 A–C(證明、命題 2–3)、附錄 D.1(未受損的設定內文,用以取代受損的表 3)、附錄 F(表 4,ρ̄/c̄ 敏感度)。**解析警告,依本文慣例:**附錄表 3(逐任務設定)有 docling 列折疊與儲存格焊接損壞——多個標題列與數值欄位合併——本頁未引用該表;相同數字(k=100, ρ̄=1.2, c̄=1.1、逐任務 stalenessS)改取自未受損的 §5.1 與 §D.1 內文。表 1、2、4 經核對無誤。
Cited by 7
- Asynchronous RL for LLMs×5
Every method above — DIS, ESTR, IcePop, KPop, PPO-EWMA, AReaL — corrects the actor: it reshapes the…
- Single-Rollout Optimization×5
brace anchored bellman residual correction — BRACE: Anchored Bellman-Residual Correction for Stale…
- Group Relative Policy Optimization (GRPO)×4
The counter-current SAO names — abandoning GRPO's critic-free design because a group is unavailable…
- Staleness–Learning-Rate Scaling×2
brace anchored bellman residual correction — BRACE: Anchored Bellman-Residual Correction for Stale…
- Model Capability & Training
Anchored Bellman Residual Correction — Corrects asynchronous RL's critic-side bias directly, where…
- Open Questions Dashboard
Anchored Bellman Residual Correction: BRACE is demonstrated only against a PPO critic; its…
- Open Questions Backlog
Anchored Bellman Residual Correction ×3 (oldest 5d) — The paper's own future-work line names this:…
Related articles
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Asynchronous RL for LLMs
Consuming rollouts for training the instant each finishes, instead of waiting for a full synchronized batch — fixes the…
- Group Relative Policy Optimization (GRPO)
DeepSeek's critic-free RL objective that became the 2024–25 default for LLM post-training: sample a group per prompt, b…
- Single-Rollout Optimization
SAO's headline move: one rollout per prompt instead of GRPO's group, fed to training the instant it finishes — cutting…
- Staleness–Learning-Rate Scaling
The (S, η) stability frontier of asynchronous GRPO, derived rather than proposed as a fix: the stale-rollout gradient b…
