单rollout异步优化:RL训练从"等整批"走向"实时流"

当所有人都努力把RL训练的组越做越大时,清华的研究者说——也许最小的一组才是最好的。

强化学习(RL)正在成为LLM post-training的核心引擎。从DeepSeek-R1到OpenAI的o系列,RL让模型学会了推理、编程和用工具。

但RL训练的效率瓶颈正在成为新的天花板。尤其在长程Agent任务中,模型需要多轮交互、调用工具、处理环境反馈——一条rollout可能包含数千甚至上万个token。而现有的RL流水线大多采用同步批处理:等整批rollout完成,再统一更新模型。

这意味着:一批训练里,快的rollout等慢的,GPU在空转,模型在干等。

异步RL理论上可以解决这个问题——每完成一条rollout就立即更新。但异步RL长期以来伴随一个核心困境:模型更新后,正在路上尚未完成的rollout就成了"过期数据",引入离策略偏差(off-policy bias),训练稳定性随之崩塌。

来自清华大学KEG实验室的研究团队,刚刚在arXiv上提交了一篇论文,给出了一个反直觉的解法——单rollout异步优化(Single-rollout Asynchronous Optimization,SAO)

不是把组做大,而是把组做到最小。

一、GRPO的"组"困境:越大不一定越稳

要理解SAO的价值,得先理解GRPO为什么是今天的主流选择。

GRPO(Group Relative Policy Optimization)是DeepSeek-R1采用的RL方法。它的核心思路是:对每个prompt,采样出一组rollout,用这组的相对表现作为优势信号来更新模型。

组的存在有两个作用:一是提供稳定的优势估计(组内比较消除偏差),二是通过多rollout分摊单次采样的噪声。

但GRPO有两个隐含假设,在长程Agent任务中被打破了:

第一,整组完成才能更新。 组内的所有rollout必须全部完成后才能计算相对优势。在长程任务中,不同rollout的执行时间差异巨大——一条可能10步就结束了,另一条可能要50步。GPU资源被浪费在等待上。

第二,组式采样天然不适配异步。 异步RL的核心是"来一条,训一条"。但GRPO需要组——来一条训一条,算不了相对优势。两条路子,底层逻辑冲突。

所以业界一直面临一个选择题:要么牺牲效率保稳定性(GRPO同步),要么牺牲稳定性保速度(异步)。

SAO的贡献是:把这道选择题变成了"我全都要"。

二、单rollout的设计:四招解决一个核心矛盾

SAO的核心思路直截了当:每个input只生成一条rollout,完成后立即进入训练流程。

但单rollout面临两个致命问题:第一,优势估计高度依赖于当条rollout的质量,方差大;第二,异步环境中模型参数的不断变化会持续制造离策略偏差。

研究团队用四套机制逐一击破:

1. 直接双边重要性采样(DIS)。 由于rollout生成和模型训练不同步,SAO直接在rollout阶段记录token级的对数概率。更新时计算每个token的重要性采样比,超出设定区间的token直接跳过梯度更新。本质上是"我只学那些还没过期的token"。

2. 双倍价值模型更新频率。 单rollout训练的梯度方差更大,需要更可靠的价值模型来估计优势信号。SAO解耦了策略模型和价值模型的更新节奏:策略模型每更新1次,价值模型更新2次。更频繁的价值校准降低了梯度估计的噪声。

3. 固定注意力模块参数。 研究团队发现,价值模型的训练波动主要来自全注意力层,而MoE层相对稳定。因此SAO在价值模型训练时固定了注意力模块参数,只优化MoE投影层——一个精巧的"不动最乱的"策略。

4. 跳过观察信息token的GAE。 在多轮Agent轨迹中,模型的动作和环境反馈交替出现。如果直接把观察信息的token纳入优势计算,会引入大量噪声。SAO在GAE(广义优势估计)中跳过环境反馈token,只在模型自主生成的token之间传播优势信号。

这四套设计的共同目标,是把单rollout的方差和偏差压到与组式采样相当的水平。

结果呢?SAO成功在1000步训练中保持稳定,而对照组中VAPO方法在90步时就崩溃了。

三、"流式RL"三原则:从Batch思维到Stream思维

如果要说SAO给出了什么可复用的框架,我认为可以总结为"流式RL"(Stream RL)的三原则——与之相对的,是今天主流的"批量RL"(Batch RL)思维。

维度Batch RL(旧思维)Stream RL(新思维)
采样粒度整组完成后更新单条完成后立即更新
偏差控制靠组内统计消除靠token级重要性采样裁剪
价值估计同频更新高频校准(2:1)

Batch RL的核心假设是:从统计数据中获得稳健性。Stream RL的核心假设是:从精确控制中获得效率。

这两者的切换,本质上是"相信统计"还是"相信工程"的选择。SAO证明了后者在长程Agent场景中更优——当你足够精细地控制每一个偏差源头,你就不再需要用大组来平均掉噪声。

四、在线学习:SAO的真正后劲

SAO实验中最让我觉得"这事值得关注"的部分,不是AIME 2025的97.3%或SWE-Bench的29.8%,而是那组在线学习模拟实验。

研究团队设计了一个模拟写作任务:奖励偏好会在"可爱风"、"中二风"和"古典风"之间切换。SAO在偏好切换后,模型能快速对齐新目标;而滑动平均基线则明显滞后。

这意味着什么?

在真实场景中,用户偏好、业务目标、安全约束都是动态变化的。Batch RL需要一个固定的奖励函数——因为一旦奖励变了,之前采样的整组rollout就全废了。

但单rollout的粒度天然适配动态环境:做一条、评估一条、更新一条,每一轮都能依据最新的奖励信号做出反应。

这是SAO比GRPO更本质的优势——它让RL训练从"基于批次的历史学习"走向"基于流的实时适应"

GLM-5.2(750B-A40B)的Agent RL训练已经部署了SAO。这意味着中国最大规模的MoE模型之一,正在用"最小粒度"的方法进行RL训练。

五、落到行动:对大模型训练的启示

SAO还只是一个起步——研究团队自己也承认,当前实验集中在Qwen3-30B-A3B和Agent类型的任务上,更小模型、非Agent RLHF场景的适用性仍需验证。但方向已经清晰:

  • 如果你在搭建Agent RL训练流水线: 优先考虑异步架构,关注rollout粒度而非batch size。训练效率的瓶颈往往是同步等待,不是计算资源。SAO的四招可以直接复用——尤其是DIS和双倍价值更新。
  • 如果你在做RL训练工具(如veRL、OpenRLHF): 异步+单rollout是一个值得原生支持的训练模式。现有的框架层多为同步批处理设计,需要改动的面不小,但回报巨大——训练延迟可以从小时级降至分钟级。
  • 如果你在思考RL的下一个方向: "实时在线适应"是不可忽视的能力。当模型可以边用边学、边改边适应,RL就不再只是post-training阶段的一次性投入,而会成为产品运行时的核心能力。

最后,SAO提供了一个值得所有AI训练工程师记住的反常识:有时候,最小的组才是最好的组。问题不在于组有多大,而在于你在每个token上花了多少心力去控制偏差。


论文: Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning(清华大学KEG实验室)

作者: Zhenyu Hou et al.

模型部署: GLM-5.2(750B-A40B)

滚动至顶部