AI Agent训练的"事后诸葛亮":清华SEED用自进化蒸馏填上RL监督缺口

结果对了,过程就对了?——Agent训练的盲区

训练一个能自主完成长程任务的 AI Agent,目前最主流的范式是用强化学习(RL)做后训练。逻辑很直观:Agent 执行一系列动作,环境给出最终奖励——任务成功或失败——RL 就用这个信号去更新策略。

但这里面藏着一个很本质的问题:结果正确,不代表每一步都走对了。

一条失败的轨迹里,可能有一段精彩的推理和工具调用;一条成功的轨迹里,也可能混着运气成分和无用步骤。但基于结果的 RL(outcome-based RL)只有"成"或"败"一个信号,没法告诉你"第 37 步那个工具调用很聪明,应该强化"或者"第 12 步你走错了方向,下次别这样"。

这就是学界所说的"监督缺口"(supervision gap)——在 episode 级别的结果奖励和 token 级别的策略学习之间,缺少一种细粒度的、过程导向的反馈信号。

清华陶建华团队最近提出的 SEED(Self-Evolving On-Policy Distillation),就是冲着这个缺口来的。它的名字已经透露了核心思路:让 Agent 在训练中自我进化,把已走过的轨迹转化为"事后技能",再蒸馏回策略中。

论文地址:https://arxiv.org/abs/2607.14777,代码已开源在 GitHub。

SEED 怎么做?两阶段自进化循环

SEED 的架构分为两个阶段,形成了一个自动循环的学习闭环。

第一阶段:事后技能 SFT(Hindsight Skill SFT)

先用基础策略收集一批交互轨迹。然后让一个外部分析器(可以是独立的 LLM)把每条完整轨迹总结成自然语言描述的"技能"——成功轨迹提炼出可复用的工作流和策略,失败轨迹抽象出需要规避的模式和纠正规则。

这些"轨迹 → 技能"的配对数据,被用来对模型做一次监督微调(SFT),让模型学会两件事:作为分析器,能从轨迹中提取高质量的后见技能;作为行动器,在后续任务中借鉴这些技能改善决策。

第二阶段:自进化同策略蒸馏(Self-Evolving On-Policy Distillation)

这是 SEED 的核心创新。在强化学习过程中,当前策略模型同时扮演着行动器和分析器的双重角色:

  1. 采集轨迹:行动器在环境中执行任务,生成一批同策略轨迹。
  2. 分析技能:分析器从这些轨迹中提取后见技能。
  3. 对比评分:对同一个动作采样,SEED 会对比"有技能上下文"和"无技能上下文"两种条件下模型对该动作的概率判断——这个概率变化就是技能带来的影响。
  4. 蒸馏更新:把这个概率变化转化为密集的、token 级别的同策略蒸馏信号,与 GRPO 一起联合优化。

然后循环往复:策略更新后,下一轮轨迹的质量更高,从中提取的技能也更精确,蒸馏信号随之进化。

关键洞察在于:这种事后监督来自模型自己当前的轨迹,会随策略进化而动态演化,而不是用一套静态的知识去指导动态更新的模型。

实验结果:密集监督好过终端奖励

团队在三个典型的长程 Agent 任务上做了评测——具身交互(ALFWorld)、网页导航(WebShop)和搜索问答(Search-based QA):

  • 全面超越 GRPO:在 ALFWorld 上 SEED 比纯结果驱动的 GRPO 高出 45.9 个百分点。
  • 内化优于外挂:相比于在推理时额外提供技能提示(Skill-Prompt),SEED 在推理时无需任何额外输入也能表现更好——技能已经内化进了参数。
  • 动态优于静态:相比用固定技能库做蒸馏的方法(OPSD、Skill-SD),SEED 的自进化机制优势明显,因为它能适应训练中不断出现的新轨迹和新失败模式。
  • 样本效率翻倍:SEED 只使用 60% 的训练数据,表现就超过了用完整数据训练的 GRPO。
  • 跨任务泛化:在 ALFWorld 的未见任务集上,宏平均成功率从 70.9% 提升到 86.2%。
  • 多模态扩展:在视觉 Agent 基准(Sokoban、EZPoints)上同样奏效,平均成功率从 77.0% 提升到 91.0%。

推演:Agent 训练的"事后复盘"时代

SEED 的核心贡献不是发明了什么新算法,而是揭示了一个被低估的洞察:Agent 自己走过的路,是最好的老师。

过去一年,AI Agent 的讨论焦点一直在"如何让 Agent 编计划、用工具、跑长程",但很少有人认真问:Agent 犯错之后,怎么让它从错误中学到东西?

传统 RL 的终端奖励信号太稀疏——"你错了,分数 0"——但没告诉 Agent 哪里错了。人工标注的偏好数据(RLHF)可以给出更细的反馈,但成本太高,也无法规模化。

SEED 的巧妙之处在于:Agent 自己就是自己最好的督导。它走过的每一条轨迹——成功的、失败的——都蕴含了可复用的经验。把动作序列翻译成自然语言技能,再把技能对行为的影响蒸馏回策略,这本质上是一个自动化的"事后复盘"机制。

这和人类学习的方式高度一致。顶尖棋手下完一盘棋,一定会复盘:这步为什么走得好?那步为什么是败招?复盘提炼出的经验,会内化为下一盘棋的直觉。

SEED 就是在做这件事——给 Agent 装上了一个自动复盘引擎。

局限与值得关注的方向

团队也坦诚指出了 SEED 的局限:

  • 复杂任务待验证:在 DeepPlanning、OdysseyArena 等更长工作流、更稀疏奖励的基准上,SEED 的表现还需进一步测试。
  • 自进化有风险:行动器和分析器用的是同一套模型,如果模型犯了错,可能会把无效做法总结成"经验"并反复强化。这有点像一个人闭门造车地复盘——没有外部验证,难免陷入自我验证的循环。
  • 训练成本:虽然推理时零额外开销,但训练阶段需要分析轨迹和成对评分,随任务复杂度上升成本可能增加。

这些局限也指向了有价值的未来方向:引入可验证的状态变化作为技能质量锚点、加入不确定性感知机制来过滤不可靠的经验、只在关键轨迹上做分析来压缩训练成本。

落在行动上

对正在构建 Agent 应用的团队来说,SEED 的启发很直接:

  1. 别只盯着最终成功率。记录下 Agent 的每一条轨迹——成功者和失败者都有价值。
  2. 把经验内化,而不是外挂。提示词里的"少样本示例"治标不治本,内化到模型参数里的能力才能真正迁移。
  3. 让 Agent 从自身经验中学习。不需要昂贵的人工标注,Agent 走过的路本身就是训练数据。关键是怎么自动地、动态地把这些经验提炼出来。

AI Agent 的下一个战场,可能不是谁的模型更大、谁的工具更多,而是谁能让 Agent 学会"自我复盘"。

滚动至顶部