伯克利×斯坦福 BeyondMimic:机器人会空翻不稀奇,「什么时候翻」才是突破

机器人会空翻,已经不稀奇;真正难的是「什么时候该空翻」。加州大学伯克利分校与斯坦福团队发表在 Science Robotics 上的 BeyondMimic 框架,解决的正是这个问题:让机器人用同一条训练配方学会数百种动态动作——空中侧手翻、旋踢、冲刺、跳舞——然后在运行时实时组合这些技能,去完成训练时从没见过的任务。

走路、奔跑、避障、翻滚,一个策略全包,没有任何手工写死的切换逻辑。实测数字是硬的:真机上空中侧手翻峰值加速度 31 m/s²,连续五次高跳不丢稳定性,沿赛道连续奔跑超过 50 米;77 人用户研究里,70.8% 认为它的行走与奔跑比宇树原生控制器更自然(奔跑单项 84.7%)。论文的真正要点不是杂技清单,而是——技能的「习得」和技能的「选用」第一次进了同一个闭环

第一阶段:统一配方,学出数百种动作

传统人形机器人控制要二选一:单个多技能策略可扩展,但探索不足容易动作不自然;每个动作单独训一个策略够自然,却要逐一调参数、甚至从头训练,规模一上去就崩。BeyondMimic 拒绝这个取舍:约 2.5 小时的人类动作数据,全部喂进同一个运动跟踪强化学习流水线,不同参考动作共享同一套奖励设计、观测空间、动作空间和超参数——平衡类动作、高动态特技、带风格的技能(老人式行走、网球、羽毛球、地面爬行)在同一套配置下一起训练。

仿真到真实的迁移能力,团队没有归功于任何单个组件,而是精确执行器建模、较少的域随机化、连续方向表示、无历史观测与低延迟部署整套配合的结果。全部动作在高保真仿真里验证后,21 个代表动作片段(总长约 15 分钟)部署到了真机,包括单腿站立、旋踢、带 180°/360° 旋转的前跳和空中侧手翻。

第二阶段:一个潜在扩散模型,同时干「规划」和「控制」

「什么时候做」的回答在第二阶段。BeyondMimic 训练了一个统一的潜在状态-动作扩散模型,把第一阶段学会的所有技能整合进同一个运动分布。和只生成动作的扩散策略不同,它还隐式预测动作对未来的影响——能预判轨迹,是技能切换与任务适配的基础。

推理阶段用 classifier guidance:目标速度、路径点、关键姿态、障碍物距离这些任务相关成本信号,把无条件生成引导向目标,多轮去噪逐步收敛。传统解耦管线(离线运动学规划器先生成参考轨迹、再交给独立物理跟踪器执行)在这里被合并掉了——那套方案会重新引入规划器与跟踪器的失配,动作质量还被跟踪器上限卡死。BeyondMimic 把规划与控制放进同一个潜在模型,引导过程可以直接在真机上调整。

模型已经握着一组可行的人类技能,新任务只需要一条简单的目标成本就能触发正确组合。实测:速度指令下在行走与奔跑间自然切换、摇杆控制的行走平滑进入翻滚再退出、动作补全(每 0.2 秒插入一个翻滚目标关键帧,扩散策略把从行走到空中侧手翻再回来的整段过渡补出来)。

从「怎么动」到「该做什么」:技能操作系统模式

LLM Agent 先走过了这条路:前沿早已不是每任务训一个技能,而是推理时组合工具与行为。具身智能正撞上同一个点。BeyondMimic 里,新任务是一条成本函数,不是一次训练工程——路径点跟踪成本和障碍物距离成本组合起来,就得到场景感知导航,全程不需要重新训练。

旧方案是每个功能写定制代码;新方案是技能库加一个运行时组合器,读目标、选行为——本质上是给身体装了个「技能操作系统」。这是和软件侧 Agent 编排同一条架构弧线。

诚实的边界

论文自己写了天花板:状态估计质量——本体感知误差会直接传导进生成轨迹;预测时域只够反应式控制和局部避障,做不了针对远处目标的长程规划;历史信息稳定预测,但也可能让模型陷入重复动作,引导权重加大又会在模式切换时让去噪不稳——动作开始和结束阶段仍会绊倒。引导适合粗粒度目标,精细控制还得人工调参,团队把这列为未来用监督微调和适配器层解决的问题。

数字也要放进语境里读:峰值数字描述的是特定空翻动作;用户研究比的是行走与奔跑自然度——77 名参与者、1539 次有效选择,整体偏好 BeyondMimic 70.8%(行走 57.0%、奔跑 84.7%)。

产业推演

技能瓶颈正从「习得」转向「组合」。谁握有持续扩充的技能库加运行时组合器,谁就握着护城河。人形机器人部署进新环境——仓库、家庭、户外——从「几周奖励工程」变成「写一条成本函数」,直接改写具身部署的单位经济。

这和本站一直在追踪的具身智能主线是同一条:看一眼就学会任务的通用机器人两个机器人共用一个大脑。BeyondMimic 加上第三层:学会技能、共享技能之后,剩下的开放问题是「哪个技能、什么时候用」——任务裁决成为新研究前沿。至于谁为这套能力买单,市场端先要过八成订单是假的这道关。

可落地的建议

  • 机器人团队:直接抄统一配方——一套 RL 流水线、共享超参数、技能库持续扩充而不是每个行为重训。
  • 新部署任务当成现有策略之上的成本函数,别当成新一轮训练。
  • 押注状态估计与传感器融合——论文自己说的天花板。
  • 跟踪具身智能的人:机器人的下一个「GPT 时刻」,大概率会在「哪个技能、什么时候」这一层被度量——BeyondMimic 刚把这一层打开。

常见问题

Q: BeyondMimic 能做出训练时没学过的动作吗?
A: 能组合,不是无中生有。它用约 2.5 小时人类动作数据习得技能库,运行时可以把摇杆行走直接接进空中侧手翻、绕开障碍、在行走与奔跑间切换,全程不重训——组合的是学过的技能。

Q: 它比现在的人形机器人控制器更好吗?
A: 自然度上是的:77 人用户研究中 70.8% 认为它的行走与奔跑比宇树原生控制器更像人类,奔跑单项 84.7%;敏捷度上,空中侧手翻峰值加速度 31 m/s²、平均角速度约 7 rad/s,接近人类熟练动作的报告值。

Q: 它最大的弱点是什么?
A: 状态估计质量。本体感知误差直接传导进生成轨迹;预测时域也限制它只能做反应式控制和局部避障,做不了长程规划。

发表评论

滚动至顶部