用强化学习训练双脚机器人:Microduck 上手指南

Microduck 是 Pollen Robotics(Hugging Face)推出的 25 厘米、约 800 克的开源双足机器人,出厂自带 7 个预训练动作——走路、坐下、踢球、用喙抓取、滑旱冰、倒地后站起来。对开发者来说,亮点不在萌,而在它整套软件栈以 Apache-2.0 协议开源在 GitHub 上:你可以自己用强化学习在物理仿真里训练新步态,再把学到的策略直接部署到实体机器人上。

为什么值得关注

多数强化学习 demo 止步于仿真。Microduck 闭环了:MuJoCo 里训练 → 导出 ONNX → 同一套策略以 50 Hz 在机载运行。它是你能买到的、接触「仿真到现实」(sim-to-real)管线最便宜的具体载体之一,代码可读、可 fork、可重新训练。

软件栈怎么组织

核心是两个仓库:

  • pollen-robotics/microduck —— SDK 与机载软件。SSH 进去后用 robotctl 监控、配置、更新机器人。
  • pollen-robotics/microduck-rl —— 强化学习训练与 sim-to-real 工具链。

训练运行在 MuJoCo Warp(基于 NVIDIA Warp)之上,配合 mjlab(重实现了 Isaac Lab API 的训练框架)。在 NVIDIA GPU 上并行模拟 4096 只虚拟鸭子,约 1~2 小时就能训出一个可用的行走步态;也可以在 Hugging Face 自己的推理/训练基础设施上跑。

核心管线

  1. 仿真 —— 数千只虚拟鸭子在 MuJoCo Warp 并行运行,每个 episode 由任务特定的 reward 塑造。
  2. PPO 训练 —— mjlab 在仿真里训练策略,仓库自带 13 个任务族可作起点。
  3. 仿真到现实 —— 导出训练好的策略,部署到 50 Hz 机载策略循环,驱动 15 个电机与摄像头、LiDAR、双 IMU。

从哪开始

出厂 7 个动作全部公开且可重训,选一个当基线而非从零训。第一个实验建议:在某个现有步态上微调行走 reward,观察 reward 曲线,再并排对比仿真与实机的行为差异。

实践建议

  • 并行训练循环基本要求 NVIDIA GPU(或用 HF 基础设施)——别指望在笔记本 CPU 上训步态。
  • 注意许可区别:软件是 Apache-2.0,但机械/电子设计文件采用非商业许可,所以这是「开源软件平台」,不是开源硬件。
  • 想轻量地玩仿真,社区封装如 microduck-mcp 可从任意 MCP 客户端驱动仿真鸭子。

资源链接

发表评论

滚动至顶部