Microduck 是 Pollen Robotics(Hugging Face)推出的 25 厘米、约 800 克的开源双足机器人,出厂自带 7 个预训练动作——走路、坐下、踢球、用喙抓取、滑旱冰、倒地后站起来。对开发者来说,亮点不在萌,而在它整套软件栈以 Apache-2.0 协议开源在 GitHub 上:你可以自己用强化学习在物理仿真里训练新步态,再把学到的策略直接部署到实体机器人上。
为什么值得关注
多数强化学习 demo 止步于仿真。Microduck 闭环了:MuJoCo 里训练 → 导出 ONNX → 同一套策略以 50 Hz 在机载运行。它是你能买到的、接触「仿真到现实」(sim-to-real)管线最便宜的具体载体之一,代码可读、可 fork、可重新训练。
软件栈怎么组织
核心是两个仓库:
- pollen-robotics/microduck —— SDK 与机载软件。SSH 进去后用
robotctl监控、配置、更新机器人。 - pollen-robotics/microduck-rl —— 强化学习训练与 sim-to-real 工具链。
训练运行在 MuJoCo Warp(基于 NVIDIA Warp)之上,配合 mjlab(重实现了 Isaac Lab API 的训练框架)。在 NVIDIA GPU 上并行模拟 4096 只虚拟鸭子,约 1~2 小时就能训出一个可用的行走步态;也可以在 Hugging Face 自己的推理/训练基础设施上跑。
核心管线
- 仿真 —— 数千只虚拟鸭子在 MuJoCo Warp 并行运行,每个 episode 由任务特定的 reward 塑造。
- PPO 训练 —— mjlab 在仿真里训练策略,仓库自带 13 个任务族可作起点。
- 仿真到现实 —— 导出训练好的策略,部署到 50 Hz 机载策略循环,驱动 15 个电机与摄像头、LiDAR、双 IMU。
从哪开始
出厂 7 个动作全部公开且可重训,选一个当基线而非从零训。第一个实验建议:在某个现有步态上微调行走 reward,观察 reward 曲线,再并排对比仿真与实机的行为差异。
实践建议
- 并行训练循环基本要求 NVIDIA GPU(或用 HF 基础设施)——别指望在笔记本 CPU 上训步态。
- 注意许可区别:软件是 Apache-2.0,但机械/电子设计文件采用非商业许可,所以这是「开源软件平台」,不是开源硬件。
- 想轻量地玩仿真,社区封装如
microduck-mcp可从任意 MCP 客户端驱动仿真鸭子。
资源链接
- 发布文:Meet Microduck
- 产品与文档:pollen-robotics.com/microduck
- GitHub:pollen-robotics/microduck