上次我们拆过「看一遍就会」的 具身智能 GPT-3 时刻;这次是两个竞品机器人共用同一个大脑——范式从「学会看」切换到「会协作」。
一段没有片头、没有署名、没有剪辑的 10 分钟视频,让整个具身智能行业集体沉默了。拍摄场地只是一个约 15 平方米、过道窄到转身都费劲的出租屋,两台互为市场竞品的人形机器人——宇树 G1(1.3 米)和智元远征 A3(1.7 米)——正在同一套「通用大脑」的调度下并肩干活:擦玻璃、取洗衣机里的衣物、分类收纳、开关冰箱、整理桌面;发现玻璃外侧有污渍,侧身探出手臂去擦;够不到高处,自主找箱子垫脚,甚至一脚把箱子踢到柜子旁。全程无剪辑、无遥操、无人工指令,十分钟零卡顿。
为什么这一条视频比过去所有精修 Demo 都更值得认真对待?因为它可能标志着行业从「数据直觉」切换到「物理智能」的范式转折。
三条技术内核,绕开了 VLA 与 WAM 的死结
过去两年,行业两大路线——VLA(视觉-语言-动作模型,代表 RT-2、OpenVLA)和 WAM(世界动作模型)——本质上都是「数据驱动的任务拟合」:前者学「看到什么画面就输出什么动作」的统计相关性,不理解物理因果,长时序误差累积、且与本体硬件深度绑定;后者先预测动作后果再反推动作,有想象力但「知行割裂」,算力开销大、实时落地难。两条路都困在同样的天花板:动作是「猜」出来的,不是「算」出来的。
物理约束动力学学习
物理约束动力学学习::动作轨迹不是数据概率拟合,而是基于重力、力矩、接触力、空间约束的实时计算。擦玻璃时它实时解算接触力与关节力矩,手臂伸出窗外时实时补偿重心偏移——所以它没见过「探身窗外擦玻璃」也能现场推导出最优动作。训练数据里没有「用脚踢箱子」,它照样自主想出了这个解法。
跨本体统一建模
跨本体统一建模::G1 与 A3 的运动学参数、自由度、力矩特性完全不同,历史上算法无法互相迁移。这套大脑用统一动作表示 + 本体自适应机制同时驱动两台完全不同的机器人,相当于完成了一次「软硬件解耦」——就像 Windows 可以装在联想、惠普、戴尔任何品牌电脑上。
长时序鲁棒闭环
长时序鲁棒闭环::视频进行到一半闹钟响起,两台机器人立刻中断家务执行「整理桌面和冰箱」的插队指令,完成后又精确恢复此前被打断的取衣收纳任务。这种实时纠错 + 动态任务调度 + 情景记忆恢复,是机器人领域首次公开展示。
心智模型:猜 vs 算
其一,「通用大脑」将终结「本体之争」。就像智能手机时代的「Android + 高通 + 整机厂」分工,具身智能将走向「通用大脑 + 专业本体 + 场景应用」三层结构:硬件厂商专注关节精度、续航、成本;AI 公司专注让大脑更聪明;应用商专注场景。那些坚持「算法绑定硬件」的封闭生态将承受巨大转型压力。
什么会先崩
其二,有消息称该模型仅用「几十个小时」的视频数据训练即达到此效果(尚未官方确认)。如果属实,这是对「数据越多越聪明」叙事的直接挑战——具身领域的 Scaling Law 可能需要重写,护城河从「谁的数据多」转向「谁更懂物理世界」。 这也与机器人量产卡在万台关口的瓶颈同源:缺的不是模型,而是把 AI 输出变成可靠物理动作的验证与制造闭环。
可以立刻做什么
- 工程团队:别再把 VLA vs WAM 当作终极框架,把「物理优先、动力学驱动」纳入技术评估矩阵,并测试自己的栈能否跨两台不同本体迁移——这已是新的行业基准。
- 硬件厂商:押注关节、电池、成本与可靠性。大脑走向通用后,本体才是持久差异化;接口开放、文档完善的厂商会被所有大脑提供商选中。
- 投资与战略层:重新审视以「专有数据管线」为唯一护城河的具身项目——溢价正在向世界模型质量与跨本体迁移能力迁移,而 Veeda 的生成式世界模型训练场 正是这条护城河的一部分。
当然,团队匿名、技术细节未公开、训练数据量未证实,这条视频是「方向性很强的信号」而非「已完成的结论」。但它暴露的技术范式——大脑解耦、物理计算替代概率拟合、长时序闭环——恰恰是行业原本以为还要等几十年的东西。旧时代的 Demo 是为镜头精心排练的;这条视频连修都不修。本体不再是故事,大脑才是。这是结构变化,不是一次产品发布。