全球首个世界统一模型发布:机器人进入家庭场景迈出一大步

4月23日,自变量机器人在新品发布会上正式推出全球首个基于世界统一模型(WUM)架构的具身智能基础模型WALL-B,并宣布首批搭载该模型的机器人将于35天后入驻真实家庭。这意味着能在真实家庭场景中持续理解世界并自我进化的机器人大脑正式面世。

VLA架构的瓶颈

过去两年,VLA(视觉-语言-动作)架构是机器人领域最主流的技术路线。通过融合视觉等多模态感知信号与语言指令,VLA让机器人从只会执行单一动作进化到能看、能听、能跟着指令干活。

然而,真实家庭的部署让研发团队看到了VLA架构的瓶颈。VLA本质上是视觉、语言、动作三个独立模块的拼接,数据在这三个模块之间逐级传递,每经过一次模块边界就会发生信息损耗和延迟。更核心的问题在于,VLA模型只能模仿训练数据中的动作轨迹,无法真正理解物理世界的规律。

它不理解杯子为什么会掉,不理解为什么盘子悬在桌边需要推回去。它只是在重复见过的动作。

从模块拼接到统一架构

WALL-B的推出被视为对这一困局的突破性回应——不是迭代升级,而是从底层架构到训练范式的全面重构。

与世界其他方案的核心区别在于,WALL-B实现了从VLA到WUM(世界统一模型)的跨越。WUM的核心理念是:将视觉、语言、动作、物理预测等所有能力,整合到同一个网络中从零开始联合训练、深度融合,彻底消除模块间的边界和数据搬运损耗。

这一设计思路类似于Apple Silicon的统一内存架构:在M1芯片之前,CPU、GPU、内存各自独立,数据搬运产生的延迟和损耗成为性能瓶颈;统一内存架构让所有处理单元共享同一块内存,性能大幅提升。

原生多模态:看见即理解

世界统一模型为机器人带来的第一个关键能力是「原生多模态」——解决看见和行动之间的信息折损问题,把视觉、语言、动作、触觉直接打通。

这意味着机器人不仅能看见物体,还能直接理解环境并做出反应。看到地上的水,就能理解「滑」意味着风险,并自动关联到绕行、清理、避险等动作。

「世界观」与持续进化

WALL-B的第二项关键能力是「世界观」——让机器人不只看到世界,更开始读懂世界,建立起对现实规律的判断,理解物体背后的状态、关系和后果。

更重要的是,WALL-B还具备「与世界交互」的能力:机器人在真实环境中边做边学,把成功经验更新到模型参数中,无需工程师重新回收数据、训练、部署。

数据飞轮:从糖水到牛奶

在具身智能行业,最核心的资源是高质量训练数据。业内提出「糖水数据」(实验室可控数据)和「牛奶数据」(真实家庭场景数据)的对比——前者易采集但泛化能力弱,后者难采集但训练价值高。

当WALL-B进入真实家庭执行任务,系统会形成正向循环:家庭积累交互数据 → 数据推动模型迭代 → 模型能力提升后进入更多家庭 → 采回更多高价值数据。这个数据飞轮一旦跑起来,就形成了难以复刻的最高壁垒。

首站落地:家庭保洁

发布会上,自变量与58同城共同宣布,搭载WALL-B的机器人保洁员将于近期开始提供上门服务,实现人机协同的家庭保洁作业。

目前全球范围内尚无任何一台机器人能在无遥控操作的情况下独立完成大部分日常家务。家庭环境的随机性、碎片化和不断变化,被认为是这个时代最难的技术问题之一。而WALL-B正在将这一问题的解决时间表大幅提前。


标签:具身智能 | 机器人 | 世界统一模型 | WALL-B

滚动至顶部