腾讯一口气发布三大具身基座模型:具身智能的"缸中之脑"问题,终于有了解法

一句话

腾讯在WAIC 2026发布Hy-Embodied系列三大具身基座模型,首次系统性打通"感知—认知—行动"闭环,VLA模型已在日化工厂实测:成功率95%+,节拍6秒/件,新SKU适配不到3天。

破题:具身智能的"缸中之脑"困境

今天最聪明的大模型,本质上仍是"缸中之脑"——它善于推理、生成和问答,却不理解物体的位置、空间关系与可操作性,更无法在持续变化的环境中边行动、边调整。

腾讯首席科学家张正友在WAIC现场说了一句精准的话:"语言并不等于全部认知,它只是智能向外表达的一个通道。"

真正的智能,需要让语言、视觉、空间认知、身体控制和环境反馈连通起来,在"感知—身体—行动"的闭环里接受验证。这正是腾讯今天发布的五项新成果试图回答的问题。

拆解:三个模型,三种角色

腾讯 Robotics X 实验室联合混元发布的三大具身基座模型,对应了具身智能的三个核心能力层:

Hy-Embodied-VLM-1.0 —"右脑",负责看

解决三个层层递进的问题:看物知用(理解深度、方位、可操作点)、看景知变(判断下一步动作及其变化)、看远知返(长时程任务中记忆历史、失败后重新规划)。关键数据:仅A3B规模、约1/10计算量,就接近上一代A32B旗舰模型效果。这意味着它可以直接部署在机器人端侧。

Hy-Embodied-RxBrain-1.0 —"大脑",负责想

把"会推理"与"会想象"统一:面对任务,一边用语言给出步骤约束,一边生成每步完成后应达到的目标图像。让下游动作模型不仅"听到做什么",更能"看到做成什么样"。这是一种全新的认知范式——用视觉想象来锚定推理链条。

Hy-Embodied-VLA-0.5 —"小脑",负责做

核心竞争力不是更大的模型,而是"数据—模型—训练—部署"协同发力的完整学习栈:亚毫米级UMI采集系统 → 超一万小时人类示教数据 → 强化学习训练。在RoboDojo评测中拿下仿真综合排名第一,尤其长程任务和记忆任务两个维度领先。

框架:从"拼模块"到"建闭环"

过去具身智能的主流做法是拼模块——拿一个视觉模型、拿一个语言模型、拿一个控制模型,拼在一起。问题在于,每个模块各自优化,接口处全是缝隙。

腾讯的思路是原生闭环设计:三个模型从第一天就为协同工作而设计,再由两个智能体层(Apexio持续在线智能体 + TairosAgent原生框架)统一调度。Apexio三层架构尤其值得注意:

  • 认知层:按需唤醒,深度思考
  • 感知行动层:~15Hz持续接收多模态信息并快速调整
  • 执行层:更高频运行,像条件反射一样处理碰撞与失衡

再加上"目标驱动"(完成任务)和"生存驱动"(安全、能耗、状态管理)双主线,即使没有外部指令,机器人也持续感知、持续自保。

落地验证:95%成功率意味着什么

最值得关注的数据来自真实工厂:HyVLA-0.5在日化品工厂的生产实测中——

  • 作业成功率 > 95%
  • 节拍 < 6秒/件
  • 新增SKU的数据采集与模型后训练时间 < 3天

这三个数字放在一起的意义是:具身智能不再是实验室里的demo,而是可以应对"高混合、小批量、SKU频繁迭代"的真实产线。3天适配新SKU,意味着它跟得上消费品行业的迭代节奏。

推演:具身智能的"Android时刻"?

TairosAgent的设计思路暗含一个更大的野心:通过统一硬件适配层和标准化Skill接口,接入不同模型、不同形态的机器人。这与Android早期通过标准化接口让不同硬件厂商接入的逻辑如出一辙。

腾讯把平台命名为"钛螺丝"(Tairos),定位是"连接模型、本体、工具与应用的钛螺丝"。如果这个生态位成立,具身智能可能正在走向它的"Android时刻"——不是某一个机器人赢了,而是一个平台让所有机器人都能跑起来。

落到行动

对机器人开发者:Hy-Embodied-VLM-1.0已开源,A3B规模可端侧部署,值得立即评估是否适配你的机器人本体。

对制造业决策者:95%成功率+3天SKU适配的数据,说明具身智能已经跨过了"能不能用"的门槛,进入了"值不值得投"的阶段。日化、消费品等高混合低批量场景是最佳切入点。

对AI从业者:关注"数据—模型—训练—部署"协同设计的方法论。具身智能的竞争不在单一模型,而在整个学习栈的闭环效率。

滚动至顶部