一句话
腾讯在WAIC 2026发布Hy-Embodied系列三大具身基座模型,首次系统性打通"感知—认知—行动"闭环,VLA模型已在日化工厂实测:成功率95%+,节拍6秒/件,新SKU适配不到3天。
破题:具身智能的"缸中之脑"困境
今天最聪明的大模型,本质上仍是"缸中之脑"——它善于推理、生成和问答,却不理解物体的位置、空间关系与可操作性,更无法在持续变化的环境中边行动、边调整。
腾讯首席科学家张正友在WAIC现场说了一句精准的话:"语言并不等于全部认知,它只是智能向外表达的一个通道。"
真正的智能,需要让语言、视觉、空间认知、身体控制和环境反馈连通起来,在"感知—身体—行动"的闭环里接受验证。这正是腾讯今天发布的五项新成果试图回答的问题。
拆解:三个模型,三种角色
腾讯 Robotics X 实验室联合混元发布的三大具身基座模型,对应了具身智能的三个核心能力层:
Hy-Embodied-VLM-1.0 —"右脑",负责看
解决三个层层递进的问题:看物知用(理解深度、方位、可操作点)、看景知变(判断下一步动作及其变化)、看远知返(长时程任务中记忆历史、失败后重新规划)。关键数据:仅A3B规模、约1/10计算量,就接近上一代A32B旗舰模型效果。这意味着它可以直接部署在机器人端侧。
Hy-Embodied-RxBrain-1.0 —"大脑",负责想
把"会推理"与"会想象"统一:面对任务,一边用语言给出步骤约束,一边生成每步完成后应达到的目标图像。让下游动作模型不仅"听到做什么",更能"看到做成什么样"。这是一种全新的认知范式——用视觉想象来锚定推理链条。
Hy-Embodied-VLA-0.5 —"小脑",负责做
核心竞争力不是更大的模型,而是"数据—模型—训练—部署"协同发力的完整学习栈:亚毫米级UMI采集系统 → 超一万小时人类示教数据 → 强化学习训练。在RoboDojo评测中拿下仿真综合排名第一,尤其长程任务和记忆任务两个维度领先。
框架:从"拼模块"到"建闭环"
过去具身智能的主流做法是拼模块——拿一个视觉模型、拿一个语言模型、拿一个控制模型,拼在一起。问题在于,每个模块各自优化,接口处全是缝隙。
腾讯的思路是原生闭环设计:三个模型从第一天就为协同工作而设计,再由两个智能体层(Apexio持续在线智能体 + TairosAgent原生框架)统一调度。Apexio三层架构尤其值得注意:
- 认知层:按需唤醒,深度思考
- 感知行动层:~15Hz持续接收多模态信息并快速调整
- 执行层:更高频运行,像条件反射一样处理碰撞与失衡
再加上"目标驱动"(完成任务)和"生存驱动"(安全、能耗、状态管理)双主线,即使没有外部指令,机器人也持续感知、持续自保。
落地验证:95%成功率意味着什么
最值得关注的数据来自真实工厂:HyVLA-0.5在日化品工厂的生产实测中——
- 作业成功率 > 95%
- 节拍 < 6秒/件
- 新增SKU的数据采集与模型后训练时间 < 3天
这三个数字放在一起的意义是:具身智能不再是实验室里的demo,而是可以应对"高混合、小批量、SKU频繁迭代"的真实产线。3天适配新SKU,意味着它跟得上消费品行业的迭代节奏。
推演:具身智能的"Android时刻"?
TairosAgent的设计思路暗含一个更大的野心:通过统一硬件适配层和标准化Skill接口,接入不同模型、不同形态的机器人。这与Android早期通过标准化接口让不同硬件厂商接入的逻辑如出一辙。
腾讯把平台命名为"钛螺丝"(Tairos),定位是"连接模型、本体、工具与应用的钛螺丝"。如果这个生态位成立,具身智能可能正在走向它的"Android时刻"——不是某一个机器人赢了,而是一个平台让所有机器人都能跑起来。
落到行动
对机器人开发者:Hy-Embodied-VLM-1.0已开源,A3B规模可端侧部署,值得立即评估是否适配你的机器人本体。
对制造业决策者:95%成功率+3天SKU适配的数据,说明具身智能已经跨过了"能不能用"的门槛,进入了"值不值得投"的阶段。日化、消费品等高混合低批量场景是最佳切入点。
对AI从业者:关注"数据—模型—训练—部署"协同设计的方法论。具身智能的竞争不在单一模型,而在整个学习栈的闭环效率。
