机器人翻车名场面,你一定见过:插头在边缘反复摩擦却死活插不进去,抓取塑料瓶时力道失控把瓶身捏瘪,叠好的毛巾松手瞬间散落一地——视觉系统明明判断无误,物理交互的瞬间就是翻车。
这不是偶然,这是具身智能行业公认的"最后一厘米"问题:摄像头能看清空间位置,但感知不到"是否接触"、"顶到边缘"、"夹力过载"还是"发生滑移"。视觉驱动了前99%的路径规划,却在触物瞬间失明。
7月25日,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院,正式发布三份技术报告,把触觉从"辅助模态"推到了"核心基建"的位置。三份报告合起来看,恰好拼出一张完整的蓝图:一套触觉数据底座,搭配两条不同侧重的技术路线。而且,数据和模型全部开源。
一、先解决"方言"问题:30,000小时触觉数据底座
触觉数据规模化应用的最大障碍,长期是各传感器输出格式互不兼容。凝胶形变图、电容矩阵、六维力向量——各家传感器像说不同方言,无法在同一模型里融合。
NeoteAI 的 NeoData 数据集,目标就是打穿这一壁垒:
- 超过 30,000 小时视觉-触觉交互视频
- 约 140 万条操作片段,33 亿个时间步
- 对应 80 亿帧 RGB 画面与 100 亿帧触觉图像
- 动用 Franka、Piper、UR5e 等 6 种机器人本体
- 覆盖 450 项真实长程任务(叠衣、插拔接头、倒液体等),由 90 位操作员采集
- 已开源 5,000 小时视觉-触觉交互视频
配合数据集,团队提出了 NeoForce 统一表征模型。无论底层传感器硬件如何,模型都能学习到具备迁移能力、时序结构化的触觉表征——"哪里被按?按多大力?有没有横向拉扯?"——这套"触觉普通话"有效解决了跨设备数据融合难题。
二、VTLA:触觉预判,让VLA不再"慢半拍"
数据底座夯实后,更大的挑战来了:如何把触觉真正融入VLA(Vision-Language-Action)架构?
直接把触觉图像与RGB视觉信号做简单拼接,效果很差。原因在于,触觉信号仅在物理接触瞬间产生高频响应,大部分时间处于"静默"状态,极易被海量视觉Token淹没。更关键的是,即便模型提取到了当前触觉特征,本质上也只是一段已发生动作的滞后反馈——"后视镜"式的感知,在动态交互中永远慢半拍。
NeoteAI 的 VTLA 方案另辟蹊径:不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变。模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,指导动作模块提前调整。
效果非常直观:
- 插插头任务:VTLA 成功率 85%,同类视觉方案仅 60%
- 拔钥匙任务:VTLA 成功率 99%,视觉方案仅 35%
更有意思的是,VTLA 突破了传统模仿学习仅依赖专家成功轨迹的局限。通过结合触觉信息的部署后数据和 human-in-the-loop 训练,模型学会了识别任务执行阶段,甚至能识别"退步"与"救场"等复杂行为。加上离线强化学习,长程任务成功率大幅跃升:毛巾折叠 50%→95%、书包收纳 35%→80%、纸箱折叠 20%→75%。
三、TWAM:在世界模型里重构"触觉想象"
如果说 VTLA 是加装预判雷达,TWAM 则是对机器人"认知中枢"的重构——把触觉放进世界模型,让机器人在动手之前,先在自身"想象"中完整推演一遍操作视角和手感。
现有世界模型大多局限于未来视觉图像的生成,在驱动真实机器人时面临严峻的物理对齐挑战:画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?这些触感信息完全缺失。
TWAM 采用混合专家架构,内置视频、触觉、动作三个异步专家网络。视频专家从预训练模型热启动,触觉和动作专家用更窄的结构,总参数量仅 72 亿——相当于全宽方案的一半,但效果惊人:
- 仿真平均成功率 84.5%(世界模型最强基线仅 36%)
- 真机 8 项任务平均成功率 46.3%(同期方案 21.9%)
消融实验进一步证实,去除"未来触觉预测"或"当前触觉条件"均会导致性能显著下降——触觉在世界模型中的不可或缺性被实锤了。
从"看懂世界"到"摸透世界"
纵观三份报告,NeoteAI 释放了明确的行业信号:
- 𝒩₀-Foundation 验证了触觉模态具备类似视觉的 Scaling 潜力
- VTLA 证明了触觉可以自然地接入现有 VLA 架构
- TWAM 确立了触觉在世界模型顶层设计中的核心地位,与视觉模态真正平起平坐
机器人的认知范式,正在从单一的"视觉驱动"向"视触融合"演进。它们不再仅仅通过"看"来理解世界,而是开始像婴儿一样,通过主动的触觉探索来验证假设、规划下一步动作。
"看得见杯子不等于拿得稳,认得出插座不等于插得进"——这条物理世界的常识,终于被写入了机器人的底层逻辑。
距离"随手一摸即知轻重"的通用具身智能当然还有长路,真实场景数据采集成本、跨本体泛化能力、推理实时性都是待攻克的工程难题。但 NeoteAI 这组工作,已经实质性地把触觉从"小众研究方向"推到了"具身智能核心基建"的位置上。
具身智能的下一篇章,或许不再只是"让机器人看懂世界",而是真正"让机器人摸透世界"。
项目链接:https://research.neoteai.com
公司官网:https://www.neoteai.com
