Veeda AI:用生成式世界模型给机器人造一座「可试错」的虚拟训练场

今天的工业机器人本质上还是在背诵人类写好的「教科书」:工程师采集遥操作数据、标注轨迹,再祈祷机器在真实仓库或家庭的复杂地面上能泛化。Veeda AI 想改变这件事。这家由前 NVIDIA AI 研究副总裁 Sanja Fidler 与两位长期搭档创立的公司,正在用多模态基础世界模型,把机器人训练从「模仿学习」搬进「可交互的虚拟现实」。它刚刚完成由 Khosla Ventures 与 Radical Ventures 联合领投的 9000 万美元种子轮融资,说明资本开始押注仿真实验设施本身,而不仅是又一家人形机器人硬件团队。

「世界模型」不是视频生成器

Veeda 给自己的定位是多模态基础世界模型,但它和那种输入一段提示词就生成漂亮视频的视觉模型不同。它的输入是机器人的动作指令或相机运动,输出是下一帧世界应该长什么样。目标不是拍电影,而是造一个可训练的仿真器,让具身智能体在不用碰坏任何真实传感器的前提下,练习抓取、导航、装配和失败恢复。

创始三人组的背景都出自 NVIDIA 的空间智能与生成式 AI 实验室:Fidler 曾任 NVIDIA AI 研究副总裁,共同推进 3D 场景合成;Zan Gojcic 专注神经重建与高保真仿真环境;Huan Ling 负责实时高分辨率视觉合成。他们的研究谱系贯穿 GameGANDriveGAN、视频 Latent Diffusion 以及 NVIDIA 的 Cosmos 世界模型家族。2026 年 6 月,团队发布了 OmniDreams,一个面向自动驾驶闭环仿真的动作条件化生成式世界模型,能在生成环境中对驾驶策略做与真实数据重建一致的评估。Veeda 要做的,就是把这种闭环思路从自动驾驶扩展到通用机器人。

为什么真实世界不是好的训练场

真实世界机器人训练是一个被包装成工程问题的数据瓶颈。遥操作数据质量高但采集慢、成本高;互联网视频数量大但缺少动作标注;纯模仿学习遇到新姿态、新光照或意外碰撞时就会失效。演示学习路线也绕不开真实数据--GEN-1.5 看几秒演示就能学会新任务,但每个新任务仍要先采集一次真实演示。

Veeda 的判断很直接:机器人需要通过试错来学习,而真实世界的试错太贵、太慢、太难并行。 把机器人放进厨房,它可能打碎盘子;把一百万个策略副本放进神经仿真器,它们可以连夜探索。Veeda 赌的是,一个足够忠实的世界模型能成为具身 AI 的「现实健身房」,就像 Dota 环境之于 OpenAI Five、AlphaFold 数据集之于结构生物学。

技术栈可能长什么样

Veeda 尚未发布完整技术白皮书,但从创始人过往工作和招聘信息可以还原出大致架构:核心是一个动作条件化的视频模型 + 潜在动力学模型,生成主干预计采用 rectified flow 扩散 Transformer、块因果自回归结构,以及因果视频分词器。分词器的压缩比非常关键,压缩得越狠,模型能在显存里推演越长的未来。

要让这个世界模型真正用于机器人训练,需要解决四个难题:

  • 动作条件化,但不依赖遥操作标注。 Veeda 计划用逆动力学(inverse dynamics)和潜在动作模型,从无动作标签的视频中恢复「伪动作」,从而把训练数据来源从昂贵的人工遥操作扩展到海量视频。
  • 长程稳定性。 世界模型会逐渐吃自己的输出,误差累积会导致漂移。Veeda 预计用 diffusion forcing、self-forcing,以及持久的 3D Gaussian 或点图场景表示,把连贯推演从「几帧」拉到「分钟级」。
  • 实时交互。 如果仿真一步要渲染几分钟,强化学习就没法用。模型需要被蒸馏成少步采样器,让策略能以交互速率在世界模型内部行动。
  • 物理约束验证。 纯生成模型会幻觉。Veeda 倾向于把传统物理求解器与生成模型结合,用基于物理的奖励模型和验证器把推演限制在物理合理范围内。

它不是要取代 Isaac Lab 或 DM0.5 这类开源 VLA 方案,而是想坐在更上层:一个可接入现有仿真 API 的学习型世界生成器,能够对 π0GR00T N 等具身基础模型做后训练,再部署到真实硬件。

从自动驾驶到通用机器人

OmniDreams 的可贵之处在于,团队已经证明了他们能做出闭环驾驶仿真器:策略的动作会逐帧改变生成场景。把这套能力迁移到机器人,意味着世界模型要处理抓取、可变形物体、接触物理和多样机位,难度远高于驾驶,但经济回报也更大:仓库、医院、农业、家庭都需要能快速适应新任务的机器人。在量产交付仍卡在万台关口的当下,训练数据层的进展将直接决定这波回报兑现的时间表。

如果 Veeda 成功,机器人策略的开发流程将越来越像训练大语言模型:在广泛的仿真经验上预训练,用少量真实数据微调,再用 Sim2Real 差距评估。最昂贵的环节将从「手工搭建仿真场景」变成「扩展世界模型本身」

产业信号

Veeda 的成立是一个明确信号:物理 AI 正在进入数据基础设施阶段。 过去几年,聚光灯打在硬件平台、视觉-语言-动作基础模型和人形演示上;现在前沿正移向「生成训练数据」这一层。历史上有过类似剧本:自动驾驶里,拥有高保真仿真器的公司比困在真实路测的对手迭代更快;游戏领域里,程序化环境催生了 AlphaStar 和 OpenAI Five。机器人是下一个。

资本实际上在赌:在生成现实中进行交互式学习,会成为具身 AI 栈的核心原语之一,与执行器、感知模型、推理芯片并列。如果赌对了,下一代机器人基础模型的评价标准可能不只是参数量,而是它们能「消费」多少模拟年的经验。

行动建议

  • 机器人工程师: 把世界模型当作一等训练环境,而不是可视化工具。未来 Sim2Real 管线消耗的算力可能超过策略本身。
  • AI 产品负责人: 想清楚你的机器人价值来自硬件 novelty,还是训练它的数据引擎。Veeda 说明资本正在流向后者。
  • 投资者与监管者: 关注生成式仿真的「保真度-成本曲线」。一旦生成环境比真实试点更便宜、更安全,现有的责任与监管框架必须跟上。

FAQ

什么是机器人基础世界模型?
它是一种生成式仿真器,根据当前状态和机器人动作预测未来观测,让策略在没有物理机器的情况下练习任务。

Veeda 和 NVIDIA Isaac 等传统物理仿真器有什么区别?
Isaac 依赖手工搭建的图形管线与物理求解器;Veeda 试图从数据中学习世界动力学,再与物理约束结合,从而更容易扩展到新物体和新场景。

交互式世界模型训练什么时候能规模化?
特定工业任务可能在未来 2-3 年内进入生产环境,但通用家用机器人还需要更长时间,因为 Sim2Real 差距仍然很大。

来源:36Kr / 阿尔法公社

发表评论

滚动至顶部