李飞飞的 World Labs 发布了其最大胆的一步:Atlas,一个从头预训练的多模态世界模型,原生处理文本、图像、视频与 3D 数据。它不是又一个借「世界模型」之名的图像生成器,而是把世界生成、空间重建与物理模拟收进同一个模型——这才是值得拆开看的结构性变化。
Atlas 能做什么
- 可控运镜:像素级相机控制,从单/多张图生成最长 60 秒、1440p 视频。
- 空间重建:单张到数十张输入重建真实场景,既能生成新视角帧,也能输出显式 3D,性能优于现有专用重建模型。
- 时空模拟:对视频中的空间与时间建模,为机器人提供真实到模拟(real-to-sim)的工作流(具身 AI 正在走向共享大脑的拐点)。
- 图像生成:文生图与 360° 全景,可遵循复杂提示。
底层是多模态自回归扩散 Transformer:序列元素逐个生成、逐步参考既有上下文,视觉输出通过去噪产生。关键是相机位姿与深度被当作模型处理的一等数据类型,而非事后硬加的控制参数。
相机位姿为什么重要
「镜头左移」是意图描述;指定相机在空间中的位置与朝向,则是一组可检验的约束。前者要模型猜测你想要什么,后者允许创作者检查镜头是否真的到位。对需要反复修改、衔接镜头的制作流程,差别不只是控制更细,而是能否把同一环境当作可复用场景,而非每次重新抽一段视频。
重建与生成同理:证据充分的区域应尽量还原,没拍到的只能依已有信息补全。一个模型同时承担两者,意味着使用者必须清楚哪些来自观测、哪些来自想象。生成得合理,不代表它就是现实的样子。
三类世界模型:渲染器 / 模拟器 / 规划器
这是 World Labs 公开研究里最有指导意义的框架。今年 6 月的文章把世界模型分成三类:生成观察画面的渲染器、描述世界状态与变化的模拟器、决定下一步动作的规划器。
一段视频看着真实,不等于它能当可靠的训练环境。影视镜头只需让手与杯子的接触看起来自然;训练环境却要回答:抓取位置偏移后会不会滑落、动作改变后结果是否一致、模拟中的改进能否迁移到真实机器人(这是另一个角度:如何用世界模型训练机器人)。
为什么这不是更「大」的模型
World Labs 的路线解释了它的执念。创始团队(李飞飞、Justin Johnson、NeRF 作者 Ben Mildenhall、Pulsar 作者 Christoph Lassner)来自视觉、图形学与三维表示,而不只是语言建模。公开轨迹从 2024 年 12 月浏览器可探索的 3D 世界,到 2025 年 11 月开放的 Marble,再到 2026 年 1 月的 World API、7 月收购机器人公司 SceniX 并演示 real-to-sim-to-real 闭环(机器人数据经济的关键拼图,含线缆操作与杂乱抓取的一小时无人干预运行)。
2026 年 2 月的 10 亿美元融资(AMD、Autodesk、英伟达、Fidelity 等)折射出两道门槛:连续视觉数据的训练算力,以及专业生产流程。Autodesk 的 2 亿美元战略投资指向更硬的那半——世界模型要在建筑、制造、影视管线里落地,还得过约束、尺寸、资产兼容和稳定交付这关。钱能买算力,买不来这些工程。
该关注什么
Atlas 目前对部分合作伙伴开放早期访问,会支撑后续 Marble 产品。三个信号最关键:统一模型在大规模下是否真能保住重建保真度与模拟一致性;real-to-sim-to-real 闭环能否产出可预测真实表现的机器人训练环境;以及 Autodesk 级专业工作流能否跑通。对工程师的实际建议:把「世界模型」拆成三个独立承诺——渲染、模拟、规划,再按你真正需要的那一个去评估厂商。
