看得见的视频,进不去的世界
今天的视频生成模型已经很会「拍电影」了:一句提示词,它能安排角色、动作和镜头;给它一张图,它能补出后续运动。可一旦想绕到物体背后、自由改变视角,或者把场景直接丢给游戏引擎、机器人仿真器、VR/AR 系统——问题就暴露了。
你看到的仍然是一段固定镜头下的二维视频。它看起来像一个世界,却还不是一个可以被观察、被操作的世界。
这正是浙大(ReLER、CCAI)团队新论文《Beyond Pixels: From Video Priors to 4D Worlds》要解决的问题。而他们给出的答案很反直觉:别去生成像素,直接从隐空间出发。
为什么「先生成视频、再重建 3D」的路走不通
目前从文本或图片生成动态 3D 场景(4D 生成)主要有两条技术路线,都卡在同一个点上:
级联式(先生成再重建):先用视频生成器产出 RGB 帧,再用独立的 4D 模型把画面重建成立体几何。这条路存在明显的分布不匹配——视频模型在互联网海量数据上训练,产出的纹理和时序噪点,4D 重建模型(往往在小数据集上训练)根本接不住,于是画面闪烁被直接放大成破碎的 3D 表面。像素级的瑕疵会一路传播到几何结构里。
端到端(直接预测几何):生成过程中直接输出几何,绕开了 RGB 瓶颈,但代价是把几何预测深度绑定到某个具体生成器上。想升级到更强的视频模型?整个几何模块得重新训练。
两条路共同的病灶就是 「RGB 表示边界」:只要 4D 预测必须经过像素空间,就摆脱不了像素生成器带来的伪影、分布差和耦合限制。
核心洞见:VAE 隐空间就是被忽略的「通用接口」
论文的关键洞察很简单:共享的 VAE 隐空间本身就是一套通用协议。
很多现代视频扩散 Transformer(DiT)——包括 Latte、CogVideoX、PixArt-Σ 等——都共用同一个变分自编码器(VAE)checkpoint,把画面压缩进隐空间、再解码回像素。这个隐空间(记为 Zv)在渲染成像素之前,已经包含了丰富的表观、结构和运动信息。
研究者由此假设:这个隐空间可以作为 4D 预测的天然公共接口。 因为多个 DiT 共享同一套 VAE 约定(缩放、张量排布、压缩率),一个学会读这些隐向量的 4D 模型,理论上能兼容任何输出到同一隐空间的生成器,无需重新训练。
这就像 USB 统一了外设连接:不再需要每台设备单独一根线、一个驱动,一套共享协议就能解锁通用兼容。
Latent-to-4D 怎么做:对齐、精炼、生成
团队把这一洞见落地成方法 Latent-to-4D,核心三步:
1. 对齐隐空间网格。把视频 DiT 去噪完成的最终隐向量,与预训练 4D 解码器的体素/时空 token 网格对齐——把 2D+t 的视频隐向量映射到 3D+t 的体素网格,全程不经过 RGB 解码。
2. 时空注意力精炼。用逐帧 + 全局时空注意力对对齐后的隐向量做精修,抹平本来会变成几何错误的时序不一致,保证 4D 输出的时间连贯性。
3. 解码成 4D。精炼后的 token 交给预训练 4D 解码器,输出显式的动态 3D 场景——带纹理、会动、可以绕行、可以导出,也可以直接导入仿真环境。
整条管线只用了约 1,000 段现有重建视频片段(来自 EPIC-KITCHENS、Objaverse-X 等公开重建资源)做训练,完全不需要视频生成训练数据。
一个 Checkpoint,多个生成器通用
这是 Latent-to-4D 最体现结构价值的地方:单个训练好的 checkpoint,可以原样迁移到同 VAE 家族的多个视频 DiT 上,零样本、无需重训、无需微调。
在 Text4D-200 和 I4D-200 两个基准上,Latent-to-4D 对比同隐空间的 Wan+4RC 级联基线,投影 DINO-F1 指标分别高出 2.88–3.45 分和 5.81 分;人工评测在几何保真度、时间稳定性、整体观感上也一致更优。
代码和权重已经完全开源,数据集基于公开重建资源构建,随时可以拿来复现和集成。
越过像素:对内容创作意味着什么
Latent-to-4D 代表一个结构性的转向:不再把 RGB 当作理所当然的产出格式、事后修几何,而是把隐空间当成原生格式,让 4D 预测成为与具体视频模型解耦的一等能力。
产业上的想象空间不小:
- 游戏与 VR 管线:从文本或视频提示直接生成动态 3D 场景,不再经过容易出错的 RGB 重建。
- 机器人仿真:从视频隐向量生成的 4D 场景,可直接喂给仿真环境用于具身智能训练。
- 跨模型生态:当更多视频生成器采用通用 VAE 约定,一个 4D 解码器就能兼容整个生态——和现在各自为战、绑定特定生成器的做法正好相反。
这条研究路线与「世界模型」走向几何结构理解的大趋势一脉相承——从「生成画面」到「生成现实」的桥,正越修越近。
一句话总结:通往 4D 世界的捷径,不经过像素。 它藏在视频生成器早已在用、我们却一直忽略的隐空间里。