过去两年,可交互世界模型把画面卷到了新高度:4K、物理一致性、长时间持续生成。但戴上耳机就会发现一个致命短板——这片世界一片寂静。现在终于有人补上了这块拼图。Noiz AI 联合香港科技大学、清华、CMU、Google DeepMind 的研究员发布了 HelixWorld 1.0:一个实时可交互的音视频世界模型,输入一张图和一句提示词,眼前就展开一个持续生成的世界——24FPS 画面与 48kHz 双声道音频由同一个原生 Transformer 联合生成,往前走、转过身,画面和声音同时跟上。声音不是事后贴的音轨,而是从生成第一刻起就属于这个世界。
为什么声音是硬骨头,不是锦上添花
在可交互世界里,声音承担的信息画面给不了:身后的脚步、拐角外的碰撞,往往只有耳朵先听到;离多远、踩在什么材质上、声音从哪个方向来,都会改变听感,听者一转视角,整个声场都得跟着转。这迫使 HelixWorld 把整个技术链路重做了一遍,团队把它拆成四步。
第一步是数据。视觉侧已有成熟解法:用位姿估计模型反推每帧相机轨迹、生成动作标签。但声音侧几乎没有现成数据——现有视频数据集按分辨率、时长、镜头切换筛选,几乎不管音轨,因为没人打算生成有声世界。团队两条腿走路:真实世界数据来自公开网络视频,其中最有价值的是第一人称连续行走素材,环境声同期录制、声画天然对齐;游戏世界数据则补上精确空间关系——几何、材质、声源位置、听者朝向全部已知,每一声都能对上物理位置,还天然带动作标注。
清洗环节没有先例可抄:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,用语义筛选去掉旁白和外加音效;再做逐帧声画对齐校验——汽车从画面右侧驶向左侧,声像必须同步滑动;碰撞发生在哪一帧,音轨能量峰值就得落在哪一帧。每段素材除相机位姿和视频描述外,还要加音频描述与音视频联合描述,画外声单独标注,免得模型自己编造声源。走完整条管线后得到百万量级训练片段,再用人工标注训练分类器打分,筛出高质量微调子集。
一个 Transformer,两种模态,同一个世界
第二步是联合生成。团队以音视频生成基座 LTX2.3 为起点引入动作控制:音频和视频保留各自的 latent 表征,但进入同一个 Transformer 联合生成、持续交换信息,学习「根据当前状态和用户动作,预测下一刻的画面与声音」。人往前走一步,透视、遮挡和声源距离都得变;一转身,原来在正前方的声音转到侧后方,这才算真转过身了。质检不止靠耳朵:画质看 FID/FVD,音质看 FAD,音画同步看 Desync,声像方位还得人工核对——自动化的空间音频评测标准目前还不存在。
只看过去,也能一直生成
第三步是因果化。传统视频扩散模型是双向生成:算第 10 帧时可以偷看第 20 帧,更容易连贯。但交互世界里第 20 帧还没发生,用户下一秒往哪走也不知道。HelixWorld 把双向预训练模型改造成只看过去的因果模型,配合 KV Cache 复用历史信息、逐块自回归生成。这里有个隐蔽的坑:训练时模型看到的是干净正确的历史,部署时看到的却是自己刚生成的结果、误差早已混入。团队的解法是训练时就让它读自己生成的历史去预测正确结果,提前练习带着误差继续往下走,避免小误差滚成声画双双跑偏。
跨过实时门槛:轨迹蒸馏 + DMD
第四步是速度。原本几十步的去噪要压到个位数,同时省掉文本条件引导的额外前向计算。主流少步方案 DMD(分布匹配蒸馏)有著名副作用:画面过曝——高光溢出、色彩过饱和、暗部细节丢失,看着更亮其实失真。HelixWorld 把轨迹蒸馏和 DMD 放在一起:轨迹蒸馏让学生模型沿着教师的去噪路径走,给少步生成一个稳定基线;DMD 守住最终分布,避免步数压下去后偏离教师模型。再配合因果化 KV Cache 和逐块生成,上一块刚生成、下一块已经开始算,画面与声音边生成边输出,每次操作立刻得到回应。
当世界有了耳朵,接下来会发生什么
HelixWorld 的意义在于让声音成为世界模型的原生模态。此前腾讯 WorldPlay、蚂蚁 LingBot-World 已实现实时视觉世界,Google DeepMind 的 Genie 3 把探索推得更远,但声音都是缺席的。团队列出的下一步方向更有意思:多智能体世界——每个角色有自己的身份、目标和记忆,彼此协作或争执,故事在角色相遇后自己长出来;多人现场——模型要分清谁在说、对谁说、声音从哪来,抢话、停顿、眼神都会带偏下一秒的关系;超长时间一致性——世界跑上几小时甚至几天,角色记得自己是谁,昨天推开的门今天还开着;再远一点是自主进化——没有 Prompt、没有人在场,世界也按自己的规则继续运行,角色结成新关系,城市和资源继续变化。
这条轨迹比单个模型更大。正如2026 AI 趋势盘点所总结的,生成式 AI 正从「一句话生成一段成品」走向持续运行、可交互的环境——这也正是未来 Agent 工作、训练和生活的底层空间。实时渲染画面与声音的世界,是回合制生成永远给不了的环境层。游戏、互动影视、教育是最直接的受益者,Agent 仿真与合成数据是更隐蔽的第二批。
现在能做什么
HelixWorld 的权重和代码将在接下来几周完全开源(github.com/NoizAI/HelixWorld),团队(开源项目累计超 5 万 GitHub Stars,代表作 Mockingbird、AudioX)历史上说到做到。三件事值得现在做:盯着开源发布,用因果流水线对照自己的延迟预算做基准测试;马上开始积累「音频优先」的世界数据——本文描述的清洗管线才是稀缺资产;把音画同步质量(FAD、Desync、声像方位)写进评估与招聘标准——它将是「感觉真实」与「看起来真实」的世界模型之间的分水岭。声音是最后补上的感官,也是最难伪造的。