8 月 5 日,清华系团队 Sand.ai 发布并开源了 MAGI-2 Preview——全球首个开源千亿级 MoE 视频生成模型。总参数 114B,单次前向只激活约 6B;在 8 卡 H100 上生成一段 10 秒 1080P 视频,成本约 5 毛钱,只有行业主流模型的十分之一。在 Artificial Analysis 视频生成榜单上,它凭借 6B 激活参数排到第六,超越了一批激活参数超百亿的闭源模型。
这不止是一次开源发布。它背后是一个更硬的问题:视频模型的 Scaling 路线,为什么一直走不通?
一、视频模型为什么「做不大」
过去两年,开源视频生成模型的参数规模大多停在十几 B 以内,最大的也不过二三十 B。而语言模型那边,开源模型早就靠 MoE 冲进了几千亿甚至万亿参数。
两类模型任务不同,参数规模不能直接代表能力,但这组差距仍然说明问题:视频模型规模化,要付出远比 LLM 更高的代价。
- 序列太长。一段视频被拆成大量空间 patch 和连续帧,再加入音频与文本,序列长度和信息量指数级增长;
- 通信太贵。MoE 的路由结果动态变化,激活专家数量时刻波动,跨卡通信量随之抖动,视频的长序列在这里成为致命瓶颈;
- 训练太脆。动态路由、专家负载波动、多模态数据叠加,让 LLM Scaling 中的常见问题在视频 MoE 上成倍放大。
结论很直接:视频模型的 Scaling 不能照抄 LLM,单纯迁移 MoE 不管用,得从底层开始重构。把视频 MoE 从纸上谈兵推到千亿参数、还跑得起来的,Sand.ai 是第一个。
二、拆解:MAGI-2 Preview 的三层创新
MAGI-2 Preview 的工程报告《MAGI-2 Preview: Scaling Video Generation Models Efficiently》把答案拆成了三层:架构、效率、系统。
架构层:统一音视频单流,音画同步成为原生能力
传统多流方案里,视频走视频的主干,音频走音频的主干,最后靠 cross-attention 或后处理把两边粘起来——链路越长,延迟和误差累积越多,这也是「声画不同步」的根源。
MAGI-2 Preview 延续 Sand.ai 在 daVinci-MagiHuman 论文中验证过的单流架构:文本、视频、音频进入同一个 Transformer,在每一层 self-attention 中直接交换信息,画面与声音由同一套主干共同生成。模型内部既有三种模态共享的专家,也有各自的专属专家:共享专家捕捉模态共性,专属专家处理语言、画面、声音独有的信息。
效果是结构性的:人物说话时,口型、表情、身体动作是生成出来的;撞击声出现时,画面里的物体在同一时间作出反应;音乐节奏变化,人物表演和镜头推进随之调整。这些细小的同步关系,从「工程补丁」变成了「模型原生能力」。
效率层:超细粒度 MoE,3072 个专家怎么协同
MAGI-2 Preview 把 3072 维特征表示拆成 12 个 256 维子空间,每个子空间独立选择 6 个专家,单个视频 token 动态组合激活 72 个专家。每层总专家数达到 3072 个——作为参照,DeepSeek 等主流 MoE 大模型每层专家大多停留在几百个。
专家更细、分工更细,模型能拼凑出的能力组合就更多。但代价是调度压力:专家一旦增加到数千个,传统路由方式很快触及效率上限。
系统层:Head Parallel,把通信从「波动」变成「恒定」
这是整篇报告里最值得玩味的一步。传统 Expert Parallel 是「先路由、再通信」:每个 token 选好专家后,再按路由结果把 token 搬去对应设备,通信量随激活专家数波动。
Head Parallel 把顺序倒过来:先按 head 分发 token 表示,再由设备在本地完成专家选择和计算。因为分发的数据形状固定,主要通信量只取决于输入表示,不再随激活专家数量线性增长——视频长序列最要命的瓶颈,就这样被绕开了。
配合自研的 MagiMoE kernel 算子库(路由、排序、专家计算整条链路压在一起,减少中间结果显存搬运)和 MagiMuon 优化器,训练效率提升约 300%。在数据侧,团队放弃了简单过滤策略,建立了覆盖 2000 小时专业视频、200 余类标注(运动轨迹、声音特征、镜头语言)的细粒度标注体系,确保 3072 个专家真正形成差异化能力。
三、建框架:LLM 的 MoE 剧本,在视频上重演
把 MAGI-2 Preview 放进坐标系里看,它同时踩中了三个结构性位置:
第一,这是「千亿 MoE 不只属于语言模型」的宣言。语言模型 2024 年起靠 MoE 突破参数墙,视频模型卡在十几 B——不是不想大,是通信和序列代价扛不住。MAGI-2 用「细粒度专家 + 通信重排」把这堵墙拆了,首次把千亿参数、MoE、开放权重三件事捏在一起。
第二,它和 MiniMax H3 是同一波浪潮的两面。如果 H3 是从闭源市场侧打出的「几分钱时代」信号弹,MAGI-2 就是从开源技术侧递出的宣言——一个打价格,一个打架构,指向同一个方向:视频生成正在进入「工业化成本区间」,单分钟生成成本从千元级降到十元级。
第三,这是一条「非共识路线」的再次验证。创始人曹越是清华大学特等奖学金获得者、Swin Transformer 共同一作,曾联合创办光年之外、在智源研究院负责多模态与视觉研究。李开复曾公开称 Sand.ai 为「AI 视频生成界的 DeepSeek」。从自回归视频生成(MAGI-1,2025 年 4 月开源,24B)到音画同出,再到千亿 MoE 开源——团队选择的道路总是人迹罕至,和 DeepSeek 在语言模型上的打法同构:不追热点,押注底层架构的非共识,再用系统级工程把非共识变成现实。
四、推演:三个正在发生的结构变化
1. 内容生产工作流会被重写。当单次生成成本低到可以忽略,「精修单条」的模式开始让位于「多版本生成 + 自动筛选」:同样的预算测试更多提示词和生成版本,从中筛选可用镜头。广告、短剧、动画、游戏资产生成、虚拟人互动这些高频调用场景,第一次有了经济上成立的自动化空间。
2. 开闭源的竞争维度被重新定义。以前视频生成的开闭源比拼是单纯效果:谁画质好、谁更便宜。一旦开源模型在效果上持续逼近闭源,视频生成大概率会走上语言模型的老路——闭源靠产品体验和服务稳定性,开源靠部署、控制和开发者生态。评估指标也会从「画质/价格」扩展到「模型能否继续训练、接口是否被单一平台控制」。
3. 视频 infra 栈开始分层。千亿级视频 MoE 的通信模式(Head Parallel)对推理集群设计提出了新要求,超细粒度专家对 kernel 库、路由算法都是新考题。视频生成的「基础设施层」正在从模型公司内部走向公共技术栈——这对算力调度、推理框架、开源生态都是新增量。
当然,边界也要说清楚:MAGI-2 Preview 仍是 preview——目前只支持 10 秒时长,采用 preview 低分辨率去噪 + refiner 升 1080p 的两阶段生成,且依赖 Qwen3.5-27B 文本编码器、Wan2.2 VAE、stable-audio-open-1.0 音频 VAE 等开源组件拼装。AA 榜单第六说明它「非常接近第一梯队」,但尚未登顶。正式版和社区验证,才是这条路线真正的交卷时刻。
五、行动:三类人现在该做什么
- 内容创作者与工作室:开始搭建「多版本生成 + 自动筛选」流水线;单分钟成本降到十元级后,把 AI 生成纳入分镜预演(pre-visualization)环节,用低成本试错替代昂贵实拍。
- 开发者:去读论文《MAGI-2 Preview: Scaling Video Generation Models Efficiently》,Head Parallel 的「通信重排」思路对长序列 MoE 推理有普适参考价值;关注 MagiMoE/MagiMuon 是否会随正式版进一步开放。
- 技术决策者:把「单条生成成本」和「音画同步质量」纳入视频模型选型指标;对数据敏感的行业(广告、游戏、虚拟人),开源权重 + 本地部署是值得认真评估的选项。
下一个值得观察的信号:正式版发布、更长时长的支持、主流推理框架(vLLM 等)的适配,以及社区衍生微调模型的数量。千亿级 MoE 视频模型的接力棒,已经从 Sand.ai 交到了开源社区手里。
