全球首个千亿参数 MoE 视频生成模型开源:Sand.ai MAGI-2-preview,114B 参数、6B 激活,10秒1080P只需5毛钱

一、视频生成遇上"不可能三角"

做大模型,最怕的事情就是钱不够烧。

文本模型还好,处理的是离散 token,叠参数、加算力,模型就能越滚越强。但视频模型面对的是一整个动态世界——每一帧画面被拆成大量空间 patch,连续帧还要记录人物动作、物体关系和镜头变化。如果再叠加文本、音频等信息,序列长度直接「超级加倍」。

这就引出了视频生成领域的核心矛盾:模型要更大、视频要更长、成本还要可承受——这三件事几乎构成了一个「不可能三角」。

如果还用稠密模型,Scaling 的训推成本可想而知。但放弃 Scaling 又意味着效果天花板。出路在哪里?

答案其实不新鲜——MoE(混合专家模型)。但把 MoE 从语言模型搬到视频生成,远比想象中困难得多。

就在今天,清华系团队 Sand.ai 交出了一份令人瞩目的答卷:MAGI-2-preview——全球首个千亿参数 MoE 视频生成模型,代码权重全部开源。

二、为什么视频 MoE 比 LLM MoE 难得多?

MoE 的核心思路很简单:模型可以拥有百亿千亿的总容量,但每次推理只激活其中一小部分,成本可控。

这套思路在 LLM 领域已经被 DeepSeek 等团队验证得相当成熟。但迁移到视频领域时,三道坎横在面前:

第一道坎:通信瓶颈。传统专家并行会先为 token 选出 Top-K 专家,再把 token 送到专家所在的 GPU。激活专家越多,需要跨卡传输的数据就越多。对于本就拥有超长序列的视频模型,通信成本很快就会盖过专家计算本身。

第二道坎:训练稳定性。动态变化的路由、随时波动的专家负载,加上多模态数据(文本、视频、音频)的异构特性,让大模型 Scaling 过程中常见的问题在视频 MoE 上成倍放大。

第三道坎:架构鸿沟。LLM 处理的序列长度是千级 token,视频模型处理的序列长度是百万级 token。简单迁移 LLM 的 MoE 架构,根本无法应对超长序列下的跨卡通信和多模态对齐。

这也是为什么行业里少有团队走这条路。Sand.ai 是第一个真正把千亿 MoE 视频模型从理论搬到现实的团队。

三、MAGI-2-preview 的解题思路

MAGI-2-preview 交出的答卷,是一套从架构到系统、从通信到数据的端到端解决方案。

3.1 单流架构:音画从第一层开始共舞

MAGI-2-preview 延续了 Sand.ai 在 daVinci-MagiHuman 中验证过的单流架构——文本、视频和音频进入同一个 Transformer,在每一层自注意力里直接交换信息。

传统做法是视频走视频的通道,音频走音频的通道,最后靠 cross-attention 把两边粘起来。而 MAGI-2-preview 从第一层开始,画面和声音就在共同建模。这种设计使得音画对应关系更精细,统一主干也让延迟和维护成本远低于模型串联方案,天然适配 MoE 扩展。

3.2 极致细粒度的专家路由

MAGI-2-preview 的技术亮点在于 Multi-Head LatentMoE

它将 3072 维的隐藏表示拆成 12 个 256 维 head,每个 head 独立路由。同一个 token 被拆进多个低维子空间,有的 head 关注人物外观,有的处理动作和时序,各司其职。

在 36 层主体网络里,每层总共 3072 个独立专家单元,每个 token 在每个 head 内选择 6 个专家,合计激活 72 个小专家。

作为参照,DeepSeek-V4-Pro 等主流 MoE 大模型的每层专家数大多还停留在几百个。MAGI-2-preview 直接推到了三千级别。

专家数量增加、但每个专家处理的子空间尺寸更小、分工更细——模型由此能够拼凑出更多能力组合。

3.3 自研 Infra:让三千专家跑起来

这么细粒度的专家,单靠通用 MoE 框架是实现不了的。Sand.ai 为此自研了全套基础设施:

  • MagiMoE kernel 库:把路由、排序、专家计算整条链路压在一起,减少中间结果的显存搬运,针对 Multi-Head MoE 的前向和反向过程都做了专门优化。
  • Head Parallel 策略:在路由发生之前就按 head 把计算分配到不同设备。设备间传输的是形状固定的 head 表示,而不是路由后数量不断变化的专家 token。通信量不随激活专家数波动,视频长序列不再是瓶颈。
  • 混合优化器:矩阵参数用 Muon,专家参数用 AdamW,不同性质的参数用不同的更新节奏。

3.4 数据策略:从"删减"转向"组织"

很多团队做数据是层层过滤,最后留一个干净但窄的数据集。但生成模型需要的是多样性——见得越多,生成才能越逼真。

MAGI-2-preview 的思路是:先扩大有效数据规模,尽量保留广度,再通过精准标注把数据组织起来。预训练负责全覆盖,后训练负责偏好对齐、可控性和安全性。

四、这个千亿参数开源意味着什么?

MAGI-2-preview 总参数 114B,单次前向只激活约 6B。按 8 卡 H100 行情算,生成一段 10 秒 1080P 视频,成本仅需 5 毛钱——差不多是行业主流模型的十分之一。

Benchmark 方面,MAGI-2-preview 在 AA 视频生成榜单排名第六。仅用 6B 激活参数,效果就非常接近第一梯队。

但真正的震波不在榜单上,而在开源生态里。

对研究者而言,这是第一次能够真正解剖千亿级视频 MoE——专家如何分工、路由是否稳定、通信怎样组织、Scaling 规律能否复现。这些问题终于有了公开研究对象,不必隔着论文空想。

对企业而言,开源意味着多了一个私有化部署和行业微调的选项。金融、医疗、工业等数据敏感行业,数据能否留在本地、模型能否针对业务继续训练,重要性并不亚于一次生成效果。

对行业格局而言,开闭源的竞争维度将被重新定义。以前是单纯效果比拼,往后模型能否继续训练、接口是否被单一平台控制,都将成为对比指标。一旦开源模型在效果上持续逼近闭源,视频生成大概率会走上语言模型的老路——闭源靠产品体验,开源靠部署控制。

五、回到那个"不可能三角"

MAGI-2-preview 的答案是:通过架构创新,重新定义三角形的边界

MoE 不是新概念,但把 MoE 做到千亿级、做到视频领域、做到全开源,这三件事捏在一起,此前没有人做成过。

Sand.ai 创始人曹越是 Swin Transformer 共同一作、清华特等奖学金获得者,团队被李开复称为"AI 视频生成界的 DeepSeek"。从自回归视频生成,到音画同出,再到千亿 MoE 开源,这支团队选的路总是人迹罕至。

当然,MAGI-2-preview 还不是视频生成的最终答案,还需要等待正式版继续交卷。正如团队自己所说:这里的 6B 激活参数并不等于一款 6B 稠密模型的实际成本,专家通信、路由、显存和部署方式仍会产生额外开销。

但有一点已经做实了——千亿级 MoE,不只属于语言模型。

开源地址:https://github.com/SandAI-org/MAGI-2-preview

滚动至顶部