Sand.ai Magi-1 — 全球首个开源自回归视频生成大模型

简介
Sand.ai 是一家专注于 AI 视频生成的前沿技术公司,其旗舰模型 Magi-1 是世界上首个大规模自回归视频生成模型(Autoregressive Video Generation Model)。与扩散模型不同,Magi-1 通过自回归方式逐块预测视频帧序列,实现了高时间一致性、长视频生成和流式实时部署。
Magi-1 最大变体拥有 240 亿参数,支持高达 400 万 token 的上下文长度,在图像转视频(I2V)任务上表现优异。项目已完全开源,Hugging Face 和 GitHub 均可获取模型权重与推理代码。
核心技术
- 自回归视频生成范式:Magi-1 将视频定义为固定长度的连续帧块(chunk),通过自回归方式逐块预测,支持 causal 时序建模和流式生成。
- Chunk-wise Prompt 可控生成:支持逐块提示词控制,可实现平滑场景过渡、长时合成和精细的文本驱动控制。
- MagiAttention 高效注意力:配套的 MagiAttention 机制大幅降低长视频生成的内存开销,使 4M token 上下文成为可能。
- 开源可商用:Sand.ai 将 Magi-1 完全开源,开发者可在 GitHub 和 Hugging Face 免费获取。
适用场景
- 影视制作:利用 Magi-1 的视频扩展能力进行场景过渡和长视频合成。
- 独立创作者:无需专业设备即可生成高质量视频内容。
- AI 研究:作为自回归视频生成的基础模型进行二次研究与微调。
常见问题
Q:Magi-1 与 Sora 等扩散模型有何不同?
A:Magi-1 采用自回归范式而非扩散范式,支持逐块流式生成和更长的上下文,且完全开源。
Q:支持多长时间的生成?
A:Magi-1 支持无限视频扩展能力,通过逐块提示可实现任意长度视频的连贯生成。
Q:是否开源?
A:是的,模型权重、推理代码和 MagiAttention 均在 GitHub 和 Hugging Face 上开源。





