7月31日,MiniMax 发布新一代多模态生成模型 MiniMax H3,并宣布将于8月3日开源模型权重。这则消息里藏着三重信号:在 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力排名全球第一;2K 分辨率视频生成定价 0.8元/秒,不到主流旗舰模型的三分之一;且它是 MiniMax 首个开源的多模态生成模型,设计初期就考虑了多款国产芯片的兼容适配。
三重信号指向同一个方向:视频生成正在从「能出片」走向「能商用」,而 MiniMax 选择的路径,是彻底重构生成模型的数据、压缩、架构与输出四层。
破题:为什么 H3 值得拆开看
过去两年,视频生成模型的进步方式是高度一致的:把某一类效果做好,封装成一个功能,接到产品上。于是用户看到一份不断变长的能力清单——文生视频、图生视频、主体参考、动作参考、视频编辑各占一个入口,模型侧则对应着不同的专家模型或一长串 condition 分支。
MiniMax 把这称为「任务、能力、模态的隔离」。一个只在图生视频数据上训练的分支,学不到动作参考数据里的东西;数据被切碎在十几个任务里,泛化能力就无从谈起。H3 的做法是回到预训练阶段,把这些任务统一建模,用自然语言描述任务关系——而不是为每个任务训练一个专家。
这本质上是在回答一个问题:生成模型的复杂度应该堆在结构里,还是堆在语言里?
拆解:四层技术栈,对应生成模型的四个环节
任何生成模型都可以粗暴地拆成四层:数据怎么被描述、信息怎么被压缩、算力怎么被组织、结果怎么被输出。H3 的四个新工作恰好一一对应。
1. 数据描述层:Contextual Omni Representation
这是 MiniMax 自称投入最大的部分。多模态上下文的引入让 Caption 被彻底泛化——不仅要描述目标视频,还要描述上下文素材之间、上下文与目标之间的关系,甚至联合描述视频和音频在多镜头下的对应关系。定制化的全模态理解管线中,大部分素材要消耗约 100K Token 的推理,最终压缩为约 4K Token 的表示。
关键洞察:语言在其中充当可泛化的连接桥。过去每多一个任务就多一套 condition 格式,结构里的复杂性不能泛化;而语言里的复杂性可以——同一套表述能力,能描述训练中从未出现过的组合。
2. 压缩层:H3-VAE
H3 彻底重写了前代 tokenizer,在重建质量和易学性上全面升级,拿到了 4 倍序列长度压缩。这直接摊薄了训练和推理成本,也是 H3 敢默认提供原生 2K 分辨率的底气——2K 每秒价格不到主流模型的 1/3,768P 则是主流 720P 的一半。
3. 算力组织层:H3-Omni Transformer
多模态上下文的引入让序列长度方差比前代大了 3 倍,理解与生成的计算负载显著异质化。MiniMax 采用理解与生成异构的训练架构,精细调优不同 workload 下的硬件利用率,端到端训练吞吐提升近 30%。
更有意味的是主动放弃:团队抛弃了曾带来显著架构优势的 Hailuo-02 架构,理由是它在「任务泛化」的核心目标下引入了额外复杂性。用 MiniMax 自己的话说:「架构技巧应为模型定义让路。」——这与语言模型界反复上演的剧情是同一条逻辑:聪明的技巧总能在特定任务上取胜,而简洁的结构才可能在没见过的任务上成功。
4. 输出层:In-context Regeneration
H3 的 2K 输出没有使用常规的专用超分模块,而是让基模对自己的低分辨率结果做 in-context 重新生成。好处有二:最大限度复用基模已有的生成能力;再次利用原始多模态上下文信息进行高分辨率输出,还原传统超分方案靠「猜」无法恢复的细节——比如小文字和精细纹理。
建框架:视频生成正在复制大语言模型的演进路径
把 H3 放进更长的时间轴看,它像极了 GPT 系列当年走过的路:从多专家、多分支的特化系统,收敛为单一、通用、以语言为接口的基础模型。H3 支持文本、图片、音频、视频任意组合输入,输出带原生双声道的音视频,最长 15 秒;参考生成模式下可组合最多 9 张图、3 段视频、3 段音频共 12 个媒体文件,用一句自然语言描述它们之间的关系即可——「参考视频1的希区柯克运镜,让图2中的人物唱歌,歌声参考音频3」。
在商业能力上,H3 强调指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)——这些正是广告、品牌、电商、UI/UX、游戏等真实生产场景最需要的「可编辑性」,而不是单纯的「画面惊艳」。业内已有人将之称为视频生成领域的「Coding 时刻」:从演示品变成面向真实场景交付的生产工具。
推演:三个变量正在改变行业格局
其一,价格战把视频生成拖入商用区间。 0.8元/秒的 2K 定价,叠加高压缩 tokenizer 带来的成本结构优势,让广告、电商等对成本敏感的行业第一次可以认真核算 AI 视频的生产账。MiniMax 港股股价单日一度大涨超 14%,资本市场给出了初步背书。
其二,开源+国产芯片适配,复制 LLM 的生态路径。 闭源模型长期主导视频生成,迭代速度和生态开放性落后于大语言模型。H3 设计初期就考虑多款国产芯片兼容,8月3日权重开源后,企业可本地部署、结合自有数据定制,芯片厂商和开发者也能参与适配优化。视频生成的开源生态,可能就此被真正点燃。
其三,「任务泛化」取代「参数内卷」成为竞争主轴。 当同行还在比拼参数规模与单点效果榜单时,MiniMax 用「一个模型解决所有模态任务」+「极致性价比」的组合拳,走出了差异化路径。字节 Seedance 2.5 同期发布支持 30 秒长镜头直出,双方在能力与价格两个维度同时交火——多模态生成赛道的竞争,已从秀肌肉转向拼工程与拼成本。
落到行动:接下来 72 小时可以做什么
- 开发者:8月3日 0 点(北京时间)权重开源后,到魔搭社区拉取模型,重点测试 V2V Motion Transfer 与多模态参考生成的可控性;技术报告尚未公开,架构细节建议以实测为准。
- 创作者/品牌方:用参考生成模式把现有素材(产品图+口播音频+参考镜头)直接组合成片,核算单条视频成本,对比外包与旧方案。
- 企业:关注本地部署与国产芯片适配进度,评估自建视频生成能力的合规与成本账——这可能是今年视频生成落地最值得跟踪的一个开源节点。
- 观察者:留意 H3 开源后社区二创与第三方榜单复测,验证「视频编辑全球第一」在真实工作流中的成色。
「架构技巧应为模型定义让路」——这句话值得所有做 AI 产品的人抄下来。模型的边界,最终由定义它的人决定。
