MiniMax H3 发布:多模态生成模型的"统一时刻",视频编辑全球第一

7月31日,MiniMax 发布了新一代多模态生成模型 H3。同一天,字节跳动旗下的即梦也发布了 Seedance 2.5。两家中国 AI 公司在视频生成赛道正面交锋。

但 H3 真正值得关注的,不是它又卷出了一个新 SOTA,而是它做了一件不同的事:不再把图片、视频、音频当作独立任务来处理,而是用一个模型统一理解所有模态的创作意图

破题:视频后期正在被"手绘即特效"改写

MiniMax 官方展示了一个 demo:输入一段希区柯克式运镜的视频、一张人物照片、一段音频,然后写一句话——"参考 Video 1 的运镜,让 Image 2 中的人物唱歌,人声匹配 Audio 3"。H3 直接输出了完整的音视频。

这不是 TTS + 抠图 + 合成的工作流。这是在统一的模态理解中,一次推理完成所有任务

对于视频创作者来说,这意味着什么?过去需要 AE 特效师花几小时做的合成镜头,现在用一句话描述就能生成初版。这不是取代创作者,而是把"后期"这个环节从技术活变成了创意活——就像 Copilot 把写代码从语法活变成了逻辑活。

拆解:H3 做了四件技术上的"反常识"事

H3 的技术报告里,有四个关键设计值得单独拿出来看:

1. Contextual Omni Representation:用语言桥接模态

传统做法是给每个任务(T2I、I2V、视频编辑)训练独立的专家模型。H3 的做法是:把所有输入素材(图片、视频、音频)用语言描述它们与目标输出的关系,然后让模型统一理解。

这意味着——大部分素材需要消耗约 100K Token 的推理来理解,但最终蒸馏成平均约 4K 的描述性 Token。语言成为了"模态翻译器"。

2. H3-VAE:4 倍有效序列长度,原生 2K 的关键

H3 的 VAE 实现了高压缩比,有效序列长度提升了 4 倍。这直接降低了训练和推理成本,也让原生 2K 输出变得经济可行。这是 H3 能在 2K 定价仅为竞品 1/3 的核心原因

3. H3-Omni Transformer:理解与生成分开训练

MiniMax 直接弃用了 Hailuo-02 架构,因为多模态上下文的序列长度变化比纯文本/视频大得多。H3 把理解(understanding)和生成(generation)两个工作负载分开,各自优化硬件利用率。端到端训练吞吐量提升近 30%。

4. In-Context Regeneration:放弃超分,让模型自己重绘

大多数视频生成模型用超分模块(Super-Resolution)把低分辨率结果拉高。H3 的做法是:让基础模型在原始多模态上下文中重新生成自己的低分辨率结果。这恢复了传统超分靠"猜"无法还原的细节——比如品牌 Logo 上的小字。

这对商业场景(广告、电商)至关重要。一个连品牌名都写不对的视频生成模型,在商业客户那里是没法用的。

建框架:从"特化任务模型"到"通用多模态智能"

H3 的发布,标志着 AI 视频生成赛道的一个关键拐点:架构效率正在取代参数规模,成为新的竞争维度

回顾这个领域的发展路径:

  • 第一阶段(2022-2024):单任务模型百花齐放,T2I、T2V、I2V 各有一个专家模型,各有各的优劣势
  • 第二阶段(2024-2025):多模态理解开始融合,但生成仍然是分任务的
  • 第三阶段(2026-):统一模态理解 + 统一生成,一个模型完成所有任务

H3 属于第三阶段的开端。它不是第一个走这条路线的(Google Gemini Omni 也是这个方向),但它是第一个承诺开源的同类模型。如果 H3 的权重如约放出,它将成为开源视频模型的绝对王者——大幅领先此前的开源第一 LTX-2.3。

独立评测机构 Artificial Analysis 的排名也印证了这一点:

  • 视频编辑(带音频):Elo 1130,全球第一,领先 Gemini Omni Flash(1121)
  • 文生视频(带音频):Elo 1242,全球第二,仅落后 Gemini Omni Flash 3 分(置信区间重叠,实际水平相当)
  • 图生视频:全球第三

MiniMax 的定价策略也很激进:2K 分辨率 $0.13/秒(约 $7.80/分钟),768p 更便宜。对比来看,Seedance 2.0 为 $22.45/分钟(1080p),Kling 3.0 为 $20.16/分钟(1080p)。H3 的价格不到竞品的三分之一。

推演:谁会被影响?

对视频编辑工具:传统视频后期软件(Premiere、Final Cut、达芬奇)的 AI 功能必须加速。当用户能在 H3 上"一句话完成特效合成",传统软件"手动逐帧操作"的价值会被持续压缩。

对 AI 视频生成赛道:H3 和 Seedance 2.5 同一天发布,竞争格局已经白热化。H3 在视频编辑和价格上领先,Seedance 2.5 在单次生成长度(30秒 vs 15秒)和参考输入数量(50个 vs 15个)上占优。这不只是模型比拼,更是生态竞争——谁能先跑通商业闭环,谁就能拿到下一轮数据飞轮。

对开源社区:H3 采用 MiniMax Community License,允许年营收低于 2000 万美元的组织商用(需显著署名)。这意味着中小开发者和初创公司可以基于 H3 构建自己的视频产品。如果 H3 开源后社区生态活跃起来,字节跳动和快手等闭源模式将面临真正的压力。

落到行动

如果你是开发者:H3 的 API 已经开放,模型 ID 是 MiniMax-H3,通过 platform.minimax.io 接入。支持文本/图片/视频/音频混合输入,最多 9 张参考图、3 段参考视频、3 段参考音频。适合做广告素材生成、电商产品视频、UI 动效 demo 等场景。权重未来几天开放,关注 Hugging Face 上的 MiniMax 官方仓库。

如果你是创作者:Hailuo AI App 已经上线 H3 能力,可以试用"手绘即特效"功能。在写 prompt 时,可以尝试多模态组合输入(比如"参考这个视频的运镜+这个图片的人物+这个音频的风格"),这是 H3 最强的能力所在。

如果你是产品经理:关注 H3 在垂直场景的落地效果。视频编辑 Elo 第一意味着它在"修改和迭代"场景(如广告 A/B 测试、品牌物料批量生成)有显著优势。这是差异化切入的机会。

---

MiniMax H3 不是"又一个视频模型"。它代表了一种新的范式:统一模态理解 + 统一生成 + 开源 + 激进定价。当这四个要素组合在一起,AI 视频生成行业可能正在进入一个"ChatGPT 时刻"——不是因为它突然变得多好,而是因为它突然变得又好又便宜又可定制。

对于开发者来说,真正的机会不在"用 H3 生成视频",而在"在 H3 之上构建新的创作工具"。当视频编辑的边际成本降到接近零,创作工具的形态本身会被重新定义。

滚动至顶部