Make-A-Video

Make-A-Video

3.0

先进AI系统可根据文本提示生成高质量视频。

最后更新 2026 年 9 月 29 日
Make-A-Video 截图

主要功能

文本转视频:输入一段英文文字描述,即可生成与描述对应的短视频片段,全过程无需提供任何示例视频作为输入。
文生图能力延伸:以文本生成图像扩散模型为基座,把静态画面的生成能力扩展为带运动信息的视频生成。
无监督运动学习:依靠未标注视频数据学习物体的运动规律,不依赖人工逐帧标注或"视频-文本"配对数据集。
研究资料公开:发布官方研究论文,公开模型设计与训练方法,供研究社区查阅与复现。

适用人群

适合研究者做技术调研,例如在动手搭建文生视频模型之前,先阅读 Make-A-Video 论文,借鉴其"图文对学外观、无标注视频学运动"的训练框架,评估数据成本与技术路线。

适合创意工作者快速打样,例如短视频创作者输入"戴贝雷帽的小狗在滑板上穿行"这类描述,先得到动态画面雏形,再判断某个脑洞是否值得投入实拍与后期。

适合教学与科普演示,例如讲解生成式 AI 演进时,用"从文生图到文生视频"的路径展示模型如何从静态画面走向动态世界,说明零样本视频生成的难点。

更多介绍

介绍

Make-A-Video 是 Meta AI 推出的文本生成视频(文生视频)研究工具,用于将一段文字描述直接转化为对应的短视频。它在近年文本生成图像技术的基础上扩展而成,利用"图片+描述"的图文对学习世界的外观与常见描述方式,再借助无标注视频学习世界如何运动,因此无需采集"文字-视频"配对数据即可完成训练。该项目以研究形式发布,官网附有完整研究论文可供查阅。