介绍
Make-A-Video 是 Meta AI 推出的文本生成视频(文生视频)研究工具,用于将一段文字描述直接转化为对应的短视频。它在近年文本生成图像技术的基础上扩展而成,利用"图片+描述"的图文对学习世界的外观与常见描述方式,再借助无标注视频学习世界如何运动,因此无需采集"文字-视频"配对数据即可完成训练。该项目以研究形式发布,官网附有完整研究论文可供查阅。
适合研究者做技术调研,例如在动手搭建文生视频模型之前,先阅读 Make-A-Video 论文,借鉴其"图文对学外观、无标注视频学运动"的训练框架,评估数据成本与技术路线。
适合创意工作者快速打样,例如短视频创作者输入"戴贝雷帽的小狗在滑板上穿行"这类描述,先得到动态画面雏形,再判断某个脑洞是否值得投入实拍与后期。
适合教学与科普演示,例如讲解生成式 AI 演进时,用"从文生图到文生视频"的路径展示模型如何从静态画面走向动态世界,说明零样本视频生成的难点。
Make-A-Video 是 Meta AI 推出的文本生成视频(文生视频)研究工具,用于将一段文字描述直接转化为对应的短视频。它在近年文本生成图像技术的基础上扩展而成,利用"图片+描述"的图文对学习世界的外观与常见描述方式,再借助无标注视频学习世界如何运动,因此无需采集"文字-视频"配对数据即可完成训练。该项目以研究形式发布,官网附有完整研究论文可供查阅。