Pixelle-Video:13.6K Stars 的开源 AI 短视频引擎,3 分钟自动生成一条视频

概述

在 AI 视频生成领域,多数工具要么只做图像生成(如 Stable Diffusion),要么只做视频生成(如 WAN),要么只做语音合成。Pixelle-Video 的不同之处在于:它将整个视频生产链路整合为一个端到端的全自动流水线——输入一个主题,3 分钟生成一条包含文案、配图、配音、背景音乐和字幕的完整短视频。

这是一个由国内开发团队 AIDC-AI 打造的开源项目,目前已在 GitHub 上获得超过 13,600 Stars,是完全免费的开源方案(Apache-2.0 许可证)。

项目地址:https://github.com/AIDC-AI/Pixelle-Video
官方文档:https://aidc-ai.github.io/Pixelle-Video/zh/

一句话定位

Pixelle-Video = 全自动短视频引擎。输入主题,输出成品视频。

它的目标是让视频创作成为一句话的事——不需要剪辑经验,不需要写脚本,不需要学复杂的工具操作。

核心能力

全自动视频生成流水线

用户只需要输入一个主题(例如"为什么要养成阅读习惯"),Pixelle-Video 就会自动完成以下全部步骤:

  1. ✍️ AI 撰写文案 — 根据主题自动生成分镜脚本和解说词
  2. 🎨 AI 生成配图 — 每个分镜自动生成匹配的插图
  3. 🗣️ AI 语音合成 — 将解说词转为自然语音
  4. 🎵 添加背景音乐 — 支持自动配 BGM
  5. 🎬 一键合成视频 — 将所有素材合成为最终视频

组件能力矩阵

环节可选方案说明
LLM(文案)GPT / 通义千问 / DeepSeek / Ollama智能生成解说词,支持多种模型切换
配图生成ComfyUI(FLUX / Qwen 等)/ RunningHub每句话自动配一张匹配插图
视频生成WAN 2.1 / WAN 2.2 / Nano BananaAI 生成动态视频内容作为背景
语音合成Edge-TTS / Index-TTS / ChatTTS / 声音克隆多语言、多音色,支持参考音频克隆
视频合成内置 FFmpeg 管线图文混合、背景叠加、字幕生成

架构设计:一切能力都是 ComfyUI 工作流

Pixelle-Video 最核心的设计理念是:所有 AI 能力都通过 ComfyUI 工作流 JSON 文件来定义。这意味着管线与具体模型是真正解耦的——当你想把图像生成从 FLUX 切换到 Qwen,你改的不是代码,而是指向另一个 workflow JSON 文件。

整体分层架构如下:

  1. 应用层 — Pixelle-Video Web UI(Streamlit),用户交互界面
  2. 编排层 — 视频生成管线,负责文案→配图→语音→合成的流程编排
  3. 能力层 — ComfyUI 工作流 JSON 文件,定义具体模型和参数
  4. 执行层 — ComfyUI(本地或远程),运行工作流生成图像和视频

这种架构带来了极大的灵活性:如果你有更好的图像生成模型,不需要改 Pixelle-Video 一行代码,只需添加一个新的 workflow JSON 文件即可。

功能亮点

  • 全自动生成 — 输入主题,3 分钟出成品视频,无需手动剪辑
  • AI 智能文案 — 自动生成解说词和分镜脚本,支持多种 LLM
  • 灵活的视频尺寸 — 支持竖屏(1080×1920)、横屏(1920×1080)等
  • 多种视觉风格 — 内置多个模板,可快速切换风格
  • 自定义素材 — 支持用户上传自己的照片和视频,AI 自动识别内容并生成描述
  • 原子能力灵活组合 — 基于 ComfyUI 架构,可使用预置工作流或自定义
  • API 支持 — 对外提供 REST API,可集成到其他系统

安装方式

Windows 用户(推荐整合包)

GitHub Releases 下载最新 Windows 整合包,解压后双击 start.bat 即可使用。无需安装 Python、FFmpeg 或任何依赖。

macOS / Linux 用户(源码安装)

git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video

# 推荐使用 uv(更快的包管理器)
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync

# 启动 Web 界面
uv run streamlit run web/app.py

浏览器打开 http://localhost:8501 即可使用。

如果选择本地部署 ComfyUI 作为图像生成后端,还需要额外安装 ComfyUI 并下载相应模型文件。

快速生成第一个视频

启动 Web 界面后,工作流程非常简单:

  1. 在"⚙️ 系统配置"中配置 LLM API Key(通义千问、DeepSeek、GPT 任选一个)和图像服务地址
  2. 在"📝 内容输入"中输入一个主题,例如"健康饮食的重要性"
  3. 设置场景数量(默认 5 个分镜)
  4. 选择 TTS 和图像生成工作流
  5. 点击"🎬 生成视频"按钮

系统会实时显示进度:生成文案 → 生成配图(每个分镜) → 合成语音 → 合成视频。整个过程大约 2-5 分钟。

费用说明

Pixelle-Video 提供多级费用方案,丰俭由人:

  • 完全免费:LLM 使用 Ollama(本地运行)+ ComfyUI 本地部署 = 0 元。适合有 NVIDIA 显卡(6GB+ 显存)的用户。
  • 推荐方案:LLM 使用通义千问(3 段视频约 0.01-0.05 元)+ ComfyUI 本地部署。性价比极高。
  • 云端方案:LLM 使用 OpenAI API + 图像使用 RunningHub 云端服务。费用较高但无需本地显卡。

与其他项目的对比

Pixelle-Video 并非从零起步,它的设计受到多个优秀开源项目的启发,同时在架构上有自己的创新:

  • MoneyPrinterTurbo — 同类视频生成工具,但 Pixelle-Video 通过 ComfyUI 工作流架构实现了更强的模型灵活性和扩展性
  • NarratoAI — 偏重影视解说自动化,Pixelle-Video 更通用
  • Pixelle-MCP — 同一团队开发的 ComfyUI MCP 服务器(这是 Pixelle-Video 的底层依赖之一),让 AI 助手直接调用 ComfyUI

适用场景

  • 自媒体创作者:批量生产知识科普类短视频,输入主题一键生成
  • 教育培训:快速制作课程解说视频、学习内容短视频
  • 营销推广:产品介绍、品牌故事等短视频素材的自动生成
  • 个人使用:旅游 Vlog、生活记录等趣味短视频创作

局限与注意事项

  • 生成的视频质量受底层模型能力限制(ComfyUI 的模型、TTS 的质量)
  • 本地运行需要一定配置门槛(GPU 推荐 6GB+ 显存),但云端方案可解决
  • 目前 GitHub 上有 63 个 Open Issue,主要涉及配置依赖、字幕生成等功能性问题
  • 视频风格模板的丰富度还在扩展中

总结

Pixelle-Video 是目前 GitHub 上最活跃的 AI 短视频自动生成项目之一,13,600+ Stars 反映了社区对其方向的认可。它的核心理念——用 ComfyUI 工作流解耦 AI 能力——在架构设计上颇具前瞻性,使得用户可以在不修改任何代码的前提下,灵活替换和升级底层模型。

对于需要批量生产短视频的内容创作者来说,Pixelle-Video 是一个极具实用价值的免费开源方案。低门槛(Windows 整合包一键启动)、零费用(本地运行方案)、全自动流水线,让视频创作的效率提升了一个数量级。

标签:Pixelle-Video, AI视频生成, 短视频, 开源, ComfyUI, AIGC, 内容创作

滚动至顶部