概述
在 AI 视频生成领域,多数工具要么只做图像生成(如 Stable Diffusion),要么只做视频生成(如 WAN),要么只做语音合成。Pixelle-Video 的不同之处在于:它将整个视频生产链路整合为一个端到端的全自动流水线——输入一个主题,3 分钟生成一条包含文案、配图、配音、背景音乐和字幕的完整短视频。
这是一个由国内开发团队 AIDC-AI 打造的开源项目,目前已在 GitHub 上获得超过 13,600 Stars,是完全免费的开源方案(Apache-2.0 许可证)。
项目地址:https://github.com/AIDC-AI/Pixelle-Video
官方文档:https://aidc-ai.github.io/Pixelle-Video/zh/
一句话定位
Pixelle-Video = 全自动短视频引擎。输入主题,输出成品视频。
它的目标是让视频创作成为一句话的事——不需要剪辑经验,不需要写脚本,不需要学复杂的工具操作。
核心能力
全自动视频生成流水线
用户只需要输入一个主题(例如"为什么要养成阅读习惯"),Pixelle-Video 就会自动完成以下全部步骤:
- ✍️ AI 撰写文案 — 根据主题自动生成分镜脚本和解说词
- 🎨 AI 生成配图 — 每个分镜自动生成匹配的插图
- 🗣️ AI 语音合成 — 将解说词转为自然语音
- 🎵 添加背景音乐 — 支持自动配 BGM
- 🎬 一键合成视频 — 将所有素材合成为最终视频
组件能力矩阵
| 环节 | 可选方案 | 说明 |
|---|---|---|
| LLM(文案) | GPT / 通义千问 / DeepSeek / Ollama | 智能生成解说词,支持多种模型切换 |
| 配图生成 | ComfyUI(FLUX / Qwen 等)/ RunningHub | 每句话自动配一张匹配插图 |
| 视频生成 | WAN 2.1 / WAN 2.2 / Nano Banana | AI 生成动态视频内容作为背景 |
| 语音合成 | Edge-TTS / Index-TTS / ChatTTS / 声音克隆 | 多语言、多音色,支持参考音频克隆 |
| 视频合成 | 内置 FFmpeg 管线 | 图文混合、背景叠加、字幕生成 |
架构设计:一切能力都是 ComfyUI 工作流
Pixelle-Video 最核心的设计理念是:所有 AI 能力都通过 ComfyUI 工作流 JSON 文件来定义。这意味着管线与具体模型是真正解耦的——当你想把图像生成从 FLUX 切换到 Qwen,你改的不是代码,而是指向另一个 workflow JSON 文件。
整体分层架构如下:
- 应用层 — Pixelle-Video Web UI(Streamlit),用户交互界面
- 编排层 — 视频生成管线,负责文案→配图→语音→合成的流程编排
- 能力层 — ComfyUI 工作流 JSON 文件,定义具体模型和参数
- 执行层 — ComfyUI(本地或远程),运行工作流生成图像和视频
这种架构带来了极大的灵活性:如果你有更好的图像生成模型,不需要改 Pixelle-Video 一行代码,只需添加一个新的 workflow JSON 文件即可。
功能亮点
- 全自动生成 — 输入主题,3 分钟出成品视频,无需手动剪辑
- AI 智能文案 — 自动生成解说词和分镜脚本,支持多种 LLM
- 灵活的视频尺寸 — 支持竖屏(1080×1920)、横屏(1920×1080)等
- 多种视觉风格 — 内置多个模板,可快速切换风格
- 自定义素材 — 支持用户上传自己的照片和视频,AI 自动识别内容并生成描述
- 原子能力灵活组合 — 基于 ComfyUI 架构,可使用预置工作流或自定义
- API 支持 — 对外提供 REST API,可集成到其他系统
安装方式
Windows 用户(推荐整合包)
从 GitHub Releases 下载最新 Windows 整合包,解压后双击 start.bat 即可使用。无需安装 Python、FFmpeg 或任何依赖。
macOS / Linux 用户(源码安装)
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
# 推荐使用 uv(更快的包管理器)
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync
# 启动 Web 界面
uv run streamlit run web/app.py
浏览器打开 http://localhost:8501 即可使用。
如果选择本地部署 ComfyUI 作为图像生成后端,还需要额外安装 ComfyUI 并下载相应模型文件。
快速生成第一个视频
启动 Web 界面后,工作流程非常简单:
- 在"⚙️ 系统配置"中配置 LLM API Key(通义千问、DeepSeek、GPT 任选一个)和图像服务地址
- 在"📝 内容输入"中输入一个主题,例如"健康饮食的重要性"
- 设置场景数量(默认 5 个分镜)
- 选择 TTS 和图像生成工作流
- 点击"🎬 生成视频"按钮
系统会实时显示进度:生成文案 → 生成配图(每个分镜) → 合成语音 → 合成视频。整个过程大约 2-5 分钟。
费用说明
Pixelle-Video 提供多级费用方案,丰俭由人:
- 完全免费:LLM 使用 Ollama(本地运行)+ ComfyUI 本地部署 = 0 元。适合有 NVIDIA 显卡(6GB+ 显存)的用户。
- 推荐方案:LLM 使用通义千问(3 段视频约 0.01-0.05 元)+ ComfyUI 本地部署。性价比极高。
- 云端方案:LLM 使用 OpenAI API + 图像使用 RunningHub 云端服务。费用较高但无需本地显卡。
与其他项目的对比
Pixelle-Video 并非从零起步,它的设计受到多个优秀开源项目的启发,同时在架构上有自己的创新:
- MoneyPrinterTurbo — 同类视频生成工具,但 Pixelle-Video 通过 ComfyUI 工作流架构实现了更强的模型灵活性和扩展性
- NarratoAI — 偏重影视解说自动化,Pixelle-Video 更通用
- Pixelle-MCP — 同一团队开发的 ComfyUI MCP 服务器(这是 Pixelle-Video 的底层依赖之一),让 AI 助手直接调用 ComfyUI
适用场景
- 自媒体创作者:批量生产知识科普类短视频,输入主题一键生成
- 教育培训:快速制作课程解说视频、学习内容短视频
- 营销推广:产品介绍、品牌故事等短视频素材的自动生成
- 个人使用:旅游 Vlog、生活记录等趣味短视频创作
局限与注意事项
- 生成的视频质量受底层模型能力限制(ComfyUI 的模型、TTS 的质量)
- 本地运行需要一定配置门槛(GPU 推荐 6GB+ 显存),但云端方案可解决
- 目前 GitHub 上有 63 个 Open Issue,主要涉及配置依赖、字幕生成等功能性问题
- 视频风格模板的丰富度还在扩展中
总结
Pixelle-Video 是目前 GitHub 上最活跃的 AI 短视频自动生成项目之一,13,600+ Stars 反映了社区对其方向的认可。它的核心理念——用 ComfyUI 工作流解耦 AI 能力——在架构设计上颇具前瞻性,使得用户可以在不修改任何代码的前提下,灵活替换和升级底层模型。
对于需要批量生产短视频的内容创作者来说,Pixelle-Video 是一个极具实用价值的免费开源方案。低门槛(Windows 整合包一键启动)、零费用(本地运行方案)、全自动流水线,让视频创作的效率提升了一个数量级。
标签:Pixelle-Video, AI视频生成, 短视频, 开源, ComfyUI, AIGC, 内容创作