Voice-Pro - 开源AI语音识别、翻译与多语言配音工具

Voice-Pro - 开源AI语音识别、翻译与多语言配音工具

4.0

Voice-Pro:一站式AI语音处理工具箱,从识别到配音全流程覆盖 在语音处理领域,创作者通常需要在多个工具之间来回切换:下载视频、分离人声、转写文字、翻译字幕、再合成配音。Voice-Pro 把这些环节全部整合进一个开箱即用的 Web 应用——基于 Gradio 构建,支持 YouTube 视频下载、人声分离、语音识别、翻译、字幕生成与多语言配音,为内容创作者、研究者和跨国团队提供了一条完整的 AI 语音处理流水线。 核心功能:覆盖语 …

最后更新 2026 年 8 月 29 日
Voice-Pro - 开源AI语音识别、翻译与多语言配音工具 截图

主要功能

**顶级语音识别:**集成 Whisper、Faster-Whisper、Whisper-Timestamped 三种引擎,支持高精度转录与逐词时间戳输出,中英文及多语种识别表现优异。
**零样本语音克隆:**内置 F5-TTS、E2-TTS、CosyVoice(含支持韩语等 9 种语言的 Fun-CosyVoice3),无需训练样本即可克隆任意音色。
**多语言文本转语音:**基于 Edge-TTS 与 kokoro,可选接入 Azure TTS,一键生成自然流畅的多语种配音。
**YouTube 视频处理:**内置下载器(yt-dlp),可直接拉取视频进行字幕生成、翻译与二次配音,打造多语言内容。
**专业人声分离:**集成 Demucs 与 MDX-Net 模型,支持伴奏/人声分离,适配卡拉 OK、播客剪辑与混音场景。

适用人群

内容创作者可用它批量生成多语言字幕与配音,快速出海;播客与视频剪辑师借助人声分离与转录功能高效处理素材;语言学习者可以通过视频翻译与双语字幕沉浸式学习;开发者则可基于其模块化架构二次集成,构建自己的语音应用。项目当前在 GitHub 上已收获超 1.1 万 Star,社区活跃,持续迭代。

如果你正在寻找一款免费、可本地部署的 AI 语音全流程工具,不妨立即访问 Voice-Pro GitHub 仓库,体验从视频到多语言配音的一站式工作流。

更多介绍

Voice-Pro:一站式AI语音处理工具箱,从识别到配音全流程覆盖

在语音处理领域,创作者通常需要在多个工具之间来回切换:下载视频、分离人声、转写文字、翻译字幕、再合成配音。Voice-Pro 把这些环节全部整合进一个开箱即用的 Web 应用——基于 Gradio 构建,支持 YouTube 视频下载、人声分离、语音识别、翻译、字幕生成与多语言配音,为内容创作者、研究者和跨国团队提供了一条完整的 AI 语音处理流水线。