OpenVoice 语音克隆实战:从在线试用到本地多语言接入的最短路径 OpenVoice 语音克隆实战从在线试用到本地多语言接入的最短路径【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型3~5 秒音频复刻说话人音色支持跨语言语音合成与情绪风格控制面向开发者。只想本地跑起来直接看第 1 节只关心合成不像这类问题直接跳到第 5 节。快速上手先试在线版再跑本地最短命令不装环境先看在线体验OpenVoice 的输入音频可以是任意语言它会克隆这段音频里的音色再用这个音色说多种语言。不想装环境的话官方在 MyShell 平台上部署了按语言区分的在线服务覆盖英式英语、美式英语、印度英语、澳大利亚英语、西班牙语、法语、中文、日语、韩语等。平台里的操作路径进入 Workshop创建 Bot再在语音设置里通过 voice cloning 生成一条克隆音色。官方另有两个极简演示空间可快速试核心功能。本地最短可行命令面向熟悉 Linux、Python、PyTorch 的开发者V1 和 V2 的安装命令完全一样conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完只是后面 checkpoint 和依赖不同。想直接看本地界面可再跑python -m openvoice_app --share起一个极简 Gradio demoWindows、Docker 的社区安装指南见 docs/USAGE.md。V1 风格控制3 步克隆音色并调情绪结论V1 是基础说话人 TTS 音色转换器两件套。情绪、口音由基础说话人模型决定音色转换器只负责把音色换成参考音频里的人——想改口音或情绪得换基础说话人而不是调转换器。具体三步见 demo_part1.ipynb加载基础说话人模型与音色转换器从参考音频提取目标音色嵌入se_extractor.get_se建议vadTrue去静音用speaker选情绪、speed调语速合成再 convert 到目标音色target_se, _ se_extractor.get_se(ref_audio, tone_color_converter, vadTrue) base_speaker_tts.tts(text, src_path, speakerwhispering, languageEnglish, speed0.9) tone_color_converter.convert(audio_src_pathsrc_path, src_sesource_se, tgt_setarget_se, output_pathsave_path)风格参数有 friendly、cheerful、excited、sad、angry、terrified、shouting、whispering 八种。跨语言克隆用一种声音说另一种语言结论V1 做跨语言靠换基础说话人。只要目标语言有可用的基础说话人 TTS就能把参考音色说成那种语言参考音频和输出语言都不需要出现在训练集里属于零样本。做法见 demo_part2.ipynb把基础说话人换成支持目标语言的模型官方示例用 OpenAI TTS 顶替文本改成目标语言再走同样的 convert 流程。这样能覆盖英语、西班牙语、法语、中文、日语、德语、俄语、阿拉伯语、印地语、葡萄牙语等十几种语言。只支持某一两种语言时直接换对应语言的基础说话人即可不必重训音色转换器——最难的转换器训练官方已经做完。V2 多语言额外要装什么、怎么跑结论V2 音质更好原生支持英语、西班牙语、法语、中文、日语、韩语六种语言MIT 协议可商用。相比 V1 多做两件事装 MeloTTS 依赖按其官方仓库的 pip 命令安装再执行python -m unidic download拉取日语分词包下载 V2 的 checkpoint 包解压到项目根目录的checkpoints_v2文件夹V1 是解压到checkpoints跑法见 demo_part3.ipynb合成一句日语例如model.tts_to_file(彼は毎朝ジョギングをしています, speaker_id0, output_pathsrc_path, speed1.0)V2 对中文普通话的声调、日语的 mora 处理做了优化亚洲语言比 V1 更稳。踩坑速查声音不像、装不上、语言报错按 docs/QA.md 整理成现象 → 原因 → 一句话解法音色不像参考人 / 口音情绪对不上→ OpenVoice 只克隆音色不克隆口音和情绪二者由基础说话人模型决定 → 换对应口音/情绪的基础说话人模型别指望转换器去改。音质差、有杂音→ 参考音频不干净、太短、多人混音、有大段静音或同名参考音频的processed缓存没删 → 换 3~10 秒单人干净音频get_se开vadTrue并清掉processed旧文件。Silero VAD 下载失败→ 机器无法访问外部托管源时se_extractor.get_vad_segments拉不到包 → 手动下载 silero-vad 的 zip解压到~/.cache/torch/hub/snakers4_silero-vad_master。日语跑不起来→ 缺日语分词包 → 执行python -m unidic download。想要训练集里没有的语言→ 缺该语言的基础说话人 → 自备一个该语言 TTS 当基础说话人或用 OpenAI TTS 顶替。资源索引文档、论文、模型包、引用格式使用文档docs/USAGE.md常见问题docs/QA.md核心模型实现openvoice/models.py音色提取openvoice/se_extractor.py论文OpenVoice: Versatile Instant Voice CloningarXiv:2312.01479模型包V1 用checkpoints_1226.zip解压到checkpointsV2 用checkpoints_v2_0417.zip解压到checkpoints_v2从官方渠道下载许可V1、V2 均为 MIT可免费商用学术引用article{qin2023openvoice, title{OpenVoice: Versatile Instant Voice Cloning}, author{Qin, Zengyi and Zhao, Wenliang and Yu, Xumin and Sun, Xin}, journal{arXiv preprint arXiv:2312.01479}, year{2023} }下一步建议先用在线版确认音色克隆效果再决定要不要本地部署省得白装环境。只跑中文/英语且在意音质直接上 V2要跨十几种语言或做风格研究V1 更灵活。接入自己的项目时优先替换基础说话人模型这一层音色转换器沿用官方现成的。合成效果不满意先按第 5 节逐条排查参考音频再考虑换版本。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考