RVC 变声器:10 分钟录音,跑通一个可换声色的语音模型 RVC 变声器10 分钟录音跑通一个可换声色的语音模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC 变声器是什么适合谁RVC 变声器是一个开源的语音转换工具你给一段目标人声录音它训出一个音色模型之后任何音频进去都换成那个音色输出。输入是 10 到 50 分钟的 WAV 人声录音。输出是一个约 60MB 的 .pth 模型文件和转换后的音频。适合给视频配音、给游戏换声、做翻唱的内容创作者和爱好者。手里连一段干净录音都没有的不适合先上这条路。跑起来之前先回答三个问题跑 RVC 之前把 RVC 显存要求、录音量、环境依赖这三件事先对一遍后面才不会卡住。我的显卡够吗4GB 显存能跑。配置最低要求推荐说明显存4GB6GB 以上4GB 以下3GB、2GB官方 FAQ 建议放弃显卡类型NVIDIA 或 A 卡/CPUNVIDIAA 卡 Windows 走 DirectMLLinux 走 CPU内存8GB16GB切分和音高提取吃 CPU 多进程内存紧就把 CPU 进程数调低Python3.12 x643.12 x64本分支只认 3.12需要准备多少录音10 分钟起步50 分钟封顶。官方建议总时长 10~50 分钟底噪低、音色有辨识度5~10 分钟也行单条片段 30 秒到 2 分钟语速、语调、情绪要有变化统一转成 WAV采样率会自动重采样需要装哪些东西三样Python 3.12 环境、ffmpeg、预训练模型文件。sudo apt install ffmpeg python -m venv .venv source .venv/bin/activate pip install -r requirments_cpu_py312.txt三样都齐了下面开始跑。最小路径从 10 分钟录音到一条转换出的音频RVC 变声器最小路径一共 5 步全部在项目根目录执行。第 1 步拉代码装依赖拉代码按你的硬件装依赖。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv source .venv/bin/activate pip install -r requirments_cpu_py312.txtNVIDIA 卡先装 CUDA 11.8 版 torch再把最后一行换成pip install -r requirments_cu118_py312.txtRTX 50 系用 cu128两阶段装法参考 README.md。Windows 激活虚拟环境用.venv\Scripts\activate。看到python -c import torch正常打印版本号即成功。第 2 步下载预训练模型底模缺了训练和推理都起不来。pip install -U huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include pretrained/* pretrained_v2/* --local-dir assets看到 assets/hubert_base/、assets/rmvpe/rmvpe.pt、assets/pretrained_v2/f0G40k.pth 都在即成功。第 3 步启动 WebUI一条命令浏览器自动打开。python webui.py无桌面的服务器加--noautoopenWindows 也可以直接双击 go-webui.bat 走整合包。看到浏览器出现 RVC WebUI 页面、默认端口 7865 即成功。第 4 步一键训练在训练页填好参数点一键训练。填实验名如 my-voice和训练文件夹路径目标采样率 48k、版本 v2、模型带音高指导音高提取算法 rmvpe、总轮数 20、其余用默认接着自动跑数据切分、F0 与 HuBERT 特征提取、模型训练、索引训练四段日志写在 logs/my-voice/ 下。看到 assets/weights/ 出现 my-voice.pth、logs/my-voice/ 出现 added_ 开头的 .index 即成功。没有索引就再按一次训练特征索引。第 5 步推理验证在模型推理页选模型转换一段音频。点刷新音色列表推理音色里选实验名上传一段音频变调填 0点转换。看到输出音频能播放、音色和训练集对得上即成功。效果不满意调这几个旋钮默认参数能出结果但 RVC 变声器的效果取决于以下几个变量。参数默认值怎么调调了会怎样总轮数 total_epoch20底噪大数据 20~30干净长数据 200噪数据训太多轮会把噪音学进去干净数据训太少没收敛保存频率 save_every_epoch5调小多留检查点检查点多才能逐个试听挑最早达标的避免过拟合batch_size约显存 GB 数的一半OOM 就往下调最低 1调小稳定、调大提速1 还 OOM 说明显存低于 4GB检索特征占比 index rate0.750~1 之间拉调高锚定训练集音色调低音质上限更高但可能音色泄露保护值 protect0.33有电音就调低保护清辅音和呼吸声调低保护力度更大如果出现输出有电音、撕裂声大概率是清辅音没保护好把 protect 从 0.33 调到 0.2 试试如果出现输出音色往输入音频或底模靠音色泄露大概率是 index rate 太低把它调到 1 试试如果训练报 out of memory大概率是 batch size 太大逐个往下调调到 1 还报就是显存低于 4GB只能换卡从单条到批量和实时变声RVC 变声器跑通单条之后剩下三个场景都直接可触发。批量转换一个文件夹模型推理页下有批量推理选项卡。填输入音频文件夹路径和输出文件夹默认 opt选模型和导出格式点转换。限制批量推理 index rate 默认是 1和单次推理的 0.75 不同同一段音频两个入口结果会有差异。说话实时变声Windows 双击 go-realtime_gui.bat其他平台跑python realtime_gui.py。界面里选模型和索引、选音频输入输出设备即可开始。限制端到端延迟 170ms换 ASIO 设备能压到 90ms但依赖声卡驱动支持普通 USB 声卡别指望这个数。翻唱先分离再转换用伴奏人声分离去混响去回声选项卡的 UVR5 模型把混音拆成人声和伴奏人声再进推理页转换。限制要先下载 uvr5_weights分离质量取决于混音本身。□ 把一段不在训练集里的新录音扔进去输出音色应该和那个人对得上□ 把变调设为 12输出应该比输入高一个八度□ 同一模型带索引和不带索引各推一次带索引的音色相似度应该更稳三个都过了流程就通了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考