RVC 安装与训练完整指南:10 分钟录音做出自己的 AI 语音克隆模型 RVC 安装与训练完整指南10 分钟录音做出自己的 AI 语音克隆模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是一个基于 VITS 的开源变声框架用一个人 10~50 分钟的说话录音就能训练出专属的 AI 语音克隆模型之后任何音频都可以换成这个人的声音。本文覆盖这个 RVC 变声工具从安装、训练到推理、排错的完整流程。RVC 语音转换能做什么不能做什么先说结论RVC 解决的是把一个人的声音替换成另一个人的问题——先用少量目标人声录音训练出音色模型推理时再把输入音频的音色替换为目标音色其中用 top1 检索直接替换输入源特征来抑制音色泄漏输出里混入原音色的现象。框架还内置了 UVR5 人声伴奏分离、RMVPE 音高提取和模型融合功能全部在一个网页界面里完成。判断自己是否适合对照下面两列即可适合你的情况不适合你的情况翻唱变声、视频或游戏角色换声显卡显存低于 4G4G 仍可尝试更低基本不可行个性化语音助手、实时变声场景素材不足 5 分钟且期望稳定效果1 分钟以下官方不建议只有一张普通显卡想用 10 分钟素材训出可用模型想做能唱歌的模型却未开启带音高指导选项RVC 安装教程按显卡选依赖文件并补齐预训练模型安装环节的关键只有一点根据显卡选对 requirements 文件并补齐assets下的预训练模型。两者缺一后面都会卡住。第一步获取代码并安装依赖。需要 Python 3.8 及以上环境git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt第二步按显卡环境选择依赖文件N 卡直接用上一步命令其余按下表替换显卡环境依赖文件说明NVIDIArequirements.txtCUDA 加速最常见的选择AMDWindowsrequirements-dml.txt走 DirectML 加速AMDLinuxrequirements-amd.txt需先装好 ROCm 驱动IntelLinuxrequirements-ipex.txt走 IPEX 加速如果改用 Poetry 安装Python 建议 3.7~3.10其他版本安装llvmlite0.39.0时可能冲突。第三步安装 FFmpeg。音频读写依赖ffmpeg与ffprobeUbuntu/Debian 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 用户将ffmpeg.exe和ffprobe.exe放到项目根目录即可。第四步补齐预训练模型。至少需要assets/hubert、assets/pretrained、assets/uvr5_weights三个目录下的文件要使用 v2 版本模型还需assets/pretrained_v2。运行 tools/download_models.py 可批量下载上述文件。第五步启动 WebUI。执行python infer-web.py默认监听 7865 端口端口被占用时可加--port 7861更换。Windows 整合包里的go-web.bat则默认以 7897 端口启动。⚠️重要运行期间不要关闭终端窗口它是后端服务本体关闭后浏览器会提示 Connection Error。RVC 模型训练流程从素材准备到索引生成训练入口是 WebUI 的「训练」选项卡整体分为三个环节备料、一键训练、验证产物。准备一份干净的人声音频库素材质量直接决定效果上限比加大训练轮数重要得多时长推荐 10~50 分钟音质高、底噪低、音色统一时5~10 分钟也可行1 分钟以下不建议。内容同一人的统一音色去掉底噪、爆音和静音段。路径所有文件放入同一个训练文件夹路径避免空格、括号和中文这两类符号是后续 ffmpeg 报错和 utf8 错误的主要来源。一键训练生成检查点与索引文件在「训练」选项卡填好实验名、目标采样率和「模型是否带音高指导」后点「一键训练」即可串行执行数据预处理切片、归一化→ 音高与特征提取F0 曲线 HuBERT 特征→ 模型训练 → 索引训练。采样率v2 版本可选 32k / 40k / 48kv1 仅 40k / 48k40k 是通用选择48k 音质上限最高32k 计算开销最小。训练产物检查点按保存频率持续写入logs/实验名/生成器为G_xxx.pth、判别器为D_xxx.pth。训练轮数 total_epoch默认 20素材底噪大时 20~30 轮足够调高也带不动低音质素材素材优质且时长充足时200 轮没有问题。中断与续训关闭终端重启后用相同参数再次点训练会从上次检查点继续不会从零开始。验证训练产物并定位实验目录训练成功与否看两处输出信息出现 Training is done 即代表模型训练完成其后紧邻的个别报错可忽略。logs/实验名/下出现added_IVF..._Flat_nprobe_....index索引文件它是推理时把声音锁在目标音色上的特征检索库。也可以在训练设置中开启每次保存时间点将小模型保存至 weights 文件夹省去事后手动提取。⚠️重要训练中途不能更换目标采样率继续训练否则会报 tensor 尺寸不匹配错误必须更换实验名从头训练可拷贝上次的音高与特征文件夹加速。控制输出效果的三个 RVC 变声参数变调、索引率、F0 算法推理入口是「模型推理」选项卡先点「刷新音色列表和索引路径」选中刚训好的模型填入待处理音频路径参考输入框中的示例格式选择 F0 算法后点「转换」。真正影响结果的就是下表三个参数参数作用调整建议变调按整数半音整体升降调填 12 升八度填 -12 降八度男声翻女声通常从这里入手取正值索引率检索特征占比控制输出向训练集音色靠拢的程度单次推理默认 0.75音色不够像时在 0.5~0.9 之间逐步试调得越高越贴近训练集音色但训练集音质低于输入源时可能拉低音质F0 音高提取算法从输入音频提取音高曲线rmvpe效果最好且资源占用可控pm最快适合歌声提速harvest低音表现好但速度慢crepe效果好但更吃显存另外两个常调参数protect保护清辅音和呼吸声默认 0.33拉满 0.5 即关闭保护批量推理时索引率默认为 1可按需调低。训练集本身优质且时长充足时模型对索引率的依赖会明显下降。高频报错对照表从现象到解决方案遇到报错先按下表定位绝大多数情况不需要重新训练现象可能原因解决方案ffmpeg error / utf8 error音频路径含空格、括号等特殊符号ffmpeg 报错或含中文写 filelist 时 utf8 报错将音频改名为纯英文并移动到纯英文路径WebUI 弹出 Expecting value: line 1 column 1 (char 0)系统局域网/全局代理拦截了请求关闭代理后刷新服务端设置的http_proxy/https_proxy也要 unset缺少 llvmlite.dllWindows 缺少 Visual C 运行库安装对应版 vc_redist 运行库后重启CUDA out of memory显存不足训练侧调小 batch size调到 1 仍不够则需换卡推理侧在 configs/config.py 中酌情调小x_pad、x_query、x_center、x_max4G 以下显存基本只能放弃训练tensor 尺寸不匹配expanded size / size of tensor a 必须 match①wavs16k目录中有明显偏小的异常音频文件② 中途变更采样率继续训练① 删除异常文件后重新训练模型和索引② 更换实验名从头训练训练完成但没有added_开头的索引训练集较大时索引添加步骤卡住先确认出现 Training is done然后手动再点一次「训练特征索引」推理列表里找不到刚训好的模型训练过程报错中断或产物位置不对点「刷新音色」仍无则查看控制台输出与logs/实验名/下的日志文件提示若报文件/内存错误多为 CPU 进程开太多把「提取音高和处理数据使用的 CPU 进程数」调低并手动把训练音频切短一些。语音克隆模型如何正确分享以及更多资料入口分享模型前必须分清两类文件logs/实验名/下的 pth 是实验检查点体积达几百 MB用于复现和继续训练直接拷到weights强行推理会报 f0、tgt_sr 等 key 缺失错误可分享的是weights目录下 60MB 的 pth。标准流程在「ckpt 处理」选项卡最下方的模型提取功能中输入logs下 G 开头的检查点路径采样率、是否带音高、版本可自动识别提取出轻量小模型存入weights再把该 pth 与对应的added_....index索引文件一起打包发给对方解压到对应目录即可使用。遇到问题时优先查阅仓库自带的官方资料常见问题解答docs/cn/faq.mdWebUI 内「常见问题解答」选项卡即展示此文件更新日志docs/cn/Changelog_CN.md索引生成与模型转换脚本tools/infer/各采样率模型配置configs/v1/ 与 configs/v2/英文训练细节说明docs/en/training_tips_en.md界面与启动逻辑入口infer-web.py回头看整条路径按显卡装好依赖 → 补齐预训练模型 → 备料、一键训练、验证产物 → 用三个参数控制推理输出 → 按表排错 → 提取小模型分享。效果差距主要来自素材是否干净、音色是否统一而不是参数玄学。先用最短的 10 分钟素材完整跑通一遍再逐步增加数据量问题大多能在 docs/cn/faq.md 和上表的对照中自行解决。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考