RVC 变声器实操教程:10 分钟录音跑通 AI 变声的完整指南 📅 发布时间:2026/9/1 10:21:31 👁 浏览次数: RVC 变声器实操教程10 分钟录音跑通 AI 变声的完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI这篇 RVC 变声器教程带你从零搭建环境、训练出第一个音色模型再把一段录音换成目标人物的声音。RVCRetrieval-based Voice Conversion是一款基于检索机制的开源变声框架最大卖点是只需约 10 分钟低噪录音就能训出效果不错的模型对新手非常友好。你将获得在一台有独立显卡的电脑上完整跑通「训练音色 语音转换」全流程能读懂index_rate、f0_up_key、filter_radius这几个关键参数并据此调优效果掌握 5 类最高频报错的定位方法和一步修复动作知道如何扩展到批量转换和模型融合原理拆解一段录音怎么变成另一种音色RVC 的推理链路可以拆成「输入 → 核心处理 → 输出」三段输入你的原始音频一段说话或唱歌的 wav。核心处理系统先做两件事——用 Hubert 模型提取内容特征你在说什么用 RMVPE 算法提取音高曲线你喊得多高。随后进入检索环节从训练集的索引里找出与当前片段最相似的特征片段把源特征替换掉——这一步叫 top1 检索是RVC名字里 Retrieval 的来源作用是抹掉原说话人的音色痕迹。最后 VITS 声码器一种把频谱还原成波形的模型把新特征合成音频。输出内容、节奏基本不变音色换成了训练集人物的 wav。 此处插入RVC 推理链路示意图原始音频 → 特征提取 → 检索替换 → 声码器合成 → 目标音色音频所以它适合解决这类问题手里只有一小段干净录音却想要这个人的专属音色来配音、翻唱或做虚拟形象。配好 RVC 训练推理运行环境上手门槛低预计 30 分钟先拿到项目代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI再装 Python 依赖需要 Python 3.8 以上推荐 3.9–3.10。先装 PyTorch 及其核心依赖再装项目依赖。按你的显卡选一份 requirements 文件pip install torch torchvision torchaudio pip install -r requirements.txt # N 卡 # A 卡 / I 卡改为pip install -r requirements-dml.txt # A 卡 ROCm(Linux) 改为pip install -r requirements-amd.txtWindows 上 RT30 系列显卡Ampere 架构如果跑不起来尝试给 PyTorch 指定 cu117 版本安装。最后装 ffmpeg 和 RMVPE 音高模型ffmpeg 负责音频切分和格式转换是硬依赖。不同系统的装法不同系统ffmpeg 安装方式验证方式Windows下载 ffmpeg.exe / ffprobe.exe 放到项目根目录ffmpeg -versionUbuntu/Debiansudo apt install ffmpegffmpeg -versionMacOSbrew install ffmpegffmpeg -version另外下载 RMVPE 音高提取模型的rmvpe.pt文件放到项目根目录README 中有下载地址说明否则推理时选不到效果最好的 rmvpe 算法。完成标志终端执行ffmpeg -version能打印出版本号依赖安装过程无ERROR。启动 WebUI 并备好预训练模型上手门槛低预计 10 分钟 模型下载时间RVC 训练和推理都依赖几个底模预训练模型、Hubert 特征提取器等。仓库的 tools 目录里提供了下载脚本download_models.py一键拉取全部所需文件包括assets/hubert、assets/pretrained、assets/uvr5_weights想训 v2 模型还需要assets/pretrained_v2。python tools/download_models.py下载完成后启动主界面python infer-web.py浏览器会自动打开。界面顶部有几个页签模型推理单次推理 / 批量推理、伴奏人声分离去混响去回声、训练、ckpt处理、Onnx导出。后面两步主要用后两个和模型推理。完成标志终端出现Running on local URL: http://127.0.0.1:7865浏览器打开页面不报错端口默认 7865可用--port参数修改。处理数据并训练第一个模型上手门槛中首次训练预计 30 分钟–2 小时取决于数据量和显卡在训练页签里整个流程被拆成四个顺序执行的环节按从上到下的顺序点按钮即可数据准备录音放哪里、要多少把目标人物的干净录音建议 10–30 分钟、无背景噪音、无伴奏整理到一个文件夹在训练页填入该路径和实验名。采样率选 48000v2 模型支持 48k 和 32kf0提取算法选rmvpe——它比 dio、crepe 更快、资源占用更小且能明显减少哑音漏掉音高问题。前三步切片 → 音高 → 特征依次执行0-音频切片把长音频切成小片段、1-提取音高、2-提取特征Hubert 特征。每步完成后页面会出现提示失败一般是路径写错或 ffmpeg 没装好。最后一步模型训练点击训练按钮后日志区开始滚动。训练参数不用改默认值就能出可用结果查看 configs/inuse/v2/48k.json 可以看到默认batch_size为 4、learning_rate为1e-4、fp16_run已开启混合精度省显存提速。显存 6GB 以下的显卡如报 OOM再考虑把batch_size调到 2。训练轮数epoch一般8–15 轮足够损失曲线基本走平就可以停不用跑完全程。训练结束后在同一页面生成索引文件index可理解为训练集特征的查表目录检索环节就是拿它来查的生成物是一个.index文件落在assets/indices目录。完成标志assets/weights目录下出现以你实验名命名的.pth模型文件assets/indices下出现对应的.index文件。跑通第一次语音转换 ️上手门槛低预计 10 分钟切到模型推理页签的单次推理分组按下面四步操作选模型下拉框刷新后选你刚训的.pth模型。选索引选对应的.index文件。设音高f0_up_key填0表示保持原调男声想变女声常见填12女声变男声填-12单位是半音一个八度是 12。设检索比例index_rate先填0.7——它控制多大程度用训练集特征替换你的特征越高音色越像但越容易有颗粒感。上传一段 10 秒左右的测试音频点击转换右侧出现可试听的结果音频。完成标志输出区出现新的音频波形并能播放音色明显偏向训练集人物。调优让变声更接近目标音色 ️不穷举参数只给三组最常用的调整逻辑。每组都附上调完你应该听到什么方便验证现象一声音不像目标人物→ 把index_rate从0.5逐步加到0.8–1.0→ 预期变化音色越来越贴近训练集人物但超过 1.0 附近可能出现轻微毛刺。现象二有明显颗粒感、金属噪、电子音→ 把index_rate降到0.5左右同时适当调高filter_radius频谱滤波半径越大越平滑但高频细节会少一些 → 预期变化杂音减少声音变柔高频略闷属正常。现象三音高不合适太高假 / 太低闷→ 微调f0_up_key±1 半音为单位试并确认训练时和推理时的采样率一致 → 预期变化音高落位自然不再有娃娃音或地低音。三组参数组合对比组合index_ratefilter_radiusf0_up_key适用场景与预期听感保守0.530音色偏你、音质最干净适合试错阶段默认0.73按性别 ±12相似度与干净度平衡日常主力设置激进1.02按需求相似度最高接受轻微颗粒感适合必须像的场合排错五类高频报错一次看懂现象最可能原因一步验证修复动作训练中途报 CUDA out of memorybatch_size相对显存过大nvidia-smi看显存占用在本地副本的 configs/inuse/v2/48k.json 中把batch_size由 4 改为 2重开 WebUI启动即报找不到 ffmpegffmpeg 未安装或不在 PATHffmpeg -version按上文对应系统装好Windows 用户确认 ffmpeg.exe 在项目根目录推理页下拉框里没有你的模型.pth没放进assets/weights列出assets/weights目录把模型文件放入该目录点击页面刷新按钮音高算法里选不到 rmvpermvpe.pt没放到项目根目录查看根目录有无 rmvpe.pt下载后放到根目录重启 WebUI转换很慢、音高提取卡住选了 dio / crepe 等慢算法看当前 f0 算法选项换回 rmvpe速度快且资源占用更小更细的报错模型加载失败、采样率不匹配等可查仓库自带的 中文 FAQ 与 训练建议。延伸批量转换与模型融合批量转换WebUI 的模型推理页签里有批量推理分组命令行党可以直接用 批量转换脚本支持指定模型、索引和index_rate等参数。第一步挑 5 段有代表性的音频放进一个文件夹先小批量验证参数再放开跑。模型融合在ckpt处理页签的 ckpt-merge 功能里可以把两个.pth模型按权重如 0.6 / 0.4混合成新模型用来取长补短或修掉单一模型的瑕疵。第一步拿自己训的模型和官方底模各按 0.5 权重融一次对比原声。想进一步减少部署依赖可以在Onnx导出页签把模型导出为 onnx配套脚本见 tools/export_onnx.py。下一步就动手准备 10 分钟干净录音按默认参数训练第一版模型推理时把index_rate先锁定在 0.7、f0_up_key按性别填 ±12跑通后再回来微调这两个数值——比一开始就抠十来个参数效率高得多。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考