RVC WebUI 完整指南:如何用 10 分钟语音数据训练 AI 变声模型 📅 发布时间:2026/9/3 9:20:46 👁 浏览次数: RVC WebUI 完整指南如何用 10 分钟语音数据训练 AI 变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI简称 RVC WebUI是一个开源的检索式变声VC训练框架基于 VITS 实现用 10 分钟内的低底噪语音就能训出一个可用的音色转换模型还支持实时变声。本文带你从零把环境搭好、走通一次完整训练并给出调参和排错的实用建议。一、先跑起来从克隆到启动的最短路径环境要求很简单Python 大于 3.8以及 ffmpeg训练和推理都要调用它。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI然后安装 PyTorch 和对应显卡的依赖pip install torch torchvision torchaudio pip install -r requirements.txt # N 卡A/I 卡用 requirements-dml.txtRVC 还需要一批预训练文件hubert_base.pt、pretrained、uvr5_weights 等仓库的 tools/download_models.py 提供了下载脚本也可以参考 README 中的清单手动放置。ffmpeg 未安装的话Ubuntu/Debian 执行sudo apt install ffmpegMac 执行brew install ffmpeg。全部就绪后启动python infer-web.py浏览器会自动打开 WebUI 界面Windows 整合包用户也可以直接双击go-web.bat。二、完整走通一次训练从 10 分钟音频到变声想达成什么用自己的 10~20 分钟人声训出一个能替换他人声色的模型。具体怎么做准备数据把干净的人声 WAV 放到一个目录采样率建议 44100Hz底噪要低。数据切片在切片选项卡设置目标采样率和阈值默认 -40dB程序会用内置的 slicer 把长音频切成短片段。提取特征在提取选项卡选择音高算法f0_method推荐 rmvpe和 Hubert 模型对切片做音高和语义特征提取。训练在训练选项卡填入实验名和 batch_size启动后模型保存在weights/实验状态在logs/实验名/。建立索引训练完成后点击训练索引生成.index检索文件这是检索式替换的关键。得到什么结果切到推理选项卡加载weights/下 60MB 的 pth 和对应 index上传你的源音频指定音高f0_up_key半声为 12降半声为 -12和 f0_method点开始推理即可得到转换后的音频。三、你大概率会碰到的参数与配置推理和实时变声的常用参数集中在 infer/modules/vc/ 和实时配置的 configs/config.json 里index_rate0~1检索混合比例。调高更保训练集音色但音质偏向训练集调低则音质更受推理源和底模影响可能出现音色泄露f0_method音高提取算法rmvpe 效果最好且资源占用小pm、dio、harvest 速度更快但精度略低f0_up_key目标音高偏移整数半声0 表示不变filter_radius大过 0 时启用中位数滤波可平滑音高抖动total_epoch训练轮数。底噪大的训练集 20~30 即可高音质长数据可拉到 200设备与显存相关配置在 configs/config.pydevice选卡号is_half控制半精度4G 以下显存建议关掉代码对 1060/1070/1080 等卡会自动强制 fp32 并降低x_pad、x_query等参数。四、高频踩坑集当你遇到「ffmpeg error / utf8 error」多半不是 ffmpeg 的问题而是路径问题。ffmpeg 读不到带空格、括号的路径filelist.txt 写入时中文路径可能触发 utf8 error。把音频放到纯英文、无空格的路径下重试即可。当你遇到「Cuda out of memory」训练时缩小 batch_size推理时调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max。4G 以下显存基本可以放弃训练4G 显存还能抢救。当你遇到「一键训练结束没有 index 文件」如果是大训练集添加索引步骤可能卡住或占内存过大重新点一次训练索引按钮通常就能补上。当你遇到「Connection Error」多半是控制台窗口黑色命令行窗口被手动关掉了重新通过go-web.bat或python infer-web.py启动即可。当你遇到「Expecting value: line 1 column 1」关掉局域网/全局代理再试包括服务端环境里设置的 http_proxy 变量。五、进阶探索训练好第一个模型后可以往这几个方向走实时变声双击go-realtime-gui.bat打开实时界面configs/config.json 中的block_time、crossfade_length、threhold都影响延迟项目已实现端到端约 170ms 延迟命令行与批处理tools/infer_cli.py 支持单文件推理tools/infer_batch_rvc.py 可批量转换整个目录模型融合ckpt 选项卡里的 ckpt-merge 可以把两个模型融合出新音色导出与部署tools/export_onnx.py 可导出 ONNXtools/infer/ 下有独立的训练和索引脚本文档与社区多语言 FAQ 在 docs/cn/faq.md 和 docs/en/训练技巧可看 docs/cn/ 下的教程文档把数据切干净、选对 f0_method、训练完记得建索引——这三步做到位10 分钟数据训出的模型就已经能用了。剩下的靠多听、多调参。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考