如何3步上手Retrieval-based-Voice-Conversion-WebUI:用不超过10分钟的录音训练出可用变声模型 📅 发布时间:2026/9/1 8:57:29 👁 浏览次数: 如何3步上手Retrieval-based-Voice-Conversion-WebUI用不超过10分钟的录音训练出可用变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是一个基于 VITS 的语音转换变声工具靠top1 检索替换源特征来减少音色泄漏官方推荐用至少 10 分钟低底噪语音即可训出可用模型。跟着本文操作你可以完成三件事准备一份最小训练集、在网页界面里跑通训练 推理全流程、并用推理界面听到第一段换音色后的音频。先看清楚你会遇到的两个典型现象第一次接触变声模型的人通常卡在两个地方。一是训练完听不出来像谁推理结果既不像目标人物也丢了你自己录的声音特征音色变得含糊。这多半是训练数据太少或太脏模型没有抓住目标音色的稳定特征。二是换了音色却漏了源音色结果里残留了输入音频说话人的味道社区把这种现象叫音色泄漏。RVC 的检索机制就是冲着第二个问题来的第一个问题则主要靠数据质量解决——所以准备数据是整个流程里最值得花时间的一步。最小数据准备时长、底噪与切分官方文档给出的训练集建议是 10 分钟到 50 分钟如果音质高、底噪低且音色有个人特色5 到 10 分钟也能出效果1 到 2 分钟的成功案例存在但要求音色特征非常鲜明不具备普适参考价值1 分钟以下不建议尝试见 docs/cn/faq.md。数据准备上注意三点低底噪优先录音环境安静、无背景音乐和电流声。底噪大的数据训出来音质上限很低。音色统一同一个声音来源别把直播混响、清唱、朗读混在一起。单条音频别太长过长的音频文件在预处理阶段容易吃掉内存切成几段存放更稳妥。如果你手里只有完整歌曲可以先用 WebUI 里的 UVR5 选项卡分离出纯人声再进入训练流程。环境准备与首次启动需要 Python 3.8 以上。安装依赖按你的显卡选一份清单N 卡用 requirements.txtWindows 上的 A 卡/I 卡用 requirements-dml.txtLinux 上 ROCm 用 requirements-amd.txtIPEX 用 requirements-ipex.txt。N 卡的标准流程大致是pip install torch torchvision torchaudio pip install -r requirements.txt依赖之外还有几样必备物料缺失时启动会直接失败预训练底模assets/hubert/、assets/pretrained/想训 v2 模型还要assets/pretrained_v2/和assets/uvr5_weights/。仓库提供下载脚本 tools/download_models.py也可以直接跑tools/dlmodels.shWindows 用tools/dlmodels.bat。ffmpegWindows 用户把 ffmpeg.exe、ffprobe.exe 放到项目根目录即可。rmvpe.pt使用 RMVPE 音高提取算法时要放到根目录。全部就绪后启动网页界面python infer-web.py启动脚本会自动检测设备并初始化配置逻辑在 configs/config.py 里显存小于 4G 时自动调小预处理参数老架构显卡1060、1080、P40 等会自动切到 fp32省得你手动改配置。浏览器打开本地 7865 端口就是操作界面。从训练到听到结果走通一遍最小流程在网页界面里一次完整任务分四步。第一步切分与预处理。把训练集音频放进实验目录点一键训练会自动完成切分音频、提取音高、提取特征、训练模型、训练索引。切分参数如每段时长、静音阈值在 configs/v1/48k.json 这类配置里默认值对普通录音可用。第二步训练模型。训练脚本的入口在 infer/modules/train/train.py。关键参数是总轮数 total_epoch如果训练集音质差、底噪大20 到 30 轮就够音质高、底噪低、时长充足时官方说 200 轮也没问题。第三步训练索引。模型和索引是两样东西模型负责像不像目标音色索引负责推理时从训练集里借特征防泄漏。一键流程末尾会自动生成added_开头的索引文件如果卡住没生成单独点一次训练索引即可。第四步推理听结果。选模型 pth 和索引文件输入一段音频调整音高和 index rate点推理。常见音高提取算法各有所长算法适用场景RMVPE官方推荐效果好、资源占用低需额外下载 rmvpe.ptPM输入是歌声时提速明显Harvest低音效果好但速度慢CREPE效果好但 GPU 占用高实时变声则用 tools/rvc_for_realtime.py对应 go-realtime-gui.bat官方数据是端到端 170ms 延迟配合 ASIO 设备可到 90ms具体取决于硬件驱动。它为什么好用top1检索与index rateRVC 的命名就来自核心机制——检索。用白话说推理时系统会去你的训练集特征库里找最接近当前输入的那条特征把它借来替换源特征。类比一下就像配音演员换嗓子前先把原唱的录音多听几遍照着原声的音色条件去配而不是凭自己习惯的音色去演原唱。这样就能从根源上压住源音色往结果里漏。控制这个机制力度的是index rate检索特征占比调到 1理论上完全用训练集特征不泄漏源音色但音质会偏向训练集——训练集比输入音质量差时音质会被拉低。调到 0完全不用检索音质跟着输入走但失去了保护训练集音色的能力。中间值在像目标和好听之间取平衡具体效果以试听为准。顺带一提如果训练集本身音质高、时长长把 total_epoch 调高之后模型自身就不太会往底模或输入源靠此时 index rate 和索引文件的重要性都会下降分享模型时甚至可以不附索引。最小可运行验证命令行级别不想用网页界面时可以走 CLI。先跑通一次 WebUI 流程控制台会打印出预处理和训练所用的完整命令行直接照抄复现即可。推理侧官方给了一个参考脚本 myinfer.py参数含义见 docs/cn/faq.md 的 Q7 条目仓库里 tools/infer_cli.py 也提供了命令行推理的入口。验证成功的标志很简单输入一段自己 1 分钟的录音几秒后输出一条音色明显改变、但咬字和节奏与输入一致的音频。常见坑位与对策现象ffmpeg error 或 utf8 error。原因大概率不是 ffmpeg 本身的问题而是音频路径带空格、括号等符号或训练集路径含中文导致写 filelist.txt 时报 utf8 错误。处理把音频挪到纯英文、无空格的路径下重试。现象训练时报 Cuda out of memory。原因显存不够常见于 4G 以下显存的显卡1060 3G 这类基本放弃4G 还能救。处理训练阶段把 batch size 往下调推理阶段调小 configs/config.py 末尾的 x_pad、x_query、x_center、x_max 四个参数。启动时脚本也会自动根据显存大小做一轮降级。现象训练结束没有added_开头的索引文件。原因训练集太大添加索引那一步卡住另外若提示 Training is done说明模型已训好紧邻的报错是假报错。处理单独再点一次训练索引仓库已用批量 add 索引的方式缓解内存压力。下一步可以做什么流程跑通之后比较自然的扩展方向是模型融合在 ckpt 处理选项卡里用 ckpt-merge 把两个已训模型按比例合并可以在不重新训练的前提下微调音色。合并比例的取舍和更多参数细节建议对照 docs/cn/faq.md 与官方文档按自己的数据实际试听确定。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考