RVC上手指南:10分钟语音克隆一个AI音色,从装环境到出片的全流程 📅 发布时间:2026/9/3 11:06:47 👁 浏览次数: RVC上手指南10分钟语音克隆一个AI音色从装环境到出片的全流程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC检索式语音转换是一个基于 VITS 的开源 AI 语音克隆框架喂给它 10 分钟左右的干净人声就能训练出一个可推理、可实时变声的音色模型。唱歌、配音、做个性化语音助手走的是同一条训练管线。这篇文章按先跑通 → 出第一个成果 → 自己训一个 → 卡住了怎么办的路径带你走一遍命令都能直接复制。 把环境装好界面先亮起来先通三步装完git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt依赖文件按硬件区分选错装不出效果文件适用对象requirements.txtNVIDIA 显卡大多数人的情况requirements-dml.txtWindows AMD 显卡DirectMLrequirements-ipex.txtIntel 显卡Linux再稳装完依赖还缺一步——下载预训练底模。仓库里提供了现成脚本tools/download_models.py 走 pip 网络即可tools/dlmodels.sh需要系统里先装好 aria2把底模拉到assets/pretrained等目录后再启动python infer-web.py --port 7865 # 默认端口就是 7865不是 7860 python infer-web.py --port 7865 --dml # AMD 用户加上 --dml浏览器打开http://localhost:7865能看到模型推理 / 训练 / ckpt处理等标签页就成功了。过来人提醒脚本默认 Python 3.8见run.sh、venv.sh版本别乱升级依赖链是按 3.8 配的。 先用现成音色转换出第一段音频启动界面进模型推理标签页流程就四步推理音色下拉框选一个模型。如果下拉是空的说明assets/weights里还没有任何.pth小模型——先用上面的脚本把预训练底模下下来或在ckpt处理页从logs下提取一个填入待处理音频的路径或指定特征检索库.index路径选音高提取算法默认 rmvpe 就够各算法差异见文末速记卡点转换右下角音频组件里直接试听、下载两个最影响听感的滑块默认值先用着检索特征占比 index_rate默认 0.75越接近 1音色越像训练时的目标音色越偏离你原音频的演绎细节保护参数 protect默认 0.33保护清辅音和呼吸声拉满 0.5 等于关闭如果输出有电音撕裂把它调小一点变调参数按半音计0 保持原音高男声转女声常见的做法是 -12 或 -10 起步再微调。 喂 10 分钟数据训练出自己的音色模型数据准备找一个文件夹放目标人声 10–30 分钟尽量干净、无伴奏、无大段静音。训练页step2a会自动遍历该文件夹下所有能解码的音频做切片和归一化你不用自己预处理。训练页配置step1实验名自定义所有产物都进logs/实验名/目标采样率默认 40kv2 支持 32k/40k/48kv1 只有 40k/48k32k 仅 v2模型版本默认 v2是否带音高指导唱歌必须开预训练底模路径会随版本和采样率自动切换一般不用动然后点一键训练它依次跑处理数据 → 提取音高和特征 → 训练模型 → 训练特征索引四步全绿即结束。想分步验证就分别点处理数据特征提取训练模型训练特征索引。训练设置的默认值保存频率 5、总轮数 20、batch_size 按显存自动算对小数据集是合理起点小数据可以把缓存至显存设为是来提速。训练完成后大文件 checkpointG_轮数.pth留在logs/实验名/里但推理界面只认assets/weights/下的小模型。去ckpt处理页把 logs 下的 checkpoint 填进模型提取点提取即可以后想省事训练时把是否在每次保存时间点将最终小模型保存至weights文件夹设为是就不用手动提取了。过来人提醒换采样率不能在旧实验上续训起一个新实验名从头练。 卡点了按阶段对号入座启动阶段界面打不开先确认终端里的实际端口再试python infer-web.py --port 7861换个端口仍不行就查防火墙。音色下拉为空九成是没下底模或下错了目录。确认assets/pretrained、assets/pretrained_v2下有对应.pth然后在推理页点刷新音色列表和索引路径。音频处理失败/报 ffmpeg 相关错误音频处理依赖系统的 ffmpegffmpeg -version能出版本号才算装好同时保证音频路径里没有中文、空格和特殊符号这两条能排掉大半报错。训练阶段CUDA out of memory第一步把 batch_size 调小或关闭缓存所有训练集至显存再深入一点显存档位参数在 configs/ 的32k.json/40k.json/48k.json里实际生效的是自动复制出来的 configs/inuse/ 目录改动后需要重启 WebUI。特征提取失败 / tensor 尺寸不匹配通常是训练文件夹里混进了坏文件或极短音频。清掉异常文件重新处理数据再走一遍特征提取。推理阶段训完的模型不显示记住那条规则——推理只读assets/weights。把 logs 下对应轮数的G_xxx.pth用ckpt处理 → 模型提取转成小模型再点刷新。索引文件找不到训练特征索引生成的.index会在logs/实验名/下并软链到assets/indices外部索引目录名是outside_index_root推理页下拉会自动检测没有对应索引也能推理只是音色还原度差一些。 进阶玩法批量转换、模型融合与调参批量推理同一标签页下的第二个子页签给一个文件夹或上传多个文件选输出目录默认opt和导出格式wav/flac/mp3/m4a一次转完伴奏人声分离单独的 UVR5 标签页把带伴奏的音频先分离出纯人声是拿到干净训练数据最实用的前置步骤模型融合在ckpt处理页填两个模型路径 A 模型权重0–1得到一个混合音色的新模型适合拿两个相近音色做交叉测试ONNX 导出同一标签页最下方把小模型转成 onnx 用于更轻量的推理部署推理调参速记卡参数默认作用与调整方向index_rate0.75音色相似度 vs 演绎保真度像但死→调低protect0.33防电音撕裂有撕裂→调小没音色感→调大f0up_key0半音数-12 降八度12 升八度音高提取算法rmvpe见下表算法特点rmvpe效果最好微吃 GPU默认首选harvest低音表现好但很慢dio高质量语音 CPU 偏弱时提速pm最快精度低歌声场景可用过来人提醒数据质量比数据量重要。10 分钟干净人声胜过 1 小时带噪音的音频先分离、去静音、挑片段再进训练。✅ 下一步行动清单环境已通assets/pretrained*底模齐全界面能在 7865 端口打开用现成音色转出第一段音频动手拖过 index_rate 和 protect听出区别准备 10 分钟干净人声 → 一键训练 → ckpt 提取 → 推理页刷新完成从数据到音色闭环有余力再试批量推理、模型融合、onnx 导出常用入口推理入口 infer-web.py、训练与推理核心代码 infer/、采样率配置 configs/、中文常见问题 docs/cn/faq.mdWebUI 里也内置了同一份 FAQ 标签页。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考