RVC WebUI 30分钟上手:用开源语音克隆训练出你的第一个AI变声模型

RVC WebUI 30分钟上手:用开源语音克隆训练出你的第一个AI变声模型 RVC WebUI 30分钟上手用开源语音克隆训练出你的第一个AI变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI直播里游戏角色开口时你希望它说的就是你的声线。开源项目 Retrieval-based-Voice-Conversion-WebUI下称 RVC WebUI做的事就是这个用几分钟的语音数据训练一个语音克隆模型做出可用的实时 AI 变声效果。它和普通变声器差在哪传统变声器只是调整音高和频率RVC WebUI 用的是检索式特征替换把训练集里的语音特征提前提取好推理时用 top1 检索每次只挑最像的那一段替换你原声音色的特征输出的就是你的话、对方的嘴。特性传统变声器RVC WebUI原理调整音高和频率语音克隆的特征替换效果同一个人、不同音调换成另一个人的音色数据要求无10 分钟左右的音频实时可用高支持简单说它不是调 EQ是换了一张嘴。装环境10分钟跑起来先确认 Python 在 3.8 以上并装好 ffmpegUbuntu 用sudo apt install ffmpegMac 用brew install ffmpeg。然后依次执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI成功的话你会看到目录里有README.md、infer-web.py、assets/这些文件。pip install -r requirements.txt # NVIDIA 显卡 pip install -r requirements-dml.txt # AMD / Intel 显卡成功的话你会看到逐条显示安装成功结尾没有报错。python tools/download_models.py python infer-web.py第一条命令把所有预训练模型下到assets/第二条启动网页界面。成功的话你会看到浏览器自动打开http://localhost:7865页面有模型推理训练等选项卡。实战把一段录音变成你的声音整条主线是训练一个音色模型再用它转换一段音频。准备 10-30 分钟目标音色的音频放进一个新建文件夹源素材是带伴奏的歌曲时先在伴奏人声分离去混响去回声选项卡里用 UVR5 提取人声轨。为什么这么做模型从这一个文件夹里学音色混进的伴奏和噪音它也会一并学会。长音频可以手工切成每段几分钟别放单条特别长的。为什么这么做切短后音高提取更稳处理失败的概率更低。打开训练选项卡在 step1 填实验名如mi-test在0. 填写数据集路径填音频文件夹点1. 训练模型。为什么这么做一键流程会按顺序自动完成音高提取、特征提取和模型训练不用手动跑命令行。模型训练进度条走完后点2. 训练索引。为什么这么做索引保存了训练集的语音特征是后面 top1 检索生效的依据。完成后weights/里会多出一个 60MB 以上的 pthlogs/实验名/里有added_开头的 index 文件。为什么这么做weights 里的 pth 才用于推理和分享logs 里那个几百 MB 的是训练存档。到模型推理选项卡先点刷新音色选模型、选索引音高算法选rmvpeindex_rate保持默认 0.75填入待转换的音频路径点转换。为什么这么做rmvpe 是当前最准确的音高提取算法模型加索引一起用能防止你的原音色漏进结果里。结果输出到opt文件夹播放听一下内容还是你说的话音色已经换成了训练数据里的人。10 分钟量级的数据集按显卡不同大约需要几十分钟训练期间保持电脑开机即可。关键参数速查参数作用推荐值备注total_epoch总训练轮数音质好 100-200底噪大 20-30轮数越高越贴训练集batch_size每卡每轮训练样本数保持默认显存不足时调小f0 提取算法从音频里提旋律rmvpepm 更快harvest 低音好但慢index_rate检索特征占比0.751.0 最防音色泄漏0 为不检索变调结果升/降的半音数012 为升八度训练音频底噪偏大时total_epoch给 20-30 就够调太高只会把噪音一并放大。推理报显存不足时缩小configs/config.py结尾的x_pad、x_query、x_center、x_max。转换出来不像目标音色、还带点自己的声音时把index_rate往 1 调。踩坑清单启动报 ModuleNotFoundError症状启动后控制台提示某个模块找不到。原因依赖没装或装进了别的 Python 环境。解法在当前环境执行pip install -r requirements.txt后重启AMD/Intel 卡改装requirements-dml.txt。ffmpeg error / utf8 error症状处理数据集时报 ffmpeg error 或 utf8 error。原因音频路径里含空格、括号或中文字符。解法把音频挪到纯英文数字路径下重新填写路径。CUDA out of memory症状训练或推理时提示显存不足。原因显存不够。解法训练时调小batch_size推理时缩小configs/config.py结尾的x_pad、x_query、x_center、x_max。推理时看不到训练好的模型症状训练完成后推理选项卡选不到模型。原因没有刷新音色或用错了文件夹里的 pth。解法在推理选项卡点刷新音色推理用weights/下 60MB 以上的 pth不要用 logs 里那个。Connection Error症状网页突然打不开提示 Connection Error。原因把黑色的控制台窗口关掉了。解法重新执行python infer-web.py运行期间保持控制台开着。下一步换一份训练数据再练一个音色模型对比两个模型在不同index_rate下的差别。用tools/infer_batch_rvc.py把整个文件夹的音频批量转换。想搞懂音高是怎么提取的读一读infer/lib/infer_pack/modules/F0Predictor/下的源码。想做直播用的实时变声效果可以另开python gui_v1.py进入实时变声界面。更多问题查 docs/cn/faq.md网页界面的入口源码是 infer-web.py。流程走通你就有了一个能用的变声模型。接下来换一份训练数据再练一遍模型就会变成你教它的那个人。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考