RVC语音克隆实战:10分钟录音跑通专属变声模型

RVC语音克隆实战:10分钟录音跑通专属变声模型 RVC语音克隆实战10分钟录音跑通专属变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based Voice Conversion WebUI下称 RVC是一个基于 VITS 架构的开源语音转换框架喂进去 10 到 50 分钟的目标人声录音训完之后任何音频丢进去都会以那个音色重新输出。这篇不按一步步操作写而是从你最可能卡住的五个地方倒推流程——显存、录音、轮数、推理调参、批量与实时——每个点说清楚判断依据跟着做就能独立跑通第一次音色训练。显存只有4G能不能训RVC变声结论4G 是官方认可的底线能训能推低于 4G 的卡3G、2G直接放弃别浪费时间调参。程序启动时会自己读显存做两件事不够 4G 的卡会被判为不可用、推理回落到 CPU显存 4G 及以下的卡会自动切到更保守的推理分块和更小的切片长度这些逻辑都写在 configs/config.py 里你不用管但它决定了下面环境怎么搭。所有命令都在仓库根目录执行。先拉代码并建虚拟环境git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv激活虚拟环境后按硬件装依赖。NVIDIA 卡要先装对应 CUDA 版本的 torch再装对应依赖文件CPU/AMD/Intel 卡直接装 CPU 版python -m pip install -r requirments_cpu_py312.txt # CPU, AMD, Intel python -m pip install -r requirments_cu128_py312.txt # NVIDIA RTX 50 series python -m pip install -r requirments_cu118_py312.txt # NVIDIA pre-50 series底模文件缺一个训练和推理都起不来从官方模型仓库按 README 的命令拉到 assets/ 目录四样缺一不可hubert_base 特征编码器、rmvpe.pt 音高模型、pretrained 和 pretrained_v2 两套底模、以及要解压进 logs/ 的静音样本python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include pretrained/* pretrained_v2/* --local-dir assets hf download lj1995/VoiceConversionWebUI mute.zip --revision main --local-dir . python -m zipfile -e mute.zip logsffmpeg 也别省切分和重采样全靠它Ubuntu 用 apt 装Windows 把 ffmpeg.exe 放进项目根目录。最后启动python webui.py浏览器会自动打开默认 7865 端口的训练网页Windows 用户也可以直接双击 go-webui.bat 走整合包路线该脚本监听 7897 端口。录音准备多少分钟底噪多大能忍数据量决定效果上限这是全流程里最不可逆的一步先想清楚再动手录。官方 FAQ见 docs/cn/faq.md给的区间是 10 到 50 分钟如果录音干净、底噪低、音色统一有辨识度5 到 10 分钟也能训出可用模型。三条录音纪律。环境安静优先底噪会原样进模型训练轮数拉再高也压不下去与其后处理不如重录。语调、语速、情绪要有变化模型靠多样样本覆盖不同发音状态单腔调念出来的模型换个句子就露馅。单条片段控制在几十秒到一两分钟过长的录音在切分内存上是负担——系统内存爆掉的典型解法就是手工把训练音频切短FAQ Q14。一个容易忽视的坑训练集路径不要带空格和中文ffmpeg 读带特殊符号的路径会直接报 ffmpeg errorFAQ Q1。格式统一转 WAV 即可采样率不用纠结预处理阶段会自动重采样到你选的档位。训练轮数设多少爆显存怎么办一键训练会按 数据切分 → 音高与特征提取 → 模型训练 → 索引训练 的顺序自动跑完底层脚本在 train/train.py日志写在 logs/实验名/ 下。值得动的数字只有四个总训练轮数默认 20范围 2 到 1200。训练集有底噪时 20 到 30 轮就停手——训太多模型会把噪音也学进去FAQ Q9数据干净且时长足拉到 200 没问题保存频率默认每 5 轮存一个点别超过 10。间隔小才能逐个试听挑最早达标的那个保存点这是防过拟合最实际的办法每卡 batch_size默认值按显存自动估算约为显存 GB 数的一半8G 卡给 4。这是稳定起步值报 out of memory 就往下调调到 1 还不够那说明卡不够换卡或上云 GPU目标采样率与版本默认 40k 加 v2说话人声够用想要质量上限选 48k 加 v2对应 configs/v2/48k.json 那份配置其余全部保持默认音高提取算法默认 rmvpe效果最好且显存占用小跑歌声怕慢可以换 pm、说话人 id 给 0、底模路径随采样率联动不用管。内存类报错单独说如果训练时出现文件页面错误、内存 error多半是 CPU 多进程开多了把提取音高和处理数据使用的 CPU 进程数默认约为逻辑核数的 2/3拉低即可它和显存 OOM 是两回事。训完音色泄露或有电音索引率怎么调先确认索引建了没有。一键训练结束后如果 logs/实验名/ 下没有 added_ 开头的 .index 文件多半是训练集太大卡住了添加索引那一步重新点一次训练索引按钮就行FAQ Q2。索引决定输出保留多少训练集音色跳过它声音可能好听但相似度打折。切到模型推理页刷新音色、选模型和索引重点调两个滑条检索特征占比index_rate单次推理默认 0.75范围 0 到 1。音色往输入源或底模方向漂官方叫音色泄露就往 1 推代价是音质上限被训练集锁死训练集本身优质且时长足时这个值反而不敏感模型自己不怎么引用外部音色FAQ Q11保护滑条protect默认 0.33专门防清辅音和呼吸声撕裂输出带电音、破音就往上调变调是整数半音12 升八度、-12 降八度。另外记住能拿去分享和推理的是 weights/ 下 60 多 MB 的小模型logs/ 里几百 MB 的大文件是实验状态直接拿去推理会报 key 不存在的错FAQ Q4。批量转换和实时变声还要开网页吗批量不用逐条点。网页的批量推理页签里填输入音频文件夹指定输出文件夹默认 opt导出格式可选 wav、flac、mp3、m4a其余参数和单次推理一致。要脱离网页跑训练时控制台会打印实际执行的命令行照抄即可。实时变声走 realtime_gui.pyWindows 双击 go-realtime_gui.bat。官方口径是端到端延迟 170ms换 ASIO 输入输出设备能压到 90ms——但后者强依赖声卡驱动支持普通 USB 声卡别拿 90ms 当预期。现在打开推理页挑一个保存点模型把那段 10 分钟录音里从没喂给训练集的一段扔进去转换音色对得上整个流程就通了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考