RVC快速上手:10分钟语音训练AI变声模型的完整部署指南 📅 发布时间:2026/9/2 10:41:56 👁 浏览次数: RVC快速上手10分钟语音训练AI变声模型的完整部署指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让视频角色、游戏语音换成自己的专属音色RVCRetrieval-based-Voice-Conversion-WebUI是一个基于VITS的AI变声框架准备约10分钟的低底噪语音就能训练出可复用的变声模型网页里一键完成分离-切分-训练-转换全流程。零基础照做大约1小时跑通训练1个模型再等10~20分钟。它凭什么好用训练数据只要10分钟低底噪语音即可远低于传统方案动辄几小时的要求实时延迟170ms端到端延迟已做到170ms换ASIO声卡设备可压到90ms直播、语音房都够用跨平台、显存门槛低Windows/Linux/MacOS全覆盖A卡、I卡有专用加速路径4G显存起步可训练指标数值说明最少训练数据10分钟越长越好50分钟内效果最稳实时变声延迟170msASIO可达90ms端到端训练显存门槛约4G更低显存只建议跑推理装环境先看这张选路表先确认系统里装了Python 3.8 或更高版本终端输入python --version查看。然后根据系统 × 显卡对号入座系统显卡依赖安装命令WindowsN卡pip install -r requirements.txtWindowsA卡/I卡pip install -r requirements-dml.txtLinuxN卡pip install -r requirements.txtLinuxA卡ROCMpip install -r requirements-amd.txtLinuxI卡IPEXpip install -r requirements-ipex.txtMacOS统一内存芯片sh ./run.sh一条命令装完小贴士Windows 不熟命令行的话直接下载项目提供的RVC-beta.7z整合包解压双击go-web.bat就带完整环境跳过下面所有步骤。通用先装 PyTorch所有显卡第一步都一样先装深度学习框架# 安装PyTorch核心包N/A/I卡都需要 pip install torch torchvision torchaudioWindows RTX 30 系Ampere 架构需要指定 CUDA 版本安装# RTX30系指定cu117版PyTorch pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117Windows按显卡装依赖拿到代码仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI后进入项目目录# N卡装这套 pip install -r requirements.txt # A卡/I卡改成这套 pip install -r requirements-dml.txtLinuxN卡之外的补充A卡ROCM用户装完requirements-amd.txt后个别型号如 RX 6700XT还要补环境变量# 部分A卡需要指定GFX版本并加入render/video用户组 export ROCM_PATH/opt/rocm export HSA_OVERRIDE_GFX_VERSION10.3.0 sudo usermod -aG render $USERNAME sudo usermod -aG video $USERNAMEI卡IPEX用户每次开终端先执行source /opt/intel/oneapi/setvars.sh。下载预训练模型与 FFmpegRVC 要靠预训练模型才能工作。项目自带一键下载脚本会按assets/目录结构自动放好文件hubert 特征模型、v1/v2 预训练权重、UVR5 人声分离模型、RMVPE 音高模型# 一键下载全部预训练模型到assets目录 python tools/download_models.py检查点看到输出All models downloaded!且assets/hubert/、assets/pretrained/下有文件即算成功。再装音频处理工具 FFmpeg系统命令Ubuntu/Debiansudo apt install ffmpegMacOSbrew install ffmpegWindows下载ffmpeg.exe、ffprobe.exe放到项目根目录检查点终端输入ffmpeg -version能打印版本信息。跑起来一条命令与成功标志在项目根目录启动# 启动训练推理WebUI python infer-web.py浏览器会自动打开 Gradio 网页。看到模型训练UVR5人声提取推理等标签页并且左侧已列出模型/设备信息即算成功。实时变声模式单独启动Windows 双击go-realtime-gui.bat其他系统执行python gui_v1.py。核心链路从录音到成品音色准备录音录 10~50 分钟人声要求同一人、底噪低、清晰建议 WAV 格式。检查点音频总时长 ≥10 分钟。人声分离把歌曲/带背景音的录音丢进 UVR5 人声提取标签页选出人声文件。检查点输出目录出现纯人声的 wav 文件。切分与训练切分工具按 3.7 秒左右把长音频切成短段然后在模型训练标签页选数据集、采样率V2 选 40k和版本点一键训练。检查点控制台依次出现数据集处理、F0 提取、特征提取日志无红字报错。生成索引训练结束自动建索引卡住就手动点训练索引按钮。检查点logs/实验名/下出现added_*.index文件。转换试听在推理标签页选刚训练的音色填入原唱/任意音频转换。检查点output/目录出现变声后的 wav播放音色已替换。分享模型时给assets/weights/下 60MB 的 .pth 文件即可。避坑手册FFmpeg error / utf8 error现象预处理阶段报 ffmpeg 或编码错误。 原因音频路径带空格、括号或中文路径写 filelist 失败。 解法把音频挪到简短的英文路径下重试。CUDA out of memory现象训练或推理中途崩掉。 原因显存不够4G 以下风险高。 解法调小 batch_size推理端改 configs/config.py 里的x_pad、x_query、x_center、x_max四个参数数值越小越省显存。训练完没有索引文件现象日志显示训练完成却没有added_*.index。 解法点一次训练索引按钮手动生成训练集太大时先减小规模。不知道分享哪个文件现象把logs/下几百 MB 的 pth 发给别人对方推理报错。 解法分享assets/weights/下 60MB 的 pthlogs 里的 pth 是实验状态不是成品。Connection Error / Expecting value现象浏览器打不开界面或弹 JSON 解析错误。 解法确认黑色控制台窗口没被关掉关闭系统代理客户端、服务端代理都要关。收尾清单代码仓库 依赖 预训练模型 FFmpeg四样齐了才能启动启动成功标志 浏览器出现 Gradio 界面跑通顺序 分离 → 切分 → 训练 → 索引 → 推理。参考资料常见问题docs/cn/faq.md更新日志docs/cn/Changelog_CN.md推理参数配置configs/config.py批量推理脚本tools/infer_batch_rvc.pyAPI 接口api_240604.py拿一段自己的录音从分离做到推理走一遍今天就能听到第一个属于你的变声效果。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考