GPT-SoVITS 新手教程:1分钟语音数据语音克隆全流程 📅 发布时间:2026/8/30 14:29:11 👁 浏览次数: GPT-SoVITS 新手教程1分钟语音数据语音克隆全流程【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款开源的少样本语音克隆与文本转语音工具5秒参考音频即可零样本出结果1分钟录音就能微调出专属音色模型支持中、英、日、韩、粤五种语言的跨语言合成。适合想快速搭建个人音色的内容创作者、学生和开发者。三步启动 GPT-SoVITS WebUI 界面 最短路径就两条命令装依赖、开界面。仓库整体只分模型核心、工具集、配置三大块装完开箱即用。克隆代码Windows 用户可直接下载官方整合包解压后双击go-webui.bat启动跳过下面所有步骤git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS一条命令装好依赖和预训练模型。--device选硬件环境NVIDIA 显卡选 CU126 或 CU128纯 CPU 选 CPUmacOS 选 MPSbash install.sh --device CU128 --source HF模型下载不稳定时把--source换成HF-Mirror或ModelScope重跑一次即可。启动主界面然后浏览器打开127.0.0.1:9874python webui.py界面分「0-前置数据集获取」「1-微调训练」「2-推理」三大块右上角可切换界面语言后面所有操作都在这里完成。备选路径机器已装 Docker 的话可跳过安装直接一行拉起来docker compose run --service-ports GPT-SoVITS-CU128准备 GPT-SoVITS 训练数据与 .list 标注格式 最低门槛一个音频文件、一行标注。把目标音色录成一个长音频标注文件为.list格式每行四段、用|分隔项目要求示例音频路径每个小片段的绝对路径D:\data\voice_001.wav说话人任意名称各行保持一致张三语言代码zh / ja / en / ko / yuezh文本内容该片段实际念出的话我在学语音克隆完整一行长这样D:\data\voice_001.wav|张三|zh|我在学语音克隆其实不用自己手写。WebUI 内置了自动化流程上传长音频 →「语音切分」切成小片段 → 可选降噪 → ASR 自动转文字 → 人工校对。数据超过 1 分钟时走一遍列表会自动生成好。三条经验单片段 3–10 秒最合适。太长会混进背景声太短又学不到足够音色特征录音保持单人、音量稳定环境音越少越好转写错误是「效果差」的头号原因ASR 之后务必逐行校对GPT-SoVITS 训练参数选择指南 ⚙️训练分两步S1 训 GPT决定节奏和内容S2 训 SoVITS决定音色和音质。WebUI 里直接填数字不用碰配置文件。真正影响结果的就下面四个参数默认值何时需要改改成多少S1 训练轮数300数据不足 1 分钟或出现复读降到 100–200S1 学习率0.001损失值变 NaN 或剧烈震荡减半到 0.0005S2 训练轮数15合成含糊、有毛刺提到 20–25S2 学习率0.00086声音有金属感、噪声大减半到 0.0004两个补充批大小batch size显存不够就减半6GB 显存通常够用半精度NVIDIA 卡默认开启以省显存保持默认即可训练产物保存在logs目录文件名自带版本号S1、S2 的权重分别存在GPT_weights_v2、SoVITS_weights_v2这类文件夹里推理页可以直接选到。GPT-SoVITS 模型版本选择指南 ️项目提供 V1 到 V4、V2Pro、V2ProPlus 多个版本。不用背版本号对着自己的情况选你的情况推荐版本理由数据不足 3 分钟显存 6–8GBV2容忍中等音质显存开销最低数据干净追求自然音色V4更稳定原生 48k 输出不发闷追求极致效果显存 8GBV2ProPlus效果领先4060 Ti 推理 RTF 约 0.028中文训练、想合成英语或日语V2 / V4跨语言表现都稳定拿不准就先选 V2 把全流程跑通再换 V4 或 V2ProPlus 对比听感。版本切换在 WebUI 主界面顶部的下拉框不用重装环境。注意 V3/V4 的音色更贴近参考音频本身而 V2 系列更贴合整个训练集的整体风格。GPT-SoVITS 推理合成第一条语音 不训练也能先出效果——零样本功能专门用来试听。主界面右上角的版本选择器选定与训练一致的版本也可以单独开一个推理窗口端口默认 9872python GPT_SoVITS/inference_webui.py填三处上传 5–10 秒参考音频干净、单人、无混响、输入要合成的文本、选择模型版本点「一键合成」几秒后出现播放条零样本结果能接受就用 1 分钟数据微调一版相似度和稳定性会明显再上一层。参考音频是效果关键同一份文本换一段更干净的参考音频听感差异往往比换版本更大。长文本建议分段合成再拼接避免中途卡住浪费等待时间。GPT-SoVITS 常见故障排查 按症状对号入座每类先看两条解法装不上 / 起不来CUDA 版本对不上确认 install.sh 的--device与显卡驱动匹配12.6 驱动选 CU12612.8 选 CU128重装即可模型下载失败或卡死--source换成HF-Mirror或ModelScope重跑跑得慢确认半精度已开启N 卡默认开Docker 部署可换 Lite 镜像减少依赖显存吃紧就降 batch sizeCPU 环境推理本身偏慢M4 芯片 RTF 约 0.526属正常水平效果差不像本人逐行校对文本、保证每段单人录音、换更干净的参考音频重新合成复读、漏字、噪声大减少 S1 轮数并减半学习率V4 效果不佳可回退 V2 再试GPT-SoVITS 扩展资源 docs/cn/README.md中文主文档覆盖安装、训练、推理的完整细节docs/cn/Changelog_CN.md中文版更新日志升级版本前先查这里api_v2.py推理 API 入口想把合成能力接进自己网站或程序时用得上克隆仓库、备好 1 分钟录音半小时内就能拿到第一个微调后的音色。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考