GPT-SoVITS 少样本语音克隆从 0 到 1:1 分钟音频跑通全流程教程 📅 发布时间:2026/8/30 20:48:06 👁 浏览次数: GPT-SoVITS 少样本语音克隆从 0 到 11 分钟音频跑通全流程教程【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款开源的少样本语音克隆与文本转语音TTS工具核卖点是1 分钟语音数据就能训练出高质量 TTS 模型。它把 GPT 的语义建模和 SoVITS 的声码合成结合到一起再配一套可视化 WebUI让你不用写代码就能完成上传音频 → 切片 → 识别 → 训练 → 合成的完整闭环。对内容创作者、开发者和 AI 爱好者来说它的价值在于哪怕你只有一段干净的说话录音也能快速得到一个属于自己的、音色接近的语音合成模型最低门槛就是一台能跑 Python 的电脑有独立显卡效果最佳。先跑起来最短路径出结果想最快看到效果别折腾环境优先选整合包 / 一键脚本这条路。Windows 用户拿到官方整合包解压后双击go-webui.bat就能启动整个 WebUI这是成本最低的一条路。macOS 和 Linux 用户则用一键安装脚本它会帮你装依赖并下载需要的预训练模型只需按显卡情况指定--device# Linux / macOS bash install.sh --device CU128 --source HF脚本跑完后进入项目根目录用一条命令打开主界面python webui.py浏览器会自动打开控制台。至此你已经在浏览器里拥有了一个能调用的 GPT-SoVITS 界面剩下的所有操作都在网页里点。如果你的网络对HF源不稳定把--source换成HF-Mirror或ModelScope再跑一次即可。数据从哪来准备一段干净的训练音频模型好不好第一决定因素是训练音频质量而不是参数。建议用一段 30 秒到 1 分钟、单说话人、无背景音乐和无明显噪音的录音采样率 16kHz 以上语气尽量自然。原因很简单切片和识别都是在人声上工作的背景音会污染训练集后续再好的参数也救不回来。如果手上有的是带伴奏的完整录音先用内置的人声分离工具把人声抽出来这一步对应 WebUI 里的 UVR5 功能源码在 tools/uvr5/权重放在tools/uvr5/uvr5_weights。分离得到的纯人声再进入下一步能明显提升训练效果。预处理切片、降噪、自动识别三连进入 WebUI 的训练入口后整个预处理被拆成三个按钮按顺序点即可这也是官方推荐的操作时间线填入音频路径指向你准备好的纯人声文件单个文件或目录都行。切片slice把长音频按静音段切成若干几秒的短片段。切得合理训练才稳定所以这一步别跳过。降噪可选如果录音仍有底噪再跑一次降噪干净源可以略过。ASR 自动识别把每段音频转成文字省去手打标注。中文、英语、日语、韩语、粤语都有对应后端中文默认走 Fun-ASR-Nano源码见 tools/asr/。人工校对识别结果里多音字、专有名词容易错手动改一遍。这一步最影响最终发音准确度值得花几分钟。校对完成后标注文件会自动生成成.list格式每行是音频路径|说话人|语言|文本语言码对应zh / ja / en / ko / yue。这就是后面训练的输入。训练两个轮次默认参数就够用预处理做完切到训练页先训练 GPT 模型再训练 SoVITS 模型两步都是选数据、点开始。对新手轮数和批量用默认值即可重点只调一个显存不够就把批量调小、或开启半精度fp16来省显存而不是一味加轮数——轮数过反而容易过拟合出现复读、漏字。训练速度方面V2Pro 系列在 RTX 4060 Ti 上 RTF 约 0.028、4090 上约 0.014千余字的合成只需几秒到几十秒量级本地跑完全可接受。训练完的产物会落在模型目录推理时会用到记一下路径就行。推理与部署三个场景按需取用只想听效果零样本不用训练。在推理界面上传一段约 5 秒的人声作为参考音频填上参考文本和目标文本点生成即可立刻听到用这个声音说话的效果。这是最快验证项目能力的方式。要高保真复刻少样本用前面训练好的模型。进入推理入口1-GPT-SoVITS-TTS/1C-推理或单独运行python GPT_SoVITS/inference_webui.py选择训练产出的模型参考音频换成你的目标音色片段输入长文本合成。数据越干净、轮次越合适相似度越高。要部署上线项目提供了 Docker 支持。docker-compose.yaml定义了完整版与轻量版Lite不含 ASR 和 UVR5 模型两类服务按显卡选一个跑起来docker compose run --service-ports GPT-SoVITS-CU128如果对外提供 API可以看根目录的 api_v2.py把模型路径指到训练产物即可具体字段以官方文档为准。排错与调优现象 → 原因 → 解法合成声音发闷多出现在旧版本原生 24k 输出上。原因是有损重采样解法是直接用 V4 及以上模型它原生输出 48k 音频。训练时显存不足原因是批量偏大、未开半精度。解法是减小批量、开启 fp16Docker 场景下把is_half设为true同样有效。识别/标注大量错误多是源音频带背景音或多说话人混在一起。解法是回退到人声分离 降噪重切再识别别在校对页硬改。推理速度预期差先确认显卡是否真正被用上。CPU 上 V2Pro 系列 RTF 约 0.5明显偏慢属正常需要速度请切到 GPU 环境。模型下载失败基本是网络问题把安装源从HF切到HF-Mirror或ModelScope重试。下一步可以做什么先用 5 秒参考音频跑一次零样本确认环境没问题再投入时间做完整训练避免在坏环境上空耗。挑 3 段不同语气陈述、疑问、强调的录音各训一版横向对比体会数据质量 参数这件事。想把能力产品化就去读 api_v2.py 和 GPT_SoVITS/inference_cli.py把训练好的模型接到你的服务里参考音频与文本用命令行参数传入即可。以上路径、命令与模型目录均以仓库现状与官方文档为准若版本升级导致目录或参数变化请同步核对 docs/cn/ 下的中文说明。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考