GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音 📅 发布时间:2026/9/7 17:12:03 👁 浏览次数: GPT-SoVITS1 分钟录音完成语音克隆微调原生输出 48kHz 高清语音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本语音克隆项目5 秒参考音频即可零样本合成人声1 分钟录音微调后音色相似度显著提升。v4 版本直接输出 48kHz 音频支持中、英、日、韩、粤五种语言v2ProPlus 在 RTX 4090 上 RTF 低至 0.014。适合想给自己录播、给视频换配音、翻新旧音频的创作者和开发者。先看效果谁在什么场景下用它短视频/播客口播创作者录 1 分钟自己的声音做一次微调之后口播脚本直接交给模型生成48k 成品交付前不用再跑升采样。跨语言配音用中文素材训好一个音色推理时把文本切到日语、韩语或英语同一个声音读多语言内容配音成本从找配音员降到改文本。旧音频翻新影视二创和配音修复时用 WebUI 内置的 UVR5 人声分离、自动切分和 ASR 标注把老素材整理成训练集再合成一条干净的替代配音。安装与启动环境门槛不高conda Python 3.10N 卡走 CUDA 12.6/12.8也兼容 ROCm、MPS 和纯 CPU。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF参数这样选--device按硬件取 CU126/CU128/ROCM/MPS/CPUN 卡按你装好的 CUDA 版本选。--source取 HF/HF-Mirror/ModelScope国内网络建议 ModelScope下载更稳。想顺带下人声分离权重就加--download-uvr5。装完后确认 GPT_SoVITS/pretrained_models/ 下有gsv-v4-pretrained/s2Gv4.pth与vocoder.pthv4 推理靠这两个文件。如何完成第一次语音克隆最小闭环三步启动运行python webui.py浏览器打开http://127.0.0.1:9874进入推理页面。填参数模型下拉框选 v4上传一段 5 秒左右、无背景音的参考音频选择目标语言并输入待合成文本。合成试听点击合成等待生成试听输出。5 秒参考音频就能零样本克隆音色整条链路是否跑通以这一步为准。原理速览只讲三个关键点48k 干净音质来自整数倍上采样v4 声码器的上采样链全是整数倍GPT_SoVITS/configs/s2v2ProPlus.json 中upsample_rates为 10×8×2×2×2从根上消除了 v3 非整数倍上采样引入的金属音BigVGAN 直接产出 48k取代 v3 的 24k 输出。两段式分工 更大预训练语料GPT 部分负责语义与韵律SoVITS 部分负责声学细节预训练语料从 2k 小时扩到 5k 小时所以 1 分钟数据的少样本效果明显好于零样本。半精度默认开启GPT_SoVITS/configs/tts_infer.yaml 里is_half在较新显卡上默认 true推理更快、显存占用更低。进阶调优按情况选参数你的情况怎么选训练集音质干净、追求保真模型下拉框选 v4音色保真、高频最干净训练集音质一般、怕翻车改选 v2Pro 系列官方口径音质接近 v4硬件占用和速度等同 v2更稳显卡较新SM 6.1 以上保持is_half半精度开启推理更快显存吃紧报 OOM关闭半精度改 FP32 跑或换更大显存的卡纯 CPU 无 GPU用 GPT_SoVITS/export_torch_script.py 导出优化模型再推理长文本分段合成参考音频保持 5 秒左右常见问题速查音色下拉框为空→ 预训练模型缺失或放错目录 → 检查 GPT_SoVITS/pretrained_models/ 是否含对应版本的.pth/.ckpt文件。提示未找到显卡、自动退回 CPU→ 驱动或 CUDA 缺失 → 装好 N 卡驱动或显式指定--device CPU接受 CPU 速度。合成有金属音→ 还在用 v3 权重或非整数倍上采样配置 → 换 v4 并重新下载vocoder.pth。v3/v4 训练效果不如 v2→ v3/v4 对训练数据质量挑剔 → 先做分离降噪或改用 v2Pro 系列。Mac 上训出的模型质量偏低→ 已知现象 → 官方建议 Mac 用户用 CPU 模式训练。显存溢出→ 显存不足 → 关闭半精度或换更大显存的卡CPU 训练只建议少量数据试跑。下一步先用 5 秒参考音频跑通零样本合成确认链路无误再准备 1 分钟干净人声做微调对比零样本与微调的相似度差异。升级版本前扫一眼 docs/en/Changelog_EN.md确认你的权重和配置仍然兼容。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考