如何用免费的 OpenVoice 五分钟克隆出任意声音?一份即时语音克隆完整指南 📅 发布时间:2026/9/1 11:14:41 👁 浏览次数: 如何用免费的 OpenVoice 五分钟克隆出任意声音一份即时语音克隆完整指南【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型MIT 许可证。给它几秒参考语音写一句话它就还你一段那个人读出来的声音情感、口音、节奏还能单独调。跟着走一遍你能从零跑通一次完整克隆。 想给播客换个嗓子又不想重录想象一下播客剪辑到一半你突然觉得主播的嗓子不合适。重录麻烦。请配音贵。最省事的办法就是克隆一个声音。OpenVoice 的卖点正是这个给它一段 5 到 15 秒的语音它就能让那个人替你读任意你想写的文字而且你不用会写代码。效果拿去直接做内容都够格。 60 秒看懂 OpenVoice 语音克隆原理可以把它理解成给别人的嘴贴一张音色贴纸。OpenVoice 先用一个基础 TTS 模型按你指定的语言、情感和口音生成一段语音再让音色提取器从你的参考音频里抽出音色指纹贴到这段语音上。出来的就是节奏一样、但完全换了一个嗓子的声音。 5 分钟跑通第一次语音克隆第 1 步准备环境和代码建一个 Python 3.9 环境把项目拉进来装好依赖。conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .第 2 步拿模型权重把检查点文件下载后解压到项目根目录的 checkpoints 文件夹官方地址在 docs/USAGE.md 里。第 3 步备一段参考语音录 5 到 15 秒单人说话没有背景音乐越干净越好。第 4 步一行命令打开本地网页界面python -m openvoice_app --share第 5 步浏览器打开页面上传参考音频、输入文字、点生成。你听到的就是克隆结果——第一次运行要加载模型耐心等几分钟。不想折腾环境平台上有现成的部署服务进入工作坊、创建一个机器人、用语音克隆创建声音三步搞定。 三个值得试的方向跑通第一次克隆之后别急着收工下面三个方向最值得玩。声音风格微调→ 情感、口音、节奏分开控制同一个声音读出不同气质 → 看 demo_part1.ipynb改几个参数就行。跨语言克隆→ 参考语音说一种语言输出语音说另一种 → 看 demo_part2.ipynb换基础说话人的语言。V2 原生多语言→ 中英日韩等六种语言音质更好 → 看 demo_part3.ipynb换成 V2 权重即可。⚖️ 版本怎么选你的情况选哪个版本为什么要克隆到没见过的语言如德语V1零样本跨语言语言组合不限只用六种主流语言、要更好音质V2原生多语言训练音质更好只想先玩玩、不想装环境都行平台上先试部署好的服务新手选 V2 更稳音质好六种语言覆盖绝大多数场景需要冷门语言再回头看 V1。 效果不对先看这克隆的声音不像本人→ 参考语音太短或有背景噪音 → 重录一段 5 到 15 秒的干净单人语音。生成的语音发闷、有杂音→ 参考音频采样率偏低或版本旧 → 换 16kHz 以上录音改用 V2 权重。读外语时腔调奇怪→ 基础说话人模型和目标语言不匹配 → 换对应语言的基础模型或用 V2 原生支持。首次运行报 VAD 模型下载错误→ 网络访问不了外部模型 → 按 docs/QA.md 的说明手动下载并放置模型文件。下一步环境装好的话先用本地界面把自己的声音克隆一遍感受最直接。想更进一步就去平台的 TTS 小部件中心挑个基础声音模型直接用。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考