OpenVoice 实战笔记:4 步从一段参考音频到即时语音克隆 📅 发布时间:2026/9/1 9:15:43 👁 浏览次数: OpenVoice 实战笔记4 步从一段参考音频到即时语音克隆【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 联合发布的音频基础模型。它的核心能力是即时语音克隆给一段参考语音就能用那个人的音色朗读任意文本。本文把从环境搭建到出结果的完整流程走一遍读完跟着做你能拿到第一份克隆出来的语音。一句话看懂它能做什么可以把它拆成两件事基础 TTS 模型负责开口说话OpenVoice 负责换嗓子。它先从参考音频里把音色抠出来再贴到基础 TTS 的声音上——情绪、节奏、语调照样可控换成别的语言说话也保持同一副嗓子。整个项目是 MIT 协议商用不花钱。️ 它是怎么跑起来的主线很短文字内容和风格参数先进基础 TTS 模型产出带风格的基础语音同时音色提取器分析参考说话人抽出音色特征两路信息在 Encoder、Flow、Decoder 里合流最后解码成音色像参考人、风格由你定的新语音。 从零到出结果分步操作拿到代码与环境git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice conda create -n openvoice python3.9 conda activate openvoice pip install -e .克隆下来后装依赖就一行命令依赖清单在 requirements.txt 里。想跑本地演示的话装完执行python -m openvoice_app --share即可启动 Gradio 界面模型 checkpoint 需要手动下载并解压到checkpoints目录版本对应关系见 docs/USAGE.md。按编号完成核心操作进入 Workshop点击 Create a Bot。左侧 My Bots 列表多出一项你就有了承载这个声音的容器。打开 Widget 中心选中 TTS 分类。列表会按语言、输入类型、输出类型过滤出一批可用的 TTS 模型。点开任意一个 TTS 模型试听。你会听到该音色完整读出一句台词它就是提供基础声音的演员。进入机器人设置页打开 Voice (TTS) 开关点击 Create 上传你的参考语音。Voice List 里新增一条克隆声音机器人开始用你的音色说话。它能用在哪个性化语音助手让助手用你自己的嗓子应答有声内容创作克隆音色整本朗读小说视频配音给自制视频加一句专属旁白语言学习同一副嗓子生成多语种发音新手最容易卡住的点生成语音的口音或情绪和参考人不像OpenVoice 只克隆音色口音和情绪由基础 TTS 模型决定换掉基础模型就能改变。生成音频发糊、有噪点先查参考音频——有没有背景噪音、是否太短、是否混入了多个人声换成干净单人录音基本就解决。安装时 Silero VAD 下载失败机器访问不了 github 时手动下载对应 zip 包解压到torch/hub缓存目录即可。想继续深入安装细节与 V1/V2 用法都写在 docs/USAGE.md 里高频问题和官方答复汇总在 docs/QA.md。想直接调 API 做风格控制或跨语言克隆从 demo_part1.ipynb 和 demo_part2.ipynb 两个示例笔记本入手。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考