OpenVoice 即时语音克隆快速教程:几秒音频 3 步跑通,附避坑清单 📅 发布时间:2026/9/11 7:16:42 👁 浏览次数: OpenVoice 即时语音克隆快速教程几秒音频 3 步跑通附避坑清单【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型上传几秒干净人声作为参考音频即可让任意文本用这个人的音色朗读支持跨语言零样本克隆参考音频和输出文本可以是不同语言。V1 与 V2 均为 MIT 协议商用免费。本地部署需 GPU显存 4GB 起步没有硬件可直接用官方在线服务零安装。它是怎么工作的语音克隆原理 30 秒版数据流分三段输入——文本 风格参数情感、语调、节奏进基础 TTS 模型生成语音的底层模型同时参考音频进音色提取器把音频压成音色特征向量的部件中间环节——音色转换模块把合成语音的音色特征替换成参考人的风格参数原样保留输出——一段像那个人的声音但情感和节奏由你指定。两种跑法在线零安装到本地部署命令在线体验3 步跑通零安装在 Workshop 创建一个 Bot设置里开启 Voice (TTS)在 Widget Center 的 TTS 分类挑一个基础音色试听语言入口共 9 个英式英语、美式英语、中文、日语、韩语、西班牙语、法语等用 voice cloning 上传几秒参考音频、输入要朗读的文本几秒后拿到同音色结果。参考音频本身可以是任意语言。本地部署Linux一个命令块conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完把官方权重解压V1 放到checkpoints目录V2 放到checkpoints_v2目录V2 还要按 docs/USAGE.md 的 V2 章节补装 MeloTTS 相关组件。然后启动本地 Gradio 页面浏览器里操作的 Web 界面python -m openvoice_app --share边界一览语音克隆能做与不能做能做不能做 替代方案上传几秒干净人声即可克隆音色生成同音色语音只克隆音色不克隆情感、口音想换这些得换基础 TTS 模型换参考音频没用音色与风格解耦情感、语调、节奏可单独调无法克隆参考人的情感表达这些由风格参数和基础 TTS 模型控制V2 原生支持英、西、法、中、日、韩 6 种语言可跨语言零样本克隆基础 TTS 模型不支持的语言无法直接输出需换支持该语言的基础 TTS 模型参考音频可以是任意语言参考音频必须干净无背景噪音、单人说话、时长别太短不达标就换一段干净参考音频避坑速查本地部署常见问题生成的声音不像、音质差参考音频带背景噪音、多人同说、太短或有长静音段。换几秒干净单人参考音频并确认没复用旧文件名而残留processed缓存目录。启动报找不到模型权重没解压到指定目录。V1 解压到checkpointsV2 解压到checkpoints_v2。首次运行卡在下载openvoice/se_extractor.py 里的 silero-vad 组件首次调用会自动联网下载。断网环境手动下载该包并解压到~/.cache/torch/hub/对应目录。V2 提示缺依赖除主包外还需要 MeloTTS 相关组件。按 docs/USAGE.md 的 V2 章节安装 MeloTTS 并执行 unidic 下载。没有 GPU 或显存小于 4GB本地推理跑不动。改用官方在线服务或换带显卡的机器部署。用在哪4 个当天可接的场景 视频配音替换解说员音色不用重录节奏和情感保持不动 有声内容与自媒体同一音色批量产出多语言朗读适合播客 语音助手让智能设备用熟悉的声音回应 多语言学习同一位人用不同语言读同一段文本方便对比发音与语调要求是只克隆音色、风格可调且能提供几秒干净参考音频OpenVoice 当天就能接进产品期望连参考人的情感和口音一起克隆、或没有 GPU 还要稳定批处理它不达标。MIT 协议商用免费适合先做产品验证再谈规模化。延伸阅读使用文档 docs/USAGE.md、常见问题 docs/QA.md、核心源码目录 openvoice/。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考