3秒参考音频就能改词换句:VoiceCraft 零样本语音编辑与TTS

3秒参考音频就能改词换句:VoiceCraft 零样本语音编辑与TTS 3秒参考音频就能改词换句VoiceCraft 零样本语音编辑与TTS【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 是一个神经声码器语言模型专攻两件事零样本语音编辑和零样本 TTS。给它几秒参考音频加对应文本就能把录音里指定的词改掉或直接用那个人的声音念一句新话。训练数据是播客、有声书、网络视频这类真实场景语音不是录音棚数据。 它到底能帮你做什么功能输入说明零样本语音编辑原音频 原文本 改后文本替换/修改指定词音色和节奏自然衔接零样本 TTS数秒参考音频 目标文本克隆没听过的人的声音长文本 TTS长文本 参考音频Gradio 界面里分段拼接生成训练与微调自己的音频转写提供数据准备和训练脚本一句话概括同一个模型、同一套推理代码既能当音频 PS用也能当声音克隆器用。另外提醒一下README 末尾明确写了不能未经本人同意编辑他人语音商用前先看 LICENSE-CODE 和 LICENSE-MODEL。 最值得看的设计一个模型同时干编辑和 TTS很多方案里改词编辑和念新句TTS是两套流程VoiceCraft 把它们统一成了同一个训练目标token 填充infilling。音频先被 Encodec 编码成 4 个 codebook 的离散 token 序列训练时随机挖掉序列中的几段空位让模型根据上下文把空位补回来。补中间空位就是语音编辑从头生成、只留前几秒参考音频做提示就是 TTS——机制完全一样只是空位挖在哪不同。这套逻辑集中在 models/voicecraft.py 的prepare_mask_intervals和rearrange两个函数里值得逐行读。生成阶段每个 token 怎么采样的看这段就明白了def topk_sampling(logits, top_k10, top_p1.0, temperature1.0): if temperature ! 1.0: logits logits / temperature logits top_k_top_p_filtering(logits, top_ktop_k, top_ptop_p) token torch.multinomial(F.softmax(logits, dim-1), num_samples1) return token来自 models/modules/sampling.py 的核心采样逻辑。有个实用细节项目 2025 年 3 月把推理默认采样从 top-p 改成 top-k40编辑和 TTS 质量都明显提升说明这类模型调参时采样策略比换结构更有用。还有一个容易被忽略的工程点切参考音频不是按时间硬切而是先跑 MFA 强制对齐找到词边界再下刀所以克隆的几秒提示片段干净利落不会在词中间断掉。⚖️ 和同类项目比它强在哪维度VoiceCraft早期 VALL-E 类复现传统 TTS 引擎语音编辑原生支持改词后自然衔接以生成为主编辑需自行拼基本不支持训练数据播客/有声书等真实场景语音多为干净数据集录音棚录制克隆所需参考数秒通常更长时间段需专人录制注册上手方式命令行 / Gradio / Docker论文级复现成熟但多闭源换角度说它的护城河不是参数量而是野生数据 编辑和 TTS 共用一套目标。想体验完整流程可以看 inference_speech_editing.ipynb 和 inference_tts.ipynb 两个示例。 怎么开始用克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft按 README 的 Environment setup 一节建 conda 环境注意 MFA 强制对齐依赖是单独安装的直接跑python tts_demo.py不改参数就用仓库自带演示音频结果存到./generated_tts想要界面就pip install -r gradio_requirements.txt后运行python gradio_app.py浏览器打开 127.0.0.1:7860想训自己的数据照着 README 的 Training 一节准备 manifest再看 z_scripts/e830M.sh 和微调脚本 z_scripts/e830M_ft.sh先跑通tts_demo.py听个默认输出再回去读rearrange和insert_mask两段代码半天就能搞清楚编辑和 TTS 是怎么共用一套训练的。跑完顺手改改-co参数试试不同长度的参考音频是理解这个模型最便宜的方式。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考