DIAMOND技术报告解读:深入理解语音修复模型的创新与突破
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
DIAMOND是一款革命性的语音修复模型,它通过自回归RQ-Transformer处理神经音频编解码器令牌,将受损音频转化为接近录音室质量的44.1 kHz语音。作为一款生成式序列到序列模型,DIAMOND不仅能够去除噪音,更能生成缺失的音频内容,为语音修复领域带来了突破性进展。
核心技术解析:双Transformer架构的创新设计
DIAMOND采用了独特的双Transformer架构,这一设计是其实现高质量语音修复的关键。模型包含两个主要部分:时间Transformer(time-transformer)和深度Transformer(depth-transformer)。
时间Transformer负责对帧序列进行建模,而深度Transformer则处理每个帧内的9个RVQ码本。这种结构恢复了RVQ的因果链,并分布了输出投影,与早期模型通过并行头从单个帧向量中读取所有九个码本的方式形成鲜明对比。
模型的整体参数约为166.6M可训练参数,其中编码器为双向Transformer,包含20层、512维、8个注意力头(63.9M参数);解码器/时间Transformer采用因果自注意力和交叉注意力机制,同样包含20层、512维、8个注意力头(88.7M参数);码本读取/深度Transformer则在帧的9个RVQ码上进行局部自回归,包含4层、384维、6个注意力头(14.0M参数)。
值得注意的是,DIAMOND是完全从零开始训练的,没有使用任何预训练的语音骨干网络,这使得它在同类模型中脱颖而出,成为最强的从零开始训练的语音修复器。
性能表现:质量与内容的平衡
DIAMOND在750个真实受损录音上进行了测试,使用DNSMOS-P.835(原始sig_bak_ovr.onnx)评估感知质量,使用CER(字符错误率)评估内容保留度。测试结果显示,DIAMOND在感知质量上排名第二,仅次于Sidon模型,DNSMOS OVRL得分为3.829,超过了RE-USE、Resemble Enhance、UniSE和VoiceFixer等模型。
在内容保留方面,DIAMOND的CER(中位数)为0.028,虽然略高于RE-USE和输入(受损)音频,但考虑到其作为自回归模型的特性,这一表现已经相当出色。研究表明,自回归解码固有的暴露偏差是导致CER差距的主要原因,而非模型容量限制。
DIAMOND能够改善约88%的音频片段,平均ΔOVRL(整体质量提升)为+0.255,这一提升在听觉上是显著的,即使不使用耳机也能明显感受到。
实际应用:从离线修复到数据集净化
DIAMOND最适合用于离线修复和数据集净化任务。它能够将大量受损录音(如播客、采访、档案和经过有损编解码器处理的用户生成音频)转化为足够干净的素材,用于训练其他语音模型。
在项目的samples目录下,提供了多个修复前后的音频示例,展示了DIAMOND的实际效果:
- example1_degraded.wav → example1_restored.wav:DNSMOS OVRL从2.16提升到3.50(+1.34)
- example2_degraded.wav → example2_restored.wav:DNSMOS OVRL从2.83提升到3.59(+0.76)
- example3_degraded.wav → example3_restored.wav:DNSMOS OVRL从2.56提升到3.65(+1.10)
- example4_degraded.wav → example4_restored.wav:DNSMOS OVRL从3.32提升到3.89(+0.57)
这些示例充分展示了DIAMOND在处理不同程度受损音频时的能力。
使用注意事项:了解模型的局限性
虽然DIAMOND在语音修复方面表现出色,但在使用时仍需注意以下几点:
CER尾部较薄:作为自回归解码器,DIAMOND在处理困难片段时偶尔会出现单词模糊的情况。尽管推理保护措施(如分块解码、重复惩罚)可以降低这种风险,但在内容保真度至关重要的场景下,仍需检查转录文本。
解码是串行的,非实时:DIAMOND需要逐帧处理,每秒音频需要处理86帧,加上深度处理,因此它适用于离线修复,而非实时过滤。
以英语为中心:训练数据主要是英语,其他语言的效果未经测试。
生成而非过滤:编解码器截止频率以上的内容是根据上下文生成的,是合理的推测而非真实恢复。因此,不要将输出视为所说内容的法医证据。
负责任地使用:修复后的语音是合成语音,不要将其呈现为未修改的录音,也不要用它来伪造或错误归因某人的言论。
技术细节:模型训练与实现
DIAMOND的训练数据包含681.5小时的录音室语音,约2.5k名说话者,其中28%为原生宽带音频。模型使用了多种先进技术,包括RMSNorm、可学习的每层RoPE、QK-Norm、LayerScale和GELU FFN等。
音频编解码器采用Descript Audio Codec,支持44.1 kHz采样率、9码本RVQ,86帧/秒。该编解码器约74M参数,在运行时下载并冻结,不参与训练。
模型的输入可以是任何采样率的音频,内部会重采样到24 kHz,输出为44,100 Hz。整个训练过程耗时约63 GPU小时,最终得到发布的检查点。
总结:语音修复的新里程碑
DIAMOND通过创新的双Transformer架构和自回归RQ-Transformer设计,为语音修复领域树立了新的标准。它从零开始训练,却达到了与使用预训练骨干网络的模型相当的性能,证明了其架构设计的优越性。
无论是用于离线语音修复还是大规模数据集净化,DIAMOND都展现出了强大的能力。虽然作为自回归模型存在一些固有的局限性,但其在感知质量和内容保留方面的平衡表现,使其成为语音修复任务的理想选择。
随着技术的不断发展,我们有理由相信DIAMOND及其后续改进版本将在语音处理领域发挥越来越重要的作用,为用户带来更高质量的语音修复体验。
引用与致谢
如果您在研究中使用了这项工作,请引用:
@software{diamond_2026, author = {Almaz Zholdoshbek uulu, Ulanbek Abdurazakov, Denis Pavlov and Nursultan Bakashov}, title = {Diamond: A Sequence-to-Sequence Model for Speech Restoration via an Autoregressive RQ-Transformer over Neural Audio Codec Tokens}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/nineninesix/diamond-1.0}}, note = {Trained from scratch; no pretrained backbone} }DIAMOND的开发基于Descript Audio Codec的冻结令牌空间,训练数据来自LibriTTS-R、Hi-Fi TTS和VCTK等语料库。评估使用了DNSMOS P.835和faster-whisper等工具。
许可证信息
DIAMOND模型及其权重以Apache License 2.0发布。运行时下载的冻结Descript Audio Codec带有其自己的许可证(MIT)。
要开始使用DIAMOND,您可以克隆仓库:https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0,获取完整的模型和示例文件。
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考