DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
DIAMOND是一款强大的AI语音修复模型,它能将受损的音频转化为接近录音室品质的44.1 kHz语音。作为一款序列到序列的生成式模型,DIAMOND采用自回归RQ-Transformer架构,通过神经音频编解码器令牌实现高质量的语音修复,为用户提供了简单而高效的音频修复解决方案。
🌟 DIAMOND的核心优势
🔹 双Transformer读取机制
DIAMOND创新性地采用了"时间Transformer"和"深度Transformer"的双Transformer架构。时间Transformer负责对帧序列进行建模,而紧凑的深度Transformer则处理每个帧内的9个RVQ码本。这种设计恢复了RVQ的因果链,并优化了输出投影,相比早期模型通过并行头从单个帧向量中读取所有九个码本的方式,效率和效果都有显著提升。
🔹 从零开始训练的166.6M参数模型
DIAMOND不依赖任何预训练的语音主干网络,完全从零开始训练,拥有约166.6M的可训练参数。令人印象深刻的是,发布的检查点仅需63 GPU小时的训练时间,展现了模型高效的训练特性。
🔹 44.1 kHz高保真输出
借助冻结的DAC解码器,DIAMOND能够合成全频带音频,8 kHz以上的嘶嘶声和"空气感"不是简单地通过,而是重新生成,确保了输出音频的高保真度和自然度。
🔹 内容测量而非假设
作为生成式修复器,DIAMOND不仅关注音频的清晰度,还注重内容的准确性。除了DNSMOS感知质量评估外,还使用CER(字符错误率)相对于真实转录本进行评估,确保修复后的语音内容准确无误。
🎧 聆听修复效果
DIAMOND能够将严重受损的语音修复到44.1 kHz的高品质。每个音频片段的DNSMOS-P.835 OVRL评分都提升了整整一个点以上,即使不使用耳机也能明显听出差异。项目提供了多个修复前后的音频示例,展示了DIAMOND的强大修复能力:
- 示例1:原始受损音频 samples/example1_degraded.wav,修复后音频 samples/example1_restored.wav,DNSMOS OVRL评分从2.16提升至3.50(+1.34)
- 示例2:原始受损音频 samples/example2_degraded.wav,修复后音频 samples/example2_restored.wav,DNSMOS OVRL评分从2.83提升至3.59(+0.76)
- 示例3:原始受损音频 samples/example3_degraded.wav,修复后音频 samples/example3_restored.wav,DNSMOS OVRL评分从2.56提升至3.65(+1.10)
- 示例4:原始受损音频 samples/example4_degraded.wav,修复后音频 samples/example4_restored.wav,DNSMOS OVRL评分从3.32提升至3.89(+0.57)
📊 模型详细信息
架构组成
- 编码器:双向Transformer,无下采样 - 20层,512维,8个注意力头(63.9M参数)
- 解码器/时间Transformer:因果自注意力 + 交叉注意力 - 20层,512维,8个注意力头(88.7M参数)
- 码本读取/深度Transformer:帧内9个RVQ码的局部自回归 - 4层,384维,6个注意力头(14.0M参数)
技术参数
- 可训练参数:≈ 166.6M(DAC编解码器约74M,在运行时下载且冻结)
- 音频编解码器:Descript Audio Codec - 44.1 kHz,9码本RVQ,86帧/秒
- 输入/输出采样率:任何输入,内部重采样至24 kHz → 44,100 Hz输出
- 训练数据:681.5小时的工作室语音,约2.5k speakers,28%原生宽带
- 支持语言:英语
- 许可证:Apache 2.0
🏆 性能基准测试
在750个真实受损录音上进行的测试显示,DIAMOND在感知质量方面表现优异。DNSMOS-P.835用于评估感知质量,CER(字符错误率)用于评估内容保留。测试结果显示,DIAMOND在六个模型中排名第二,超越了RE-USE等模型,尽管这些模型的训练数据量大约是DIAMOND的四倍。
DIAMOND改善了约88%的音频片段(平均ΔOVRL +0.255),证明了其在语音修复任务上的强大能力。作为自回归系统,DIAMOND在CER指标上表现出竞争力,与另一款自回归系统UniSE达到了相同的平均CER(0.131)。
🚀 如何开始使用DIAMOND
要开始使用DIAMOND语音修复模型,首先需要克隆项目仓库:
git clone https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0项目提供了详细的技术报告 TECH_REPORT.pdf,其中包含了模型的详细架构和实现细节。模型配置文件 diamond.json 定义了编码器、解码器和其他关键组件的参数设置,可帮助用户更好地理解和使用模型。
💡 适用场景与注意事项
理想应用场景
DIAMOND特别适合离线修复和数据集清洗任务,能够将大量受损录音(播客、采访、档案和经过有损编解码器处理的用户生成音频)转换为足够清晰的素材,用于进一步的训练或应用。
使用注意事项
- CER尾部效应:作为自回归解码器,DIAMOND在处理困难片段时偶尔会出现单词模糊。推理保护措施(分块解码、重复惩罚)可以减轻这一问题,但在内容保真度至关重要时,建议检查转录本。
- 非实时解码:解码是串行的,不是实时的。每帧处理一次,每秒音频86帧,加上深度处理,因此DIAMOND适用于离线修复,而非实时过滤。
- 英语优化:训练数据为英语,其他语言未经测试。
- 生成而非过滤:编解码器截止频率以上的内容是根据上下文生成的,是合理的推测而非真实恢复。因此,不要将输出视为所说内容的法医证据。
负责任地使用:修复后的语音是合成语音。不要将其呈现为未经修改的录音,也不要用它来伪造或错误归因某人的言论。
🙏 致谢
DIAMOND基于Descript Audio Codec构建,使用了冻结的令牌空间。训练数据来自LibriTTS-R、Hi-Fi TTS和VCTK等语料库。评估使用了DNSMOS P.835和faster-whisper工具。
📄 许可证
DIAMOND模型及其权重根据Apache License 2.0发布。运行时下载的冻结Descript Audio Codec带有其自己的许可证(MIT)。
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考