DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器

📅 2026/7/20 20:51:22
DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器
DIAMOND语音修复模型从零开始构建的166.6M参数AI音频修复神器【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0DIAMOND是一款强大的AI语音修复模型它能将受损的音频转化为接近录音室品质的44.1 kHz语音。作为一款序列到序列的生成式模型DIAMOND采用自回归RQ-Transformer架构通过神经音频编解码器令牌实现高质量的语音修复为用户提供了简单而高效的音频修复解决方案。 DIAMOND的核心优势 双Transformer读取机制DIAMOND创新性地采用了时间Transformer和深度Transformer的双Transformer架构。时间Transformer负责对帧序列进行建模而紧凑的深度Transformer则处理每个帧内的9个RVQ码本。这种设计恢复了RVQ的因果链并优化了输出投影相比早期模型通过并行头从单个帧向量中读取所有九个码本的方式效率和效果都有显著提升。 从零开始训练的166.6M参数模型DIAMOND不依赖任何预训练的语音主干网络完全从零开始训练拥有约166.6M的可训练参数。令人印象深刻的是发布的检查点仅需63 GPU小时的训练时间展现了模型高效的训练特性。 44.1 kHz高保真输出借助冻结的DAC解码器DIAMOND能够合成全频带音频8 kHz以上的嘶嘶声和空气感不是简单地通过而是重新生成确保了输出音频的高保真度和自然度。 内容测量而非假设作为生成式修复器DIAMOND不仅关注音频的清晰度还注重内容的准确性。除了DNSMOS感知质量评估外还使用CER字符错误率相对于真实转录本进行评估确保修复后的语音内容准确无误。 聆听修复效果DIAMOND能够将严重受损的语音修复到44.1 kHz的高品质。每个音频片段的DNSMOS-P.835 OVRL评分都提升了整整一个点以上即使不使用耳机也能明显听出差异。项目提供了多个修复前后的音频示例展示了DIAMOND的强大修复能力示例1原始受损音频 samples/example1_degraded.wav修复后音频 samples/example1_restored.wavDNSMOS OVRL评分从2.16提升至3.501.34示例2原始受损音频 samples/example2_degraded.wav修复后音频 samples/example2_restored.wavDNSMOS OVRL评分从2.83提升至3.590.76示例3原始受损音频 samples/example3_degraded.wav修复后音频 samples/example3_restored.wavDNSMOS OVRL评分从2.56提升至3.651.10示例4原始受损音频 samples/example4_degraded.wav修复后音频 samples/example4_restored.wavDNSMOS OVRL评分从3.32提升至3.890.57 模型详细信息架构组成编码器双向Transformer无下采样 - 20层512维8个注意力头63.9M参数解码器/时间Transformer因果自注意力 交叉注意力 - 20层512维8个注意力头88.7M参数码本读取/深度Transformer帧内9个RVQ码的局部自回归 - 4层384维6个注意力头14.0M参数技术参数可训练参数≈ 166.6MDAC编解码器约74M在运行时下载且冻结音频编解码器Descript Audio Codec - 44.1 kHz9码本RVQ86帧/秒输入/输出采样率任何输入内部重采样至24 kHz → 44,100 Hz输出训练数据681.5小时的工作室语音约2.5k speakers28%原生宽带支持语言英语许可证Apache 2.0 性能基准测试在750个真实受损录音上进行的测试显示DIAMOND在感知质量方面表现优异。DNSMOS-P.835用于评估感知质量CER字符错误率用于评估内容保留。测试结果显示DIAMOND在六个模型中排名第二超越了RE-USE等模型尽管这些模型的训练数据量大约是DIAMOND的四倍。DIAMOND改善了约88%的音频片段平均ΔOVRL 0.255证明了其在语音修复任务上的强大能力。作为自回归系统DIAMOND在CER指标上表现出竞争力与另一款自回归系统UniSE达到了相同的平均CER0.131。 如何开始使用DIAMOND要开始使用DIAMOND语音修复模型首先需要克隆项目仓库git clone https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0项目提供了详细的技术报告 TECH_REPORT.pdf其中包含了模型的详细架构和实现细节。模型配置文件 diamond.json 定义了编码器、解码器和其他关键组件的参数设置可帮助用户更好地理解和使用模型。 适用场景与注意事项理想应用场景DIAMOND特别适合离线修复和数据集清洗任务能够将大量受损录音播客、采访、档案和经过有损编解码器处理的用户生成音频转换为足够清晰的素材用于进一步的训练或应用。使用注意事项CER尾部效应作为自回归解码器DIAMOND在处理困难片段时偶尔会出现单词模糊。推理保护措施分块解码、重复惩罚可以减轻这一问题但在内容保真度至关重要时建议检查转录本。非实时解码解码是串行的不是实时的。每帧处理一次每秒音频86帧加上深度处理因此DIAMOND适用于离线修复而非实时过滤。英语优化训练数据为英语其他语言未经测试。生成而非过滤编解码器截止频率以上的内容是根据上下文生成的是合理的推测而非真实恢复。因此不要将输出视为所说内容的法医证据。负责任地使用修复后的语音是合成语音。不要将其呈现为未经修改的录音也不要用它来伪造或错误归因某人的言论。 致谢DIAMOND基于Descript Audio Codec构建使用了冻结的令牌空间。训练数据来自LibriTTS-R、Hi-Fi TTS和VCTK等语料库。评估使用了DNSMOS P.835和faster-whisper工具。 许可证DIAMOND模型及其权重根据Apache License 2.0发布。运行时下载的冻结Descript Audio Codec带有其自己的许可证MIT。【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考