nemo-nano-codec-22khz-1.89kbps-21.5fps部署指南:从NVIDIA GPU到Jetson设备的全平台支持

📅 2026/8/7 14:10:14
nemo-nano-codec-22khz-1.89kbps-21.5fps部署指南:从NVIDIA GPU到Jetson设备的全平台支持
nemo-nano-codec-22khz-1.89kbps-21.5fps部署指南从NVIDIA GPU到Jetson设备的全平台支持【免费下载链接】nemo-nano-codec-22khz-1.89kbps-21.5fps项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/nemo-nano-codec-22khz-1.89kbps-21.5fpsnemo-nano-codec-22khz-1.89kbps-21.5fps是一款由NVIDIA开发的NeMo NanoCodec神经音频编解码器它利用有限标量量化和对抗训练技术在不同比特率和帧率范围内实现了最先进的音频压缩效果。这款模型支持22050Hz采样率、21.5fps帧率和1.89kbps比特率非常适合需要高效音频压缩的应用场景。 模型概述为什么选择nemo-nano-codec-22khz-1.89kbps-21.5fps NeMo NanoCodec采用全卷积生成器神经网络和三个鉴别器组成的架构生成器包括编码器、向量量化和基于HiFi-GAN的解码器。非因果编码器由五个残差块组成每个块包含三个类似多接收场融合(MRF)模块的残差层。因果解码器基于HiFi-GAN声码器使用与编码器一维卷积步长相反的上采样率。向量量化采用有限标量量化(FSQ)具有8个码本每个码本2016个码嵌入维度为32FSQ级别为[8,7,6,6]。该模型总参数为62M能够在保持高质量音频重建的同时实现高效压缩。 核心特性与优势全平台支持兼容NVIDIA Ampere、Blackwell、Hopper、Lovelace等多种GPU架构以及Jetson设备高效压缩1.89kbps超低比特率下实现高质量音频重建跨语言支持支持105种语言的音频处理易于集成可无缝集成到NVIDIA NeMo 2.0.0框架中商业可用支持商业和非商业用途 系统要求与兼容性硬件要求NeMo NanoCodec经过优化可在以下NVIDIA硬件上运行NVIDIA AmpereNVIDIA BlackwellNVIDIA JetsonNVIDIA HopperNVIDIA LovelaceNVIDIA PascalNVIDIA TuringNVIDIA Volta软件要求操作系统Linux运行时引擎NeMo 2.0.0依赖库librosa、torch、soundfile等具体版本请参见NeMo官方文档 快速开始安装与部署步骤1️⃣ 准备工作环境搭建首先确保您的系统已安装NeMo 2.0.0框架。如果尚未安装可以通过以下命令进行安装pip install nemo-toolkit[all]2.0.02️⃣ 获取模型两种方式任选方式一通过NeMo自动下载推荐NeMo框架支持直接从Hugging Face Hub自动下载预训练模型无需手动下载文件。方式二手动下载模型文件如果需要手动下载模型可以从项目仓库获取以下文件nemo-nano-codec-22khz-1.89kbps-21.5fps.nemo完整模型文件nemo_nano_codec_22khz_1.89kbps_21.5fps.decoder.f16.ggufGGUF格式解码器3️⃣ 克隆项目仓库git clone https://gitcode.com/hf_mirrors/nvidia/nemo-nano-codec-22khz-1.89kbps-21.5fps cd nemo-nano-codec-22khz-1.89kbps-21.5fps 基础使用指南编码与解码使用自动下载的模型进行推理以下代码展示了如何使用NeMo框架自动下载并使用nemo-nano-codec模型进行音频编码和解码import librosa import torch import soundfile as sf from nemo.collections.tts.models import AudioCodecModel path_to_input_audio input.wav # 输入音频路径 path_to_output_audio output.wav # 重建输出音频路径 # 加载音频编解码器模型 nemo_codec_model AudioCodecModel.from_pretrained(nvidia/nemo-nano-codec-22khz-1.89kbps-21.5fps).eval() # 从音频获取离散令牌 audio, _ librosa.load(path_to_input_audio, srnemo_codec_model.sample_rate) device cuda if torch.cuda.is_available() else cpu audio_tensor torch.from_numpy(audio).unsqueeze(dim0).to(device) audio_len torch.tensor([audio_tensor[0].shape[0]]).to(device) encoded_tokens, encoded_len nemo_codec_model.encode(audioaudio_tensor, audio_lenaudio_len) # 从令牌重建音频 reconstructed_audio, _ nemo_codec_model.decode(tokensencoded_tokens, tokens_lenencoded_len) # 保存重建音频 output_audio reconstructed_audio.cpu().numpy().squeeze() sf.write(path_to_output_audio, output_audio, nemo_codec_model.sample_rate)使用手动下载的模型进行推理如果您已手动下载了模型文件可以使用以下代码加载并运行推理import librosa import torch import soundfile as sf from nemo.collections.tts.models import AudioCodecModel codec_path nemo-nano-codec-22khz-1.89kbps-21.5fps.nemo # 模型.nemo检查点路径 path_to_input_audio input.wav # 输入音频路径 path_to_output_audio output.wav # 重建输出音频路径 # 加载音频编解码器模型 nemo_codec_model AudioCodecModel.restore_from(restore_pathcodec_path, map_locationcpu).eval() # 从音频获取离散令牌 audio, _ librosa.load(path_to_input_audio, srnemo_codec_model.sample_rate) device cuda if torch.cuda.is_available() else cpu audio_tensor torch.from_numpy(audio).unsqueeze(dim0).to(device) audio_len torch.tensor([audio_tensor[0].shape[0]]).to(device) encoded_tokens, encoded_len nemo_codec_model.encode(audioaudio_tensor, audio_lenaudio_len) # 从令牌重建音频 reconstructed_audio, _ nemo_codec_model.decode(tokensencoded_tokens, tokens_lenencoded_len) # 保存重建音频 output_audio reconstructed_audio.cpu().numpy().squeeze() sf.write(path_to_output_audio, output_audio, nemo_codec_model.sample_rate) 性能表现nemo-nano-codec-22khz-1.89kbps-21.5fps在多个客观音频质量指标上表现优异以下是在不同测试集上的性能结果数据集Squim MOS (↑)PESQ (↑)Mel Dist. (↓)SECS (↓)CER (↓)MLS4.4272.8370.1500.8542.434DAPS4.6663.1560.1450.8320.601这些结果表明该模型在保持低比特率的同时能够提供高质量的音频重建效果特别适合对带宽敏感的应用场景。 高级应用模型微调如果您需要针对特定数据集微调模型可以参考NeMo的音频编解码器训练教程。需要将CONFIG_FILENAME参数设置为audio_codec_low_frame_rate_22050.yaml配置并将pretrained_model_name设置为audio_codec_low_frame_rate_22khz。⚠️ 注意事项与最佳实践输入音频要求模型仅支持22050Hz单声道音频输入硬件加速虽然模型可以在CPU上运行但强烈建议使用NVIDIA GPU以获得最佳性能内存要求推理时建议至少有8GB内存训练和微调则需要更多资源语言支持模型在105种语言上进行了训练但在某些低频语言上的性能可能会有所下降许可证该模型遵循NVIDIA Open Model License Agreement支持商业和非商业用途 更多资源官方文档NeMo Audio Codec Inference Tutorial研究论文NeMo NanoCodec论文相关模型Magpie TTS与本模型配合使用效果最佳通过本指南您应该能够轻松地在各种NVIDIA平台上部署和使用nemo-nano-codec-22khz-1.89kbps-21.5fps模型享受高效音频压缩带来的便利。如有任何问题或反馈请参考项目的官方文档或联系NVIDIA支持团队。【免费下载链接】nemo-nano-codec-22khz-1.89kbps-21.5fps项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/nemo-nano-codec-22khz-1.89kbps-21.5fps创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考