实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告

📅 2026/8/19 18:04:12
实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告
实测数据公开Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU核心结论先行Voxtral-Mini-4B-Realtime-2602-NPU 是 Mistral AI 实时语音转写模型 Voxtral Mini 4B Realtime 2602 在昇腾 910B4 NPU 上的开源部署项目基于 torch_npu 昇腾推理引擎与 transformers ≥ 5.2.0 原生实现「音频 → 文本」全流程。本文公开其真实跑分数据模型加载仅约 5 秒平均生成吞吐量最高 24.7 tok/s转写一段 15.9 秒英文音频最快仅需约 4.17 秒实时率 RTF≈0.26处理速度明显快于音频播放速度为实时字幕、语音助手等场景提供了扎实的性能参考。为什么关心昇腾910B4上的实时语音转写性能Voxtral Mini 4B Realtime 2602 是 Mistral AI 开源的首批原生流式实时语音转写模型之一设计目标是在 500ms 端到端延迟内达到接近离线系统的转写精度支持 13 种语言天然适配实时字幕、会议转写、语音助手等场景。昇腾 910B4 则是国产 AI 推理的主力芯片模型能否在这类芯片上流畅跑通直接决定了国产化部署的可行性。本项目正是为了回答这个问题而诞生完整的部署方案见 README.md核心推理脚本为 inference.pyNPU 兼容补丁见 sitecustomize.py依赖清单见 requirements.txt。下面直接公开昇腾910B4单卡上的实测吞吐量与延迟数据。测试环境一览昇腾910B4 硬件与软件版本所有数据均来自同一套稳定环境保证可复现组件版本 / 配置NPU 硬件Ascend 910B4单卡 64GB HBMCANN8.5.1torch / torch_npu2.9.0 / 2.9.0.post1transformers5.15.0mistral-common1.11.7[audio] 扩展Python3.11.14模型权重bf16约 8.8GB文本 LLM ≈ 3.4B 音频编码器 ≈ 970M如上图npu-smi监控所示Ascend 910 芯片健康状态为 OK推理过程中 HBM 占用仅约 3GB / 64GB温度 40℃ 左右说明 8.8GB 权重的 Voxtral-Mini-4B 在昇腾910B4上运行非常轻松显存余量充足。实测吞吐量Voxtral-Mini-4B 在昇腾NPU上的生成速度吞吐量是衡量实时语音转写模型「每秒钟能吐出多少个 token」的关键指标。本次使用同一段约 15.9 秒英文音频爱迪生留声机经典录音测试两组不同输出长度测试用例max_new_tokens生成 tokens总耗时平均吞吐量用例一20023912.49s19.1 tok/s用例二641034.17s24.7 tok/s从数据可以看出两个规律短输出场景吞吐量更高用例二平均 24.7 tok/s约 40ms/token用例一约 52ms/token输出越长生成阶段注意力计算开销占比越大平均速度会小幅下降这是滑窗注意力模型的正常表现。上图是昇腾NPU上语音转写模型推理的终端日志示例可以看到模型加载、输入音频时长、输出 token 数、单次生成延迟等关键指标都会被清晰打印出来方便复现时逐项核对。实测延迟从模型加载到转写完成需要多久延迟决定了「用户体验」我们拆成两个阶段来看阶段实测耗时模型加载一次性开销约 5.0 – 5.1s用例一转写 239 tokens12.49sRTF≈0.79用例二转写 103 tokens4.17sRTF≈0.26这里的 RTFReal-Time Factor实时率是语音转写最直观的延迟指标RTF 1 表示转写速度快于音频实时播放。用例二 RTF≈0.26意味着 1 秒音频只需约 0.26 秒即可完成转写为流式实时场景留下了充足余量即使输出较长的用例一也达到 RTF≈0.79仍然快于实时播放。此外模型加载约 5 秒属于一次性开销服务启动时完成不影响线上推理延迟。吞吐量与延迟的权衡max_new_tokens 如何影响性能实时语音转写场景常常需要在「响应更快」和「转写更全」之间做取舍实测数据恰好说明了这一点--max-new-tokens控制最大生成 token 数设小如 64响应更快、吞吐更高模型本身支持transcription_delay_ms80–1200ms 及 2400ms档位可在延迟与精度之间灵活权衡流式设计上单条转写文本 token 对应约 80ms 音频配合因果音频编码器 滑窗注意力 LLM理论上可支持近乎无限的流式输入。建议业务方按场景选择实时字幕偏短句优先低延迟、高吞吐会议纪要偏完整转写可接受略长延迟。复现步骤在昇腾910B4上快速跑通性能测试以上数据都可以一键复现git clone https://gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU cd Voxtral-Mini-4B-Realtime-2602-NPU python3 -m venv --system-site-packages venv ./venv/bin/pip install -r requirements.txt ./venv/bin/python inference.py --audio sample_en.wav --max-new-tokens 64运行后终端会打印「生成 N tokens耗时 X.XXs平均 Y.Y tok/s」与本文数据直接对比即可验证。仓库自带sample_en.wav测试音频也可以换成任意 wav/mp3/ogg 文件脚本会自动重采样到 16kHz。上图展示了本项目从收集上下文、模型分析、环境装配到推理验证、经验总结的完整可复现工作流同样适用于其他语音模型在昇腾910B4上的适配。性能解读与优化建议精度选择默认 bf16 即可在昇腾910B4上兼顾速度与精度无需 float32显存余量权重 8.8GB 对 64GB HBM 来说非常宽裕可尝试更大 batch 或更长上下文服务化路径项目已完成 vLLM-Ascend 框架侧适配服务可正常启动待 whisper-causal 注意力上游支持后可获得更高并发吞吐值得持续关注场景匹配短输出场景吞吐更高24.7 tok/s实时字幕类「短句优先」业务最受益。总结昇腾910B4 能否胜任实时语音转写答案是肯定的。实测数据显示Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4单卡上实现了 19.1–24.7 tok/s 的生成吞吐量与 RTF≈0.26 的转写延迟处理速度明显快于音频播放完全满足实时语音转写的性能门槛。如果你正在做国产化 NPU 上的语音 AI 落地这份实测报告与完整代码可以直接作为起点。【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考