Fun-ASR Nano模型完全指南800M参数下的中文、英文、日文语音识别终极解决方案【免费下载链接】Fun-ASROpen-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.项目地址: https://gitcode.com/gh_mirrors/fu/Fun-ASRFun-ASR Nano是通义实验室推出的端到端语音识别模型家族中的轻量级明星产品仅用800M参数就实现了卓越的多语言语音识别能力。这款模型特别针对中文、英文和日文进行了深度优化同时支持7种中文方言和26种地域口音为开发者和企业提供了高效、精准的语音识别解决方案。为什么选择Fun-ASR Nano在当今AI语音识别领域大多数模型要么体积庞大、部署困难要么功能单一、无法满足多语言需求。Fun-ASR Nano以其800M参数的紧凑设计在保持高性能的同时显著降低了部署门槛。无论您是个人开发者还是企业用户都能轻松将其集成到各种应用中。核心优势亮点 ✨多语言支持原生支持中文、英文、日文三大主流语言方言覆盖支持吴语、粤语、闽语等7种中文方言地域口音涵盖河南、四川、广东等26个地区口音高效部署支持CPU/GPU边缘部署资源占用低高精度识别在远场高噪声环境下仍能达到93%准确率快速开始5分钟上手体验 环境安装步骤安装Fun-ASR Nano非常简单只需几个命令即可完成git clone https://gitcode.com/gh_mirrors/fu/Fun-ASR cd Fun-ASR pip install -r requirements.txt基础推理示例在examples/quickstart.py中您可以看到最简单的使用方式from funasr import AutoModel model AutoModel( modelFunAudioLLM/Fun-ASR-Nano-2512, trust_remote_codeTrue, remote_code./model.py, devicecuda:0, hubhf ) result model.generate( input[audio.wav], language中文, hotwords[关键词1, 关键词2] ) print(result[0][text])三大使用场景详解 1. 离线批量转录最高效对于需要处理大量音频文件的场景Fun-ASR Nano提供了vLLM引擎支持相比传统PyTorch推理提升16倍速度在examples/vllm_batch.py中可以看到具体实现from funasr.auto.auto_model_vllm import AutoModelVLLM model AutoModelVLLM( modelFunAudioLLM/Fun-ASR-Nano-2512, tensor_parallel_size2, # 多GPU支持 gpu_memory_utilization0.8 ) # 批量处理多个音频文件 results model.generate( [audio1.wav, audio2.wav, audio3.wav], language中文 )2. 实时流式识别最灵活Fun-ASR Nano支持实时语音识别适合会议转录、实时字幕等场景。examples/streaming_sdk.py展示了流式处理的能力from funasr.models.fun_asr_nano.inference_vllm_streaming import FunASRNanoStreamingVLLM engine FunASRNanoStreamingVLLM.from_pretrained( modelFunAudioLLM/Fun-ASR-Nano-2512, chunk_ms720 # 720ms的音频块 ) # 实时处理音频流 for result in engine.streaming_generate(audio.wav, language中文): print(f实时结果: {result[fixed_text]})3. CPU边缘部署最经济对于没有GPU的环境Fun-ASR Nano支持通过llama.cpp在CPU上运行模型大小最小仅需484MB在runtime/llama.cpp/目录中提供了完整的部署方案# 下载模型 bash runtime/llama.cpp/download-funasr-model.sh nano ./gguf # 运行识别 llama-funasr-cli --enc ./gguf/funasr-encoder-f16.gguf \ -m ./gguf/qwen3-0.6b-q8_0.gguf \ -a audio.wav \ --vad ./gguf/fsmn-vad.gguf性能对比为何Fun-ASR Nano脱颖而出Fun-ASR Nano在多项基准测试中表现优异特别是在中文识别场景下公开数据集性能对比从上图可以看出Fun-ASR Nano在多个中文测试集上均表现出色AIShell1词错误率仅1.80%Fleurs-zh词错误率仅2.56%WenetSpeech Meeting词错误率6.60%行业数据集表现在行业实际应用中Fun-ASR Nano同样表现卓越远场识别词错误率5.79%相比Whisper-large-v3的22.21%有显著优势方言识别词错误率28.18%在同类模型中表现最佳歌词识别在音乐背景下的歌词识别准确率达到行业领先水平高级功能超越基础语音识别 说话人分离功能Fun-ASR Nano可以与CAM模型结合实现说话人分离功能。在examples/speaker_diarization.py中可以看到完整示例model AutoModel( modelFunAudioLLM/Fun-ASR-Nano-2512, vad_modelfsmn-vad, spk_modelcam, punc_modelct-punc, devicecuda:0 ) # 输出带说话人标签的逐句结果 for sent in result[0][sentence_info]: print(f说话人 {sent[spk]}: {sent[sentence]})热词增强识别Fun-ASR Nano支持热词hotwords功能可以显著提升特定词汇的识别准确率result model.generate( input[audio.wav], hotwords[张三, 北京, 会议], language中文 )批量处理优化对于长音频文件可以使用batch_size_s参数进行优化提升GPU利用率result model.generate( input[long_audio.wav], batch_size_s120, # 每批处理约120秒音频 language中文 )模型微调定制您的专属模型 Fun-ASR Nano支持模型微调您可以根据特定场景需求定制模型。详细指南请参考docs/finetune.md文档。微调基本步骤准备训练数据按照指定格式准备音频和文本对配置训练参数调整学习率、批次大小等超参数开始训练使用提供的训练脚本开始微调模型评估在验证集上评估微调效果部署方案从开发到生产 方案一WebSocket实时服务Fun-ASR Nano提供了完整的WebSocket服务方案适合生产环境部署# 启动服务 python serve_realtime_ws.py --port 10095 --language 中文 --tensor-parallel-size 2 # 客户端连接 python client_python.py --server ws://localhost:10095 --mic方案二Docker容器化部署您可以将Fun-ASR Nano打包为Docker镜像实现一键部署FROM pytorch/pytorch:2.0.1-cuda11.7-cudnn8-runtime WORKDIR /app COPY . . RUN pip install -r requirements.txt EXPOSE 8000 CMD [python, serve_realtime_ws.py]方案三边缘设备部署对于资源受限的边缘设备可以使用量化后的GGUF格式模型# 下载量化模型 hf download FunAudioLLM/Fun-ASR-Nano-GGUF \ --include q4_0.gguf \ --local-dir ./models # 在树莓派等设备上运行 ./llama-funasr-cli -m ./models/q4_0.gguf -a audio.wav最佳实践与优化技巧 1. 内存优化策略使用batch_size_s参数控制内存使用启用混合精度推理减少显存占用对于长音频先进行VAD分割再处理2. 准确率提升技巧合理设置hotwords提升特定词汇识别率根据音频内容选择正确的language参数启用逆文本归一化ITN提升可读性3. 性能调优建议多GPU环境下使用tensor_parallel_size参数调整gpu_memory_utilization优化显存使用使用vLLM引擎获得最佳吞吐量常见问题解答 ❓Q: Fun-ASR Nano支持哪些语言A: Fun-ASR-Nano-2512支持中文、英文、日文及中文方言Fun-ASR-MLT-Nano-2512支持31种语言。Q: 模型需要多少显存A: 基础推理约需4-6GB显存使用vLLM批量处理时建议8GB以上。Q: 能否在CPU上运行A: 可以通过llama.cpp支持CPU推理量化后模型仅需484MB内存。Q: 如何处理实时音频流A: 使用FunASRNanoStreamingVLLM类支持实时流式处理。Q: 是否支持说话人分离A: 需要配合CAM模型使用Fun-ASR Nano本身不直接输出说话人标签。生态系统与社区支持 Fun-ASR Nano是FunAudioLLM生态系统的一部分与其他优秀项目协同工作FunASR工业级语音识别工具包SenseVoice多语言语音理解模型CosyVoice自然语音生成系统FunClipAI智能视频剪辑工具总结为什么Fun-ASR Nano是您的最佳选择Fun-ASR Nano以其800M参数的轻量设计、卓越的多语言识别能力和灵活的部署方案成为了语音识别领域的一颗新星。无论您是需要处理中文方言的本地化应用还是需要支持多语言的国际化产品Fun-ASR Nano都能提供专业级的解决方案。最重要的是Fun-ASR Nano完全开源您可以自由使用、修改和分发。立即开始您的语音识别之旅体验800M参数带来的强大能力提示更多详细信息和最新更新请参考项目文档和示例代码。祝您使用愉快【免费下载链接】Fun-ASROpen-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.项目地址: https://gitcode.com/gh_mirrors/fu/Fun-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考