FunASR本地部署教程:三步跑通Windows离线语音转写服务

📅 2026/8/24 21:03:55
FunASR本地部署教程:三步跑通Windows离线语音转写服务
FunASR本地部署教程三步跑通Windows离线语音转写服务【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR会议录音里带客户姓名内部同步里带未发布信息——这类音频没法上传给任何云端转写服务。FunASR本地部署就是为了解决这件事这个由达摩院语音实验室推出的开源语音识别工具包覆盖语音识别ASR、语音活动检测VAD、标点恢复PUNC全链路Windows SDK 2.0版本在纯CPU上就能做中文/英文离线转写无需GPU音频不出机器。性能方面16核CPU服务器可支撑64路并发转写请求实时率RTF即转写1秒音频所耗时间低至0.0076它集成FFmpegwav/mp3/mp4等常见音视频格式可直接转写还支持热词与逆文本规范化ITN扩展。三种日常转写方式先倒着讲——看看服务跑起来之后最常用的三种转写方式再回头部署。单文件转写进入runtime/python/websocket目录用funasr_wss_client.py客户端指向本机10095端口、--mode offline再用--audio_in指定音频wav/mp3/mp4或网络URL均可。两个值得常开的参数--use_itn 1打开数字规范化例如把123转成一百二十三--hotword指定热词文件提升专业术语准确率。用wav.scp批量转写录音文件多时建一个wav.scp清单每行按编号 路径写一条再用--audio_in传入清单路径、--output_dir指定输出目录客户端会逐条处理。零代码网页浏览器直接打开runtime/html5/static/index.html上传文件、点击连接和开始即可适合演示和非技术同事。离线转写服务三步上线第一步克隆源码git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR/runtime/deploy_tools第二步运行一键部署双击funasr-runtime-deploy-offline-cpu-zh.bat按提示做三个选择模型类型1基础转写模型2带时间戳转写模型3热词增强模型服务端口默认10095可自定义工作目录建议选D盘等非系统盘避免权限问题第三步验证服务浏览器打开http://localhost:10095看到状态页即成功也可以在命令行执行curl http://localhost:10095/health预期返回{status:healthy,version:2.0}。机器够不够软硬件环境核对上面三步一次通过可以跳过本节卡住了就先核对下面两张清单。软件依赖操作系统Windows 10/1164位专业版优先运行时.NET Framework 4.8 或更高版本容器Docker Desktop for Windows并启用WSL2后端⚠️ Docker是在轻量虚拟机里跑服务的工具WSL2是Windows的Linux兼容层。家庭版系统需先开启WSL2功能步骤见微软官方文档部署时若报 docker: command not found说明Docker Desktop尚未安装装好后重启电脑再试。硬件参考部署档位CPU内存并发上限适合谁基础档4核8GB32路个人/小团队标准档16核32GB64路部门级应用企业档64核128GB200路大规模集群一段音频进服务后经历了什么一段音频不靠单个模型完成识别服务内部依次走四步先由语音端点检测VAD切出人声、丢掉静音与背景噪音接着声学模型Paraformer解码输出文本流然后标点预测补上停顿、句号和问号最后**逆文本规范化ITN**把结果整理成标准可读形式。语言模型和热词也在解码阶段参与进来——这正是--hotword参数生效的位置。调优与行业模型替换线程数经验公式是解码线程≈CPU核心数÷2、IO线程≈核心数÷4例如16核机器在部署脚本后追加update --decode_thread_num 8 --io_thread_num 4超长音频超过1小时的录音追加--max_single_audio_length 3600启用分片行业模型用update命令替换如医疗damo/speech_paraformer-large_asr_nat-zh-cn-16k-medical-vocab5000-pytorch、金融damo/speech_paraformer-large_asr_nat-zh-cn-16k-financial-vocab8404-pytorch 超过1小时的超长音频务必先开启分片再转写否则处理过程可能中途失败。三类高频问题排查端口冲突日志出现 port is already allocated 时用netstat -ano | findstr :10095找到占端口的进程ID再执行taskkill /PID 进程ID /F强制结束重新部署。转写准确率一般三招——①到model_zoo/modelscope_models.md查看并更换更新的模型②在workspace/hotwords.txt按热词 权重逐行添加行业词汇③用Audacity等工具先把音频预处理为16kHz采样率。防火墙拦截局域网内其他设备连不上服务时执行netsh advfirewall firewall add rule nameFunASR dirin actionallow protocolTCP localport10095添加入站规则放行10095端口。服务日常运维在funasr-runtime-deploy-offline-cpu-zh.bat后追加参数即可完成日常管理start启动、stop停止、restart重启、status查看状态。排查问题先看workspace/logs目录下的日志文件CPU与内存占用可挂Windows性能监视器跟踪更细节的内容参考runtime/docs/SDK_advanced_guide_offline.md。语音识别私有化部署适合哪些人数据不出内网的方案尤其适合金融客服质检与合规录音分析、医疗语音电子病历与医患沟通记录、司法庭审录音转写、教育课堂录音转文字与课程字幕生成。完成FunASR本地部署后遇到疑问docs/ 里有详细指南含FAQexamples/ 目录则提供了各场景的现成示例。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考