TMSpeech 使用指南:Windows 离线语音转文字,三步跑起来

📅 2026/8/22 6:46:46
TMSpeech 使用指南:Windows 离线语音转文字,三步跑起来
TMSpeech 使用指南Windows 离线语音转文字三步跑起来【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款免费开源的 Windows 离线语音转文字工具用本地模型把电脑播放的声音实时转成中文字幕断网可用CPU 占用通常不到 5%。本文覆盖获取程序、安装模型、选择音频源与识别器、处理历史记录与常见问题。三个适合用离线语音转文字的场景如果你开会经常走神它能让被突然喊到时瞟一眼字幕就接回话题会后翻历史记录把漏掉的补上如果你看在线课程或没有字幕的视频可以把它当本地字幕生成器声音放出来字幕跟着滚如果你用外文内容练听力装好中英双语模型后可以让识别结果跟着音频逐句对照。和云端语音转文字服务最大的区别是模型就在你本机音频完全不上传声音数据从头到尾不出电脑适合会议纪要这类隐私敏感的内容。三步装好离线转文字工具拿到程序从 Release 页下载最新压缩包解压双击TMSpeech.exe运行没有安装向导也不需要账号想自己构建可以git clone https://gitcode.com/gh_mirrors/tm/TMSpeech拉源码编译。易错点首次运行会自动创建配置文件后面把配置改乱了运行 Release 包附带的重置配置 bat 脚本即可回到默认。装语言模型打开设置→资源标签页点中文模型旁的安装等下载完成。模型是 Zipformer-transducer 系列体积 300MB 级别另有英文和中英双语版本。易错点不装模型识别不会有任何输出这步不能省。第一次跑识别回到主窗口点红色录音按钮默认音频源是系统音频直接播放会议或视频字幕就开始出字。音频源与识别器怎么设置音频源默认是系统音频用 WASAPI 回环采集就是录电脑内部播放的声音取走全部播放声附带一个实用效果——系统音量完全静音时识别照常工作。什么时候换个人口述、语音笔记换麦克风源只想录某一个程序比如某个播放器换进程音频注意它要求系统版本 10.0.20348 及以上基本就是 Windows 11。识别器默认是 Sherpa-Onnx 离线识别器纯 CPU 推理普通笔记本最省心。对速度有更高要求、显卡可用的话换 Sherpa-Ncnn它支持 Vulkan GPU 加速。命令行识别器是面向高级用户的开放接口进阶部分展开说。模型默认是中文 Zipformer-transducer 模型。内容以英文为主换英文模型中英夹杂选中英双语。准确率与场景不匹配时可以在设置里把模型路径指向其他 sherpa-onnx 流式模型替换。字幕样式和历史记录怎么用识别开始后字幕显示在一个无边框小窗口里顶部带录音计时。窗口可任意拖动、调整大小放到视频下方或会议窗口旁边不挡内容右键可改字体、字号、颜色、阴影、背景等还有锁定按钮防止误拖动。另一个实用细节通知设置页可以配置敏感词字幕里出现时系统立即弹通知适合会议里盯自己的名字或关键词。整句结果会按日期自动存到我的文档下的TMSpeechLogs文件夹。打开历史记录窗口可以逐段回看当天内容右键菜单或 Ctrl-C 直接复制摘取关键段落很方便。实测5800u 笔记本 CPU 占用不到 5% ⚡测试机是 AMD 5800u 低压笔记本装中文 Zipformer-transducer 模型连续跑了两天的体感是 CPU 平均占用不到 5%内存没有明显增长。识别节奏是边说边出字流式模型边采边识别没有明显滞后感不依赖网络往返响应天然就快后台随便敲点字也不耽误字幕跟上。常见问题识别不准、收不到声音怎么办识别准确率不理想。先讲原因多半是环境或模型与场景不匹配。先排查环境音是否太吵、是否多人同时说话、麦克风音量是否合适都正常的话换一个模型或在设置里指向更合适的流式模型。收不到系统声音。通常是回环设备没启用。进 Windows 声音控制面板的录制标签页把立体声混音回环设备启用——不显示的话右键勾选显示禁用的设备再回设置里选中系统音频源。历史记录找不到。确认我的文档/TMSpeechLogs文件夹存在且有写入权限权限异常时以管理员身份运行程序通常能解决。CPU 占用偏高。换回 Sherpa-Onnx 识别器纯 CPU、开销低并选择轻量级语言模型敏感词通知用不上的话可以关掉省一部分附加处理。配置改乱了不知道咋办。直接跑 Release 包附带的重置配置 bat它清除现有配置文件程序回到默认状态不用重装。原理速览音频到字幕的数据流给好奇的同学几行说清楚代码是核心框架 功能插件布局插件管理、任务调度、配置、资源管理等通用能力在 src/TMSpeech.Core/音频源与识别器都是 src/Plugins/ 下的插件。启动时扫描plugins目录读取每个插件的tmmodule.json描述文件并加载进内存音频源、识别器、翻译器都靠它切换。数据流向WASAPI 低延迟采集统一输出 16kHz 单声道→ 音频源插件推数据 → 任务管理器转发 → 识别器流式识别。识别器发两类事件文本变更实时临时结果和句子完成确认句显示层据此上屏。确认句按日期写入我的文档的 TMSpeechLogs构成历史记录页的数据来源。配置是%AppData%/TMSpeech/config.json的 JSON 文件修改后通过事件通知即时生效比如改完字幕样式马上更新不用重启。进阶命令行识别器与插件机制命令行识别器是扩展空间最大的一条路给定程序和参数它启动一个外部子进程子进程标准输出里以单个换行结尾的行是当前句临时结果允许后续输出纠正以多个换行结尾的行才是确认句标准错误写入日志文件双方统一 UTF-8。换句话说任何能输出文字的识别程序都能接进来。external_recognizer/ 里有可直接参考的 Python 脚本。三个注意点子进程自行获取音频设置里的音频源切换不生效参数用空格分隔含空格的路径要加双引号用 bat 脚本时开头加隐藏命令回显结尾别写pause。想自己加一种音频源或识别器写一个实现对应接口如IAudioSource、IRecognizer的插件放进 plugins 目录即可核心代码不用动加载与数据流的完整流程见 docs/Process.md。总结TMSpeech 适合谁TMSpeech 的定位很朴素把电脑里的声音变成你随时能翻回来看的文字免费、开源、离线运行。适合需要会议纪要、网课与视频本地字幕、不想把音频送进云端的人不适合需要同时识别多种语言目前以中文、英文、中英双语模型为主、或希望在 Mac/Linux 上跑的人目前只支持 Windows。如果你发现了更好的开源流式模型或者觉得哪个环节不顺手欢迎到项目提 Issue 或提交 PR 告诉作者。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考