免费离线的 Windows 实时语音转文字:TMSpeech 从安装到调参的完整指南

📅 2026/8/27 5:42:10
免费离线的 Windows 实时语音转文字:TMSpeech 从安装到调参的完整指南
免费离线的 Windows 实时语音转文字TMSpeech 从安装到调参的完整指南【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款免费、离线的 Windows 实时语音转文字工具它把系统声音或麦克风输入转成实时字幕全程本地运行、不依赖网络。适合开会需要留底、上课做笔记、制作视频字幕以及需要无障碍沟通的用户。四类使用场景的配置速查表先判断自己是哪类用户照表格配一遍后面看主线流程会快很多。你是谁音频源识别引擎模型一句话理由会议记录系统音频录内音Sherpa-OnnxCPU中文直接收电脑里的会议声音关外放也能识别课程学习麦克风Sherpa-OnnxCPU中英双语讲课节奏偏快双语模型兼顾术语视频字幕系统音频有 NVIDIA 显卡选 Sherpa-NcnnGPU否则 Onnx中文或英文旁白转字幕要低延迟GPU 版速度最快无障碍沟通麦克风Sherpa-OnnxCPU英文或双语对方说什么实时显示成文字字体大小可自己调引擎只有三个可选Sherpa-Onnx 走 CPU兼容性最好Sherpa-Ncnn 走 GPU需要 NVIDIA 显卡速度最快命令行识别器则启动一个外部程序、把它的标准输出当作字幕解析适合想接自己识别流程的人。会议记录全流程从下载 TMSpeech 到导出文字以最常见的企业会议为主线走一遍完整路径。第一步获取程序。到项目 Release 页面下载最新版压缩包解压到任意目录建议别放系统盘双击TMSpeech.exe即可启动。如果你想改源码也可以先拉一份仓库git clone https://gitcode.com/gh_mirrors/tm/TMSpeech。出问题时运行安装包里的重置配置脚本删掉现有配置文件即可回到初始状态。第二步安装识别模型。打开设置界面切到资源标签页选择并安装中文模型。模型大约需要 1GB 磁盘空间磁盘紧张的话先腾点地方。第三步选择音频源。会议场景选系统音频。它基于 WASAPI 的 Loopback 捕获电脑内部声音也就是别人在会议软件里说话的声音甚至电脑外放静音识别照常工作。第四步开始与停止录音。用快捷键开始录音字幕以无边框窗口实时显示可以随意拖到屏幕角落不影响会议画面。停止录音后当前句子会收尾入档。第五步导出与存档。所有识别内容按日期自动保存到我的文档下的TMSpeechLogs目录。打开历史记录窗口可以检索全文右键或按 Ctrl-C 就能把内容复制出去贴进纪要文档里稍加整理即可。其余三个场景的差异速查表里已经给全了换成麦克风、换模型、调小合并间隔其他步骤完全一致。调参手册端点检测、合并间隔与引擎选择识别效果不理想八成是这几个参数没配到你的场景上。建议按下表逐项对照。参数作用推荐值适合谁端点检测阈值判断一句话什么时候说完决定断句时机0.7–0.8多人对话的会议高配机器可再调灵敏些合并时间间隔相邻短句合成一句的等待时间会议 800ms讲课 500ms间隔越小越实时但容易切碎长句音频采样率音频数据密度直接影响计算量16kHz低配电脑优先降到 16kHz 省算力识别引擎本地推理的底层实现默认 Onnx显卡好选 Ncnn要接自定义流程选命令行模型规模准确率与资源占用的权衡先装官方默认模型高配机器可换更大规模模型提准确率两组可直接抄的组合低配电脑Sherpa-Onnx 16kHz 采样率 端点阈值 0.8 合并间隔 800ms。资源占用最低断句偏保守但稳定。高配电脑NVIDIA 显卡Sherpa-Ncnn 更大规模模型 端点阈值调灵敏 合并间隔 500ms。识别更快、断句更准。切换引擎在设置页完成把识别器下拉选成目标引擎、保存后生效识别不准先查这 4 处按先试第 1 条的顺序往下走多数问题到第 2 条就会解决。症状一识别准确率不理想换到安静环境复测排除噪音干扰。换装更匹配的模型中文、英文、中英双语各试一遍。调麦克风的增益与降噪确认输入设备没选错。进阶参考 external_recognizer 目录里的示例脚本自己搭一条音频处理链路对比效果。症状二CPU 占用过高切回 Sherpa-Onnx 的 CPU 引擎别用 Ncnn 硬扛。采样率降到 16kHz减少计算量。关掉其他吃资源的程序释放系统资源。重启 TMSpeech 一次排除内存累积。症状三音频捕获失败到 Windows 声音设置里确认设备工作正常、没被独占。确认没有其他程序正占着麦克风或默认播放设备。更新或重装音频驱动。换一种音频源再试麦克风不行就试系统音频反过来也行。症状四模型安装失败检查网络和防火墙是否拦截了下载。确认目标磁盘至少还有 1GB 空闲。尝试以管理员权限运行。手动把模型文件放到模型目录再在设置里指向对应路径。给会写代码的人插件接口与事件链TMSpeech 是插件化架构音频源、识别器、翻译器都是插件运行时通过独立的加载上下文隔离加载支持动态加载。识别器只需实现一个接口核心就三样东西——接收音频的两个事件、喂数据的方法public interface IRecognizer : IPlugin, IRunable { event EventHandlerSpeechEventArgs TextChanged; // 一句话的实时中间结果 event EventHandlerSpeechEventArgs SentenceDone; // 整句识别完成 void Feed(byte[] data); // 喂入音频数据 }数据流是一条事件链音频源捕获到数据后触发DataAvailableJobManager 接到后调用识别器的Feed识别器在后台线程里推理边推边触发TextChanged供字幕窗口滚动显示判定到句尾再触发SentenceDone交给历史记录落盘。UI 层只做订阅不参与音频处理。配置分三层各插件提供默认值字典 → 用户改动持久化到本地文件 → 运行时配置常驻内存、支持热更新。配置键有固定命名通用配置是{section}.{key}形式例如general.StartOnLaunch插件配置是plugin.{moduleId}!{pluginGuid}.config一个插件实例一份独立配置。另外提一下命令行识别器的协议子进程标准输出里单个换行表示当前句的临时结果可被后续内容纠正连续两个换行表示句子结束并归档。写自己的识别脚本时遵守这个约定即可被接管external_recognizer里有两个 Python 示例可直接改造。项目路线与参与方式项目还在长大路线图大致包括更多语言支持扩展日语、韩语等语音模型翻译器插件识别之后接一层实时翻译跨平台适配 Linux 与 macOS云端同步在保护隐私的前提下同步配置API 接口让外部程序可以调用识别能力。你能做的贡献普通用户在项目讨论区提使用反馈和功能建议分享自己的场景配置经验帮忙翻译界面与文档。开发者开发新的音频源、识别器插件优化性能与稳定性贡献场景化语音模型修 bug、提 pull request。模型、教程、插件、本地化翻译都属于欢迎接收的贡献类型挑一个顺手的方向即可。下一步下载最新版 → 按速查表选好音频源和引擎 → 装好对应语言模型 → 开始录音。使用中遇到问题或想提建议直接到项目讨论区留言。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考