免费开源的实时语音转文字工具 TMSpeech 使用测评:让电脑替你把话记下来

📅 2026/8/21 4:22:17
免费开源的实时语音转文字工具 TMSpeech 使用测评:让电脑替你把话记下来
免费开源的实时语音转文字工具 TMSpeech 使用测评让电脑替你把话记下来【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech上周三的周例会我盯着投屏上的表格走神了三分钟脑子里全是中午吃什么这种哲学问题。领导毫无征兆地开口刚才这段你帮大家复述一下重点。那一刻会议室安静得能听见空调的风声而我只记得最后一句话的后半截。这种被点名却大脑空白的时刻恐怕每个上班族都经历过。它逼着我给自己定了个小目标找一款 Windows 上的实时语音转文字工具让电脑在我走神的时候替我把话记下来。既要免费又要本地运行——语音内容不出本机才敢放心让它整个会议期间一直开着。绕了一圈我在开源社区里找到了 TMSpeech一个把自己戏称为开会摸鱼工具的开源项目试用满一个月后决定把这段真实体验原原本本写给你。先说清楚这不是官方文档而是一个普通用户一个月来的实测记录安装、配置、踩坑、进阶的经验都会摊开讲你完全可以跟着步骤一边看一边动手。这笔账怎么算都不亏本地语音识别到底替你省下什么很多人对语音转文字的第一印象来自手机输入法或在线会议软件。但它们要么只处理麦克风里单一说话人的声音要么必须把音频传到服务器上——你根本不知道这段录音最后去了哪里。TMSpeech 走的是完全不同的路线抓的是电脑自己播放的声音。会议软件、网课、视频播放器、游戏里传出的任何语音都能实时变成字幕像歌词一样浮在屏幕上识别全程在本地完成。整套是离线语音识别软件你的语音数据不出电脑隐私这一关天然就过了资源占用低得让人意外。开发者实测的数据是 AMD 5800u 笔记本上 CPU 占用不到 5%我自己在办公室的老台式机上跑边上开着十几个网页和办公软件也感觉不到它的存在在低 CPU 占用语音识别软件里属于第一梯队连静音都拦不住它。它利用 Windows 的 WASAPI 环回捕获机制采集内部音频哪怕你系统静音了电脑里正在播放的语音照样能被捕捉到。一句话总结它就像随叫随到的听写秘书把从扬声器里流过的每一句语音都悄悄变成可随时回看的文字。如何在 3 分钟内跑起这套语音识别起步比想象中简单得多。想自己编译可以执行git clone https://gitcode.com/gh_mirrors/tm/TMSpeech只想尽快用起来直接下载官方打包好的 Release 压缩包解压后双击TMSpeech.exe就行。首次运行会自动生成默认配置你几乎不需要做任何设置就能看到主界面。主界面走的是极简路线一个无边框的悬浮窗口可以随意拖动、拉伸想放哪都不挡事。窗口顶部的红色计时器从开始录音的那一刻起跳动旁边是暂停和停止按钮右上角三个小图标分别是历史记录、界面锁定和设置入口。到这里工具已经能跑了。接下来的关键是让它听懂你想听的东西——这就轮到它最核心的插件化设计登场了。场景一开会时偷偷记录系统声音会议室里的音频来自软件、说话内容来自对方那头你的电脑只是旁听——所以正确做法是把语音源切到系统音频。TMSpeech 的音频源插件都在src/Plugins/TMSpeech.AudioSource.Windows/目录下实现一共三种系统音频捕获电脑正在播放的所有声音适合会议、网课、视频麦克风只收话筒输入适合你独自对着电脑口述想法进程音频只监听指定程序的输出适合多任务同时跑时的精准隔离。选好系统音频之后会议里传出的每一句话都会实时变成字幕。更贴心的是它还有一个敏感词提醒功能——在配置里填几个关键词一旦识别内容命中就会触发系统通知。电话会里谁提到了你的名字你抬眼就能看到再也不用心虚地反复刷新消息。场景二外语课跟不上先装一个语言模型实时语音转文字的质量很大程度上取决于你加载的模型。打开设置里的资源页会看到一份可安装清单中文模型、英文模型、中英双语模型后面各跟一个安装按钮。挑一个匹配自己使用场景的点下去等下载完成状态变成已安装就大功告成。内置资源存放在程序目录的plugins/文件夹里属于开箱即用的部分而你自己点击安装的模型会进入%AppData%/TMSpeech/plugins/。想清理或更换模型时动后面这个目录就行。场景三嫌它慢给它换一颗更快的大脑如果你觉得识别速度有提升空间问题多半不在网络而在识别器本身。设置面板的语音识别页提供了三个可随时切换的选项界面长这样Sherpa-Onnx 离线识别器基于 CPU 优化是普通办公电脑的默认选择速度与资源占用平衡得最好Sherpa-Ncnn 离线识别器可以调用 GPU 加速的版本适合游戏直播这类对实时性要求极高的场景命令行识别器把识别任务交给任何外部程序上限完全由你决定后面专门讲。普通办公本选 Sherpa-Onnx 就够用追求极限速度的玩家或主播可以直接切到 Ncnn 版。切换识别器不会影响你已经下载的模型随时可以换回来。低配置电脑的性能调优技巧如果你的机器比较老旧或者想让它长期挂在后台可以再做三件小事固定使用 Sherpa-Onnx 识别器它在 CPU 上的表现最平稳打开配置文件%AppData%/TMSpeech/config.json把采样率等音频参数适当调低同时按需微调字号recognizer.source: SherpaOnnx, appearance.FontSize: 48关闭或减轻实时标点这类后处理负担较重的选项让识别帧率保持稳定。字体颜色、阴影、对齐方式这些外观参数同样能在配置里微调。把窗口调成只剩一行清清爽爽的字读起来最舒服。想找回灵光一现的瞬间历史记录就在这里走神不可怕可怕的是回过神来才发现关键那句没听见。TMSpeech 默认会把每次识别结果按日期保存到我的文档下的TMSpeechLogs文件夹里。打开历史窗口就能按时间顺序回看一整天的记录右键可以复制单条也可以全选导出整理会议纪要时尤其顺手。新手可能踩过的 5 个坑第一个月里我自己就掉进去过提前帮你排排雷没装模型就急着用。装好软件不等于能识别先去资源页把对应语言模型装上改了配置却不生效。部分设置在工作运行期间会被锁定改完记得重启程序命令行识别器没反应。它需要子进程自己获取音频源此时设置里的音频源选项不会生效别白忙活批处理脚本卡在最后。如果识别程序是.bat开头要加隐藏命令回显结尾千万别写pause否则程序无法判断进程是否退出带空格的路径传不进参数。给命令行识别器传参时含空格的路径需要用双引号包起来。进阶玩法接上你想要的任何识别引擎命令行识别器的存在意味着 TMSpeech 的上限由你自己决定。它用一套固定协议工作子进程把识别结果输出到标准输出单个换行表示当前句子有更新连续两个换行表示这一句识别完成。项目在external_recognizer/目录下提供了现成的 Python 示例脚本docs/里也有插件交互流程说明——照着葫芦画瓢就能把 Whisper、云端 API 或任何开源模型接进来。想深入理解各模块怎么协作src/TMSpeech.Core/和src/Plugins/是最好的起点。三步上手清单然后一起把它变得更好到这里我踩过的路你已经全部看清了。现在只需要三步下载 Release 压缩包或git clone https://gitcode.com/gh_mirrors/tm/TMSpeech自行编译解压并双击TMSpeech.exe到资源页安装语言模型在语音识别页选好识别器回到主界面按下开始让字幕在屏幕上流动起来。如果你试用后发现识别率不够理想多半需要换一个更匹配的模型如果你有新的功能想法欢迎直接参与项目讨论贡献代码、模型或文档。开源软件的生命力正在于每个使用者都愿意多往前推一把——你的第一条反馈或许就是这个工具下一个版本的起点。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考