如何在电脑上装一个免费的离线语音转文字工具:TMSpeech 实时字幕完整指南

📅 2026/8/27 1:24:34
如何在电脑上装一个免费的离线语音转文字工具:TMSpeech 实时字幕完整指南
如何在电脑上装一个免费的离线语音转文字工具TMSpeech 实时字幕完整指南【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech线上课切到 1.5 倍速讲到关键步骤时你却没听清回看录像又要等三分钟更麻烦的是会议里有人语速飞快等你回过神前面两分钟的内容已经接不上了。TMSpeech 就是为这类时刻做的它是一款免费、完全离线的语音转文字工具把电脑正在播放的声音实时转成滚动的字幕识别全程在本机完成音频不经过任何外部服务器按日期自动存档。装好之后它会安静地替你记住你错过的那部分。离线语音转文字工具能帮你接住什么先说清楚它替你兜住的事会议和课程里漏掉的内容事后可以完整回看每天的识别文字自动归档不用手动整理所有声音数据不出你这台电脑涉及内部信息的场合也能放心开着。下面是它能做的事以及每件事对你的实际意义方面具体行为对你的意义声音从哪来系统内录WASAPI 环回为主也可选麦克风或指定进程音频网课、会议、本地视频的声音都能转不依赖麦克风文字怎么来本地流式识别边播边出字断句后定稿没有网络延迟断网也能用资源开销官方 README 实测AMD 5800U 笔记本上 CPU 占用不到 5%日常使用不打断正在进行的播放字幕长什么样无边框悬浮窗口字体、颜色、阴影、背景色、对齐均可调支持锁定穿透钉在画面边缘像歌词一样跟读不挡内容文字存到哪里默认按日期存入「我的文档/TMSpeechLogs」路径可自定义会后不用整理文字纪要已经在那了识别引擎Sherpa-OnnxCPU、Sherpa-Ncnn可 GPU 加速、命令行识别器三套可切换按电脑配置和精度需求自由选扩展方式插件化架构模型和识别器可在设置里在线安装换语言、换模型不用重装程序技术底子一句话项目用 .NET 加 Avalonia 编写源码分核心、界面、插件三层src/TMSpeech.GUI/ 放的是主界面相关代码。安装中文模型并跑通第一次识别第一步下载并启动。从 Release 页面下载最新版压缩包解压后双击TMSpeech.exe即可运行不需要安装过程建议在桌面创建快捷方式之后用起来顺手。第二步装模型。打开设置窗口点左侧导航的「资源」页。识别靠模型驱动这一页会列出内置插件和可下载的语言模型中文模型、英文模型、中英双语模型。点「中文模型」旁边的「安装」等下载完成状态会从「安装」变成「已安装」。内置资源位于应用目录的plugins/文件夹你自行安装的资源存放在%AppData%/TMSpeech/plugins/统一管理都在这个页面完成。第三步开始识别。回到主界面点开始按钮字幕窗口随即跟随电脑声音实时更新。每句话定稿后会进入历史记录窗口右键或 Ctrl-C 复制并按日期写入「我的文档/TMSpeechLogs」。它凭什么又快又不外传声音把一次识别过程想成一条传送带声音是原料文字是成品。传送带的第一段在「取料口」。TMSpeech 用 WASAPI 环回捕获CaptureLoopback在系统声音的汇聚处取样——取的是系统内部混好的音频流所以即使你把音量完全关掉识别照样进行。这个音频源插件的实现在 src/Plugins/TMSpeech.AudioSource.Windows/ 下麦克风采集、指定进程音频也在同一目录里。传送带的中段是「翻译工位」。音频一块块进来识别器不等整段说完就开始吐字这就是流式识别当前句先以临时结果反复刷新断句后定稿定稿之后还能回头纠正前面几句这也是字幕会「先变后稳」的原因。内置识别器有三套对应不同取料与加工方式Sherpa-Onnx基于 CPU占用低Sherpa-Ncnn可调用 GPU追求更快的处理速度命令行识别器把工位整个外包给你自己的程序。实现代码分别在 src/Plugins/TMSpeech.Recognizer.SherpaOnnx/、src/Plugins/TMSpeech.Recognizer.SherpaNcnn/ 和 src/Plugins/TMSpeech.Recognizer.Command/。「知识」装在哪也值得说清语言模型决定翻译工位的水平。中文、英文、中英双语模型按需安装在哪个语言下开会就装哪个模型。关于「不外传」可以更直白一点整条传送带都开在你家屋里。声音从声卡进、在本地处理、文字落在本地磁盘链路上没有云端环节自然没有上传、没有账号、没有把音频交给第三方翻译这一步。插件化是这条传送带最大的特点传送带本体核心与界面负责协调工位插件各自独立。每个插件在 src/Plugins/ 下用tmmodule.json描述自己程序启动时扫描plugins/目录自动注册所以加一个识别引擎或音频源不需要动主程序。切换识别引擎三种工位的差别入口在设置窗口左侧的「语音识别」页。下拉框里三个选项的分工Sherpa-Onnx 离线识别器基于 CPU日常首选占用低Sherpa-Ncnn 离线识别器可调用 GPU适合追求更低延迟的场景命令识别器通过自定义命令行程序获取识别结果单个换行更新临时结果、多个换行表示句子完成——适合接入 Whisper、SenseVoice 这类你已有的识别程序。换引擎只需要在下拉框里选一下再点刷新模型路径、日志保存位置都在这一页的表单里配置。三种用法把识别结果落到手里会后纪要不用整理。开会时开着 TMSpeech散会后打开历史记录窗口全选复制粘进文档就是一版初稿。识别路径默认是「我的文档/TMSpeechLogs」按日期分好找某一天不用翻聊天记录。课程笔记自动成文。录播课、直播课开着字幕重点内容以文字形式留下来外语课尤其省事字幕和画面同步课后还能把整节课的文字过一遍。敏感内容不离开本机。讨论未公开方案、内部数据或私人口径时云端识别方案往往不敢用。TMSpeech 的识别全程离线声音数据只在本机流转——这一点在设置里也可以验证整条识别链路上没有任何需要联网上传的环节。另外「通知」页支持敏感词桌面通知识别内容出现你预设的词时会弹系统通知适合盯关键词的场合。把字幕窗口调成顺手的形状外观。字幕窗口无边框、可拖动、可缩放字体、字号、颜色、阴影、背景色、对齐方式都在设置的「显示」页调整。所有配置项的定义集中在 src/TMSpeech.Core/ConfigTypes.cs想弄清每个选项的默认值从这里入手最直接。锁定与穿透。字幕支持锁定锁住后窗口可以穿透鼠标点击——看视频时窗口钉在屏幕一角不影响操作画面里的任何控件。托盘管理。程序常驻系统托盘开始/停止、字幕锁定/解锁、重置窗口位置、退出都能在托盘右键菜单里完成不用切窗口。两条进阶路径。一是换更强的模型项目基于 sherpa-onnx 目录下有完整的 Python 示例脚本照着装好对应依赖就能跑。两个注意点命令行识别器模式下外部程序要自己采集音频设置页的音频源对它不生效参数里带空格的路径要用双引号转义。遇到问题的处理办法问题怎么办识别准确率一般先确认模型语言匹配中文内容别用英文模型尽量在安静环境也可在设置中换成更大的 sherpa-onnx 流式模型抓不到系统声音检查设置里音频源是否选了系统内录确认系统声音确实有播放——环回捕获的是系统内部音频流配置乱了想恢复默认运行发行包里的重置配置脚本它会删除现有配置文件程序下次启动时重新生成想接 Whisper、SenseVoice切换「命令行识别器」参考external_recognizer/下的示例脚本注意外部程序需自行采集音频觉得占用偏高换回 Sherpa-OnnxCPU 引擎并选用更轻量的语言模型接下来可以做的三件事今天下载解压装上中文模型跑通第一次识别——三步都在「快速上手」一节里十来分钟。明天挑一场 10 分钟以上的会议或课程全程开着结束后打开TMSpeechLogs看当天的文字是否完整。之后把字体大小、保存路径、通知敏感词调成顺手的值。调完之后它就该消失在你的注意力里了——这正是它存在的意义。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考