微信语音批量转文字密语CipherTalk语音识别双引擎配置教程SenseVoice/Whisper GPU【免费下载链接】CipherTalk查无此人项目地址: https://gitcode.com/gh_mirrors/ci/CipherTalk密语CipherTalk 是一款现代化的微信聊天记录查看与分析工具内置语音识别引擎可以把微信里的语音消息批量转成文字。它提供 SenseVoice本地 CPU 离线识别与 Whisper GPUCUDA 加速双引擎另支持在线转写服务60 秒语音最快 1 秒出头即可转出文字本文带你一步步完成配置。一、为什么需要批量语音转文字微信里常有一整段没听完的语音会议记录、家庭群长语音、语音条密集的朋友……逐条点开听不仅耗时而且无法全文搜索。CipherTalk 的语音转文字功能帮你批量转换语音消息自动/批量转写为文字随后可参与全文检索结果缓存每条语音的转写结果存入本地缓存库stt-cache.db转过一次就不再重复计算换目录也不会整批重转中英日韩粤SenseVoice 引擎支持中文、英语、日语、韩语、粤语多语言识别隐私可控本地引擎全程离线运行语音数据不出电脑二、双引擎架构SenseVoice 与 Whisper GPU 怎么选CipherTalk 的语音识别采用引擎可切换设计设置页提供三种模式模式底层引擎运行方式适合场景CPU 模式SenseVoice阿里达摩院sherpa-onnx纯 CPU 离线低配电脑 / 无显卡 / 完全离线GPU 模式Whisperwhisper.cpp CUDAGPU 加速可回退 CPUNVIDIA 显卡用户大批量转写在线模式OpenAI 兼容 / 阿里云千问 ASR / 火山豆包等调用云端 API不想下载模型的轻量场景 性能参考60 秒中文语音实测SenseVoice CPU 约 18 秒Whisper CPU 约 12 秒Whisper GPU 约 1.2 秒约 15 倍提速。官方方案对比详见 electron/services/README-STT.md。三、SenseVoice 快速配置离线引擎三步上手SenseVoice 是默认引擎核心实现在 electron/services/voiceTranscribeService.ts转写任务在独立 Worker 线程中执行electron/transcribeWorker.ts不阻塞界面。第 1 步选择模型规格打开 设置 → 语音识别源码src/components/settings/tabs/SttTab.tsxCPU 模式面板提供两档模型模型版本体积特点int8 量化版235 MB✅ 推荐体积小、速度快float32 完整版920 MB更高精度体积较大第 2 步下载模型点击下载模型进度条支持暂停 / 恢复断网不丢进度。模型文件来自 ModelScope存放在系统 AppData 目录自动规避中文路径问题。第 3 步勾选识别语言在识别语言卡片中勾选中文、英语、日语、韩语、粤语至少保留一种。只勾一种时识别更准多选则自动判断语种。完成后即可在聊天页看到语音消息被逐条转成文字。四、Whisper GPU 加速配置NVIDIA 显卡用户必看GPU 模式基于 whisper.cpp 实现electron/services/voiceTranscribeServiceWhisper.ts要求NVIDIA 显卡 CUDA 11.8 以上驱动small 模型需至少 2GB 显存。配置共四步第 1 步查看 GPU 检测状态切到 GPU 模式页签右侧GPU 检测卡片会自动检测当前机器 GPU 可用性显示驱动与显存信息显示可用即可继续。第 2 步下载 GPU 组件CUDA 运行组件约645 MB点击下载 GPU 组件会自动安装到缓存目录需先在数据管理页设置缓存目录下载同样支持暂停恢复。第 3 步挑选 Whisper 模型Whisper 提供 8 档模型精度与体积梯度清晰模型体积推荐度tiny75 MB最快速度base145 MB速度精度平衡small488 MB✅ 默认推荐large-v3-turbo-q5540 MB极高精度 小体积推荐large-v3-turbo-q8835 MB极高精度 高质量量化medium1.5 GB最佳精度耗时更多large-v3-turbo1.62 GB极高精度 快速large-v33.1 GB专业级识别 新手建议显存 4GB 选small或turbo-q5显存 8GB 以上可上large-v3-turbo。第 4 步开启 GPU 加速开关打开启用 Whisper GPU 加速开关后转写优先走 GPU关闭则自动回退 CPU 执行无需卸载任何组件双引擎可随时来回切换。五、批量转写的三个提速技巧善用缓存转写结果按账号 会话 时间缓存历史语音不会重复扣时间即使更换缓存目录旧缓存也会被自动合并大任务切 GPU几百条语音的批量转写GPU 模式与 CPU 模式的速度差距可达 10 倍以上在线模式调并发使用在线转写时提供商实现见 electron/services/sttOnline/providers/openaiCompatible.ts可把批量并发数从默认 2 调到 5~10同时调大超时时间适合大批量云端转写六、常见问题 FAQQ没有独立显卡能用 Whisper GPU 吗可以。Whisper 在 GPU 组件缺失或开关关闭时会自动回退 CPU 模式比 SenseVoice 在 CPU 上仍快约 1.5 倍。Q语音数据会被上传吗本地 CPU/GPU 模式完全离线数据不出电脑仅在线模式会调用你自行配置的第三方 API。Q两个引擎可以共存吗可以两套模型独立存储互不干扰设置里随时切换不用的模型可点清除模型释放磁盘空间。Q识别不准怎么办CPU 模式可换 float32 完整版模型GPU 模式可升 large-v3-turbo 系列或在识别语言中只保留目标语种以提高准确率。参考资料语音识别服务说明electron/services/README-STT.mdSenseVoice 引擎electron/services/voiceTranscribeService.tsWhisper GPU 引擎electron/services/voiceTranscribeServiceWhisper.ts语音识别设置界面src/components/settings/tabs/SttTab.tsx【免费下载链接】CipherTalk查无此人项目地址: https://gitcode.com/gh_mirrors/ci/CipherTalk创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考