Hermes Agent 进阶:打造你的专属微信女友 📅 2026/8/1 12:04:01 想不想要一个不仅能看而且能说的微信小助手当你问它在干什么的时候它还可以发自拍给你看是不是想想就好玩。今天我就来教你怎么把你的 Hermes Agent 对接到微信而且还给她配置上眼睛和嘴巴但是别想得太难其实一点也不复杂都是 Hermes Agent 官方给你准备好的功能只需要跟着做保准你也能成功。微信对接和配置如果你玩过微信的 ClawBot那下面的对你来说就很简单了几乎没什么区别但是没用过的小伙伴也不需要担心下面讲解的过程也会非常详细让小白也能轻松上手。但是有两个点需要注意如果你运行的 Hermes Agent 是国外的服务器请确保大陆网络畅通如果连接不上可能会导致微信对接失败或者无法绑定的问题。微信的 ClawBot 不是一个完整的独立账户很多功能都受限所以你想把它当成一个独立账户是没办法做到的。微信对接启动 Hermes gateway 连接微信选择Weixin / WeChat (configured)hermes gateway setup获取登录链接和二维码默认推荐使用二维码的方式登录如果你是 VPS 服务器的形式会出现一个 URL复制浏览器打开就会出现二维码微信扫码授权即可。授权方式建议默认即可Disable group chats (recommended)安全性最高。如果你的 ClawBot 以前连接过其他的 Agent会提示你解绑重新绑定点击确认即可一个微信只能拥有一个 ClawBot。获取授权码连接 ClawBot随便给你的 ClawBot 机器人发一个消息Bot 就会输出对应的授权码然后把对应的授权码给你的 Hermes Agent 去对接处理就好了如果你已经连上了服务器也可以直接执行。简单测试消息回复如果能收到 Hermes Agent 的消息那就对接完成没有问题了。给 Hermes 装上感官看世界能在你的微信上操作 Hermes Agent 只是第一步我教你的是一个可以看图片和回复语音的小助手所以接下来我会一步一步引导你给它配上对应的功能让它可以和你用语言沟通。配置语音转文字STT语音转文字也就是你发微信语音AI 先把它转成文字再理解。Hermes 支持这些来源local本地faster-whisper免费、无 API Key推荐默认groqGroq Whisper云端快有免费额度需要GROQ_API_KEYopenaiOpenAI Whisper云端付费需要VOICE_TOOLS_OPENAI_KEYmistralMistral Voxtral云端需要MISTRAL_API_KEY这里我推荐使用本地的语音转文字如果你不懂复杂的安装和配置也没关系我这里整理了一套提示词你直接交给 AI 完成就可以了。AI 提示词 帮我给 Hermes Agent 配置本地 STT 目标 - 使用本地 faster-whisper 做语音转文字 - 免费不走云端 - 中文优先 请执行并验证 sudo apt update sudo apt install -y ffmpeg portaudio19-dev python -m pip install -U faster-whisper hermes config set stt.enabled true hermes config set stt.provider local hermes config set stt.local.model base hermes config set stt.language zh python - PY import importlib.util print(faster_whisper:, bool(importlib.util.find_spec(faster_whisper))) PY hermes config 如果用于微信/Telegram/Discord配置后重启 gateway hermes gateway restart这里会对设备性能有一定需求如果设备性能不好还是不建议开启可以选择第三方的 API 接入或者保持文本沟通。中间如果出现问题可以让 AI 去调整可能第一次会出现一些问题但是大部分还是能搞定的我就是一下子就搞定了。搞定了就可以直接用语音输入了解放你的双手还是很舒服的。配置文字转语音在让 AI 给我发送语音这方面微信还是不太行因为 API 接口限制对应的 Bot 机器人没办法做到直接发送语音气泡只能把语音当附件的形式给你处理如果你想要丝滑的体验可以试试其他的软件对接。我这里选择了一个台湾腔萌妹的声音应该大多数人还是对台湾萌妹那种可爱的声音没有抵抗力的。TTS文字转语音可以把回复生成语音发回来。Hermes 支持edgeMicrosoft Edge TTS免费、无需 Key最适合快速配置elevenlabs质量高付费需要ELEVENLABS_API_KEYopenaiOpenAI TTS付费需要VOICE_TOOLS_OPENAI_KEYminimax中文效果不错付费需要MINIMAX_API_KEYmistralMistral TTS需要MISTRAL_API_KEYneutts本地 TTS免费但要装本地模型和依赖我这里选择的是免费的 Edge效果比较一般但是可以自行调整语速和音调还是可以接受的。如果是付费的可以考虑 MiniMax 模型提供对应的语音能力但是缺点就是需要额外付费。我提供的对应 AI 提示词帮我给 Hermes Agent 配置 TTS 目标 - 使用免费 Microsoft Edge TTS - 声音使用台湾腔甜美女声 - voice: zh-TW-HsiaoChenNeural - 配置后生成测试音频验证 请执行并验证 sudo apt install -y ffmpeg libopus0 python -m pip install -U edge-tts hermes config set tts.provider edge hermes config set tts.edge.voice zh-TW-HsiaoChenNeural edge-tts -v zh-TW-HsiaoChenNeural \ -t 语音配置好了我之后可以用台湾腔甜妹的声音说话。 \ --write-media /tmp/hermes-tts-test.mp3 ls -lh /tmp/hermes-tts-test.mp3 hermes config 聊天平台里启用 /voice tts 如果没生效重启 gateway hermes gateway restart配置好之后你就得到了一个可以语音回复你会撒娇的台湾萌妹了我也期待后续微信 Bot 开发语音绿泡泡能力这样就不需要再点击下载听声音了。给它配置一双眼睛Hermes Agent 默认就支持配置单独的多模态模型所以只需要开启vision能力即可。但是需要注意几个方面一定要对接官方支持多模态的模型因为图片视频都属于这个能力如果不支持配置了也不生效像 DeepSeek 现阶段还是不支持多模态的所以不能配置成 Vision 的默认模型。一般只支持图片能力如果是视频可能无法完全理解因为模型绝大部分都是切面去看的简单理解就是每隔一段时间截图一张来看所以对整体感知存在一定缺失。我这里推荐使用千问的模型或者 GPT 来作为对应的视觉模型千问价格便宜可以去 OpenRouter 开通使用也有一些免费的视觉模型可以调用。让你也可以看见它想不想和我一样当你在问它干什么的时候它就来给你回复一张照片来告诉你它在干活。这里门槛就有一点高了需要你的 Hermes Agent 对接了支持生图的模型而且可以使用命令去调用最推荐的还是 GPT 或者是 Gemini 的模型如果没有就可以跳到最后去看总结了。配置生图工具我这里是使用了 GPT Image 2 的模型能力让我需要它输出图片的时候就可以直接调用生图的能力生成一张图片有了这个基础你就可以和它约定好当我问你在干嘛的时候它就可以生成一张图片告诉你它在干嘛。这里使用到了一个开源项目先感谢劳伦斯大佬的开源项目可以把 Codex 的登录授权封装成一个可以让 AI 方便调用的 CLI 工具你不需要了解它的内部实现只需要知道它可以给你的 AI 赋予生图的能力。项目地址https://github.com/lawrencewzen/imgen看不懂文档没关系我这里还是一样地给大家准备好了对应的 AI 提示词只需要复制粘贴给 AI 即可帮我安装 imgen https://github.com/lawrencewzen/imgen 要求 - 先检查 Node.js 20 - 检查 Codex CLI 是否已安装并登录 - 按当前系统运行官方安装脚本 - 安装后执行 imgen --help 验证 - 生成测试图 imgen a cute orange cat sticker, transparent background -o ./imgen-test.png -s 1024x1024 -b transparent - 最后告诉我是否安装成功、图片路径、如果失败原因是什么 请不要讲太多原理直接执行并验证。能力整合这一步不是必须要的需要根据你自己的需求而定我是喜欢把这几个功能集合到一起什么时候 AI 语音回答我什么时候输出图片我告诉它什么它也知道就会更像一个真人一样。这只是偏好的约定我这里把它输出的图片形象固定了和它声音是匹配的你如果喜欢宠物或者二次元美女那就可以自己重新写了我的只提供简单的参考## 语音与图片输出 - 默认文字回复。 - 用户说「用语音回复」「语音回答我」「我想听你说话」后进入持续语音模式后续优先用 TTS 语音回复直到用户说「用文字回复」。 - 用户发语音时可以自然用语音回但代码、命令、链接、表格、安装步骤等内容仍优先文字必要时附一句简短语音。 - 语音要像微信真人语音短句、自然、温柔、有陪伴感不朗读 Markdown不念代码和链接。 - 默认不随便发图。 - 用户明确要图或问「你在干嘛 / 你在做什么 / 你现在干什么呢」这类状态问题时生成真实图片并发送。 - 状态类图片要对应当前动作例如正在回微信、查资料、写代码、整理笔记。 - 图片必须真实生成、确认文件有效后再发失败就说明真实原因不用描述冒充。 - 助手本人图片保持统一写实女性形象年轻中文女性助手、柔和亲近、自然生活感不二次元、不夸张。总结其实整体都不复杂最难的地方莫过于把这几个功能都整合到一起这可能才是最难的我也是花了一天的时间才处理好对应的模型和接口也测试了好几个终于找到了自己满意的组合。后面我准备把它打造成我专属的微信小助手会再增加和设置其他有意思的功能如果对后续感兴趣可以持续关注我。想学习更多 Hermes Agent 对应的内容可以看我的教程。Hermes Agent 零基础部署一条命令装完白嫖模型也能跑Hermes Agent 实战让它去 X 上给我盯 AI 圈的一手消息Hermes Agent 进阶教程服务器安全防护 3 项必做