PowerMem:87.79% 准确率背后的 Agent 记忆系统

📅 2026/7/29 10:23:52
PowerMem:87.79% 准确率背后的 Agent 记忆系统
OceanBase 旗下的 PowerMem 仍在连续更新。这个项目看起来像一个“AI 记忆插件”但如果只把它理解成向量数据库外面包了一层 SDK就低估了它的野心。它想解决的是 Agent 里一个很老、也很烦的问题模型不是完全没记性而是记得太粗系统不是不能存东西而是越存越乱。聊天记录、用户偏好、工具调用、失败经验、临时任务全塞进一个向量库里最后就像把发票、钥匙、充电线都扔进同一个抽屉。PowerMem 做的事是给这个抽屉加上分层、检索、衰减和复盘机制。先看数字它不是只讲概念PowerMem 的 README 里给了两组 benchmark分别来自 LOCOMO 和 AppWorld。前者更接近长对话记忆检索后者更像 Agent 完成任务时能不能少绕路。指标PowerMem基线变化LOCOMO 准确率87.79%52.9%65.9%LOCOMO 检索 p95 延迟1.44 s17.12 s-91.6%LOCOMO Token 开销约 0.9k26k-96.5%AppWorld 通过率39%24%62.5%AppWorld 平均步数6.29.5-34.7%这组数据该看的不是单个准确率有多漂亮而是三个指标一起往好处走更准、更快、更省 Token。如果一个记忆系统只能靠把大量历史上下文塞回 prompt 来提升表现那它本质上是在用钱买记性。PowerMem 试图证明另一条路先把记忆处理成可检索、可更新、可忘记的结构再按任务需要取回少量关键内容。四路检索别再让向量库一个人背锅很多 Agent 记忆方案一开始都会走向量检索。它简单、通用听起来也很 AI。但向量检索有一个老毛病语义相近不等于任务相关。用户说“下次别用这个格式”过几天 Agent 需要写文章时向量相似度未必会把这条偏好排到前面。某个项目里的“上线失败原因”可能和另一条“部署环境记录”关系很近但单纯按 embedding 找很容易漏掉关系链。PowerMem 的设计是把向量检索、全文检索、图检索和时间/新近度信号放在同一层里融合。向量负责语义全文负责关键词和精确匹配图关系负责实体与事件之间的连接时间衰减负责判断一条记忆是不是已经过期。这个思路更接近真实工作台而不是单一搜索框。找“老大不喜欢什么标题风格”全文关键词可能很有用找“上次为什么没有发布”图关系和事件链更有用找“类似场景怎么处理”向量才更有用。记忆不是硬盘过期内容也会伤人PowerMem 另一个核心点是把记忆生命周期做成系统能力。它用 LLM 做记忆抽取、更新、合并也引入了艾宾浩斯式的时间衰减。这件事听起来有点玄其实很工程。Agent 的长期记忆如果只增不减会出现两个问题。第一检索噪声越来越大旧偏好和新偏好打架第二系统开始把临时事实当长期事实比如“今天下午三点开会”被永久保存半年后还冒出来提醒你。PowerMem 把记忆分成用户画像、私有记忆、短期记忆、长期记忆、共享记忆等不同层次再根据重要性、访问频率和时间衰减做保留或清理。它不是简单地“记住一切”而是让系统有机会判断这条信息是规则、偏好、经验还是一张已经过期的便签。对 Agent 来说忘记不是缺陷。不会忘才是事故源头。Experience Skill从“记事实”走向“学做事”PowerMem 最有辨识度的地方是它把记忆拆成了 Experience 和 Skill 两层。Experience 更像“发生过什么”某次对话、一次工具调用、一个失败案例、一个用户反馈。Skill 更像“以后怎么做”从多次经验里蒸馏出的流程、偏好和操作套路。这和普通 RAG 的差异很明显。RAG 多数时候是在回答“资料里有什么”Agent 记忆要回答的是“遇到类似场景时该怎么行动”。举个例子用户多次纠正公众号标题不要写“火了”“爆了”“刷屏了”。如果系统只记事实它下次可能搜到几条纠正记录如果系统能沉淀成 Skill它应该直接形成一条写作规则标题优先使用“项目名核心技术判断”的结构避开廉价热度模板。这才是 Agent 记忆真正有价值的地方不是让模型背更多聊天记录而是让它少犯同一种错。集成面很宽但也意味着它还在早期工程期PowerMem 目前提供 Python SDK、CLI、HTTP Server、MCP Server也写了 Claude Code、Cursor、VS Code、Windsurf、GitHub Copilot、Qoder、OpenClaw 等集成路径。OpenClaw 可以通过memory-powermem插件接入默认走 CLI 模式本地用 SQLite不一定要单独起服务。从生态姿态看它想做的是一层通用记忆后端不同 Agent、不同 IDE、不同客户端都连到同一个记忆服务。但边界也要说清楚。PyPI 当前版本是1.1.7项目分类仍标为 AlphaGitHub 上还有配置校验、可观测性、记忆衰减公式、元数据持久化等 open issues。换句话说它已经不是一个概念 demo但也还没到“闭眼上生产”的阶段。如果只是个人 Agent 或本地助手PowerMem 的 CLI / SQLite / MCP 组合已经足够尝鲜。若要放进团队级生产环境权限隔离、数据迁移、记忆可观测性、错误处理和评测复现仍然需要自己认真压一遍。它真正押注的是 Agent 的下一层基础设施过去一年Agent 讨论最多的是模型、工具调用和上下文窗口。记忆常常被当成附属功能加个向量库存几条偏好能搜回来就算完成。PowerMem 提醒了一件事如果 Agent 要长期陪用户工作记忆就不能只是“外置聊天记录”。它需要知道什么该进短期缓存什么该进长期画像什么该合并什么该忘掉什么能上升成可复用技能。这也是它和 OpenClaw 这类多通道 Agent 系统天然相关的原因。一个助手如果活在飞书、Telegram、公众号工作流和本地文件里难点不只是“存”还要跨场景保持一致又不把旧信息乱带到新任务里。PowerMem 的方向是对的把 Agent 记忆从单点检索推向一套可演化的工程系统。至于它能不能成为事实标准还得看两件事一是实际接入成本能不能继续降二是 benchmark 之外真实多用户、多工具、多权限场景里能不能稳住。Agent 迟早要有长期记忆。问题只剩下这套记忆是一堆越积越乱的便签还是一个会整理、会遗忘、会复盘的工作伙伴。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】