用户记忆系统:三层次评估框架、记忆层次结构与四种存储格式

📅 2026/8/27 18:45:07
用户记忆系统:三层次评估框架、记忆层次结构与四种存储格式
07-用户记忆系统三层次评估框架、记忆层次结构与四种存储格式《深入理解AI Agent设计原理与工程实践》系列读书笔记 第7篇关键词用户记忆、轨迹、JSON Cards、User as Code、消歧、隐私脱敏做无人售货柜会员服务时我被一个场景反复折磨老王每周三都在楼下柜机买同一款无糖气泡水某天他问帮我看看上次那个水还有没有Agent 一脸茫然——它不记得上次。会话结束记忆清零这是裸 LLM 的出厂设定。让 Agent 记住用户是产品从能用到好用的分水岭但记忆系统怎么设计、存什么、怎么存这本书给了目前我见过最体系化的答案。一、先立标尺记忆能力评估的三层次框架动手设计之前先回答做到什么程度算好。书里给出三层次评估框架层层递进基础回忆能准确存储和检索用户直接提供的信息。“我说过我对花生过敏”——下次推荐鲜食时能避开。这是地基考的是存取可靠性。综合关联能把多条分散的信息串起来推理出未明说的事实。用户没说过我在减肥但结合每次买零度可乐“常买沙拉”“凌晨跑步后买香蕉”Agent 应能推断并个性化推荐。考的是跨信息、跨会话的关联能力。消歧理解能区分相似甚至同名的人和事理解信息的真实归属。用户说给我爸买箱牛奶他乳糖不耐受——这条信息是记在用户爸爸名下不是用户本人用户提过两个张医生要分清谁是牙科谁是心内科。这是最高层考的是知识管理能力。用这把尺子量市面产品很残酷多数记忆功能只做到第一层。评估层次决定架构选型——只求基础回忆简单键值存储就够要消歧就得结构化知识表示。二、记忆的三个层次轨迹、用户长期记忆、业务状态搞清楚记多好之后是记什么。书里把 Agent 的记忆切成三个性质完全不同的层次1. 轨迹Trajectoryappend-only 流水账就是对话历史本身——用户消息、模型回复、工具结果只追加、不修改压缩是后来的事。轨迹是会话内的短期记忆价值在于让模型保持任务全局认知且结构化、可解释、可复盘。轨迹积累多了还能提炼成知识库、做训练数据——它是记忆系统的原材料。2. 用户长期记忆跨会话档案从轨迹中提炼出的、属于用户个人的稳定事实与偏好跨会话存在“老王偏好无糖气泡水”“李阿姨家孩子对坚果过敏”。这是大家通常理解的记忆功能。关键动作是从海量轨迹里萃取——不是把聊天记录全存下来而是抽出将来有用的原子信息。3. 业务状态高层状态抽象业务对象的当前状态“VD-0231 柜机本周第 3 次故障”“用户有一笔 12.5 元退款在途”。它不是记忆而是状态机来自业务系统订单库、工单系统Agent 通过工具读写。三者混淆是常见事故源把业务状态写死在用户记忆里“用户有一笔退款在途”退款完成后记忆没更新Agent 就开始一本正经地胡说。一句话区分轨迹是流水、长期记忆是人、业务状态是事。三、用户记忆的四种存储格式递进这是本篇的硬核部分。同样是存用户信息格式从简到繁有四级台阶能力与成本同步上升。3.1 Simple Notes原子事实O(1) 存取最简格式一条一行原子事实- 用户偏好无糖饮料 - 用户住在阳光花园小区3栋 - 用户是会员2025-06开通优点生成成本几乎为零存取 O(1)模型读起来毫无负担。缺点没有结构、没有上下文第二层综合关联勉强第三层消歧直接失分——用户对花生过敏和用户父亲对花生过敏混在一起时无法区分。实验结论很一致Simple Notes 能过第一层多数用例二三层频繁失分。3.2 Enhanced Notes整段叙事把零散事实组织成自然语言段落用户是阳光花园小区的常住居民2025年6月开通会员。健康意识强 长期购买无糖饮品和轻食曾因乳糖不耐受退过一次酸奶。优点可读性好带上下文模型理解自然。缺点检索粒度粗——想单独更新会员等级就得重写整段叙事还容易夹带推理健康意识强是判断不是事实错误会随重写累积。3.3 JSON Cards三层结构化把信息卡片化为结构化对象典型三层结构卡片级主题、时间戳、字段级键值对、来源级出自哪次会话{type:preference,facts:{drink:无糖气泡水,freq:每周三},source:session-2026-03-15,confidence:0.9}优点可增量更新改一个字段不动全卡、可检索、可回溯来源。这是生产系统的主力格式。缺点结构是人工设计的消歧仍靠约定字段硬扛。3.4 Advanced JSON Cards带 backstory / person / relationship 的消歧设计在 JSON Cards 上加四个关键字段专攻第三层评估backstory信息获取的叙事背景——“为什么存这条”如用户2026年3月投诉酸奶后主动说明乳糖不耐受person信息归属的主体——是用户本人、用户父亲还是用户的孩子relationship主体与用户的关系时间戳信息的时效边界。回到售货柜会员场景李阿姨说给孩子买牛奶要全脂的我自己的话低脂——Simple Notes 存成买全脂牛奶必然出错Advanced JSON Cards 存成两张卡person 分别指向李阿姨本人和李阿姨-孩子下次下单各归各。代价是生成与维护成本最高需要较强的抽取模型。3.5 四种格式的取舍与混合模式格式生成成本检索粒度消歧能力适用Simple Notes极低差无原型期、第一层需求Enhanced Notes低粗弱展示型个人摘要JSON Cards中好中生产主力Advanced JSON Cards高好强关键人物/偏好书的实践结论混合模式——关键且少量的数据核心偏好、关键人物关系用 Advanced JSON Cards 常驻上下文保证可见性海量低频信息用 Simple/JSON Cards 入库靠检索按需取用。这就是双层记忆架构常驻概览 上下文感知检索取细节。四、进阶User as Code——把用户写成可执行代码最前沿的表示把用户记忆写成一个 Python 模块事实是变量行为偏好是函数配合预写日志pre-written logging与检查点checkpoint机制。用户不再是一堆数据而是一段可执行的用户画像调用user.diet_constraint()直接返回约束列表代码天然精确、可版本管理、可单元测试。“知识库当代码库管理每次记忆变更当成一个 PR”——听起来激进但在要求确定性输出的个性化场景自动补货策略、饮食约束里代码的精确性碾压自然语言。这是记忆 → 知识 → 程序演进路线的终点站。五、记忆压缩、整理与隐私压缩与整理记忆不能只进不出。定期任务做三件事——合并重复三次偏好无糖合成一条、淘汰过期去年的临时收货地址、冲突消解新偏好覆盖旧偏好并保留来源。轨迹 → 记忆的抽取本身就是压缩从几万 token 对话里萃取出几十 token 的卡片。日志脱敏与隐私售货柜场景的轨迹里有支付金额、手机号、地址、开门记录萃取消化时的红线敏感字段手机号、支付凭证号不进长期记忆需要时走业务系统实时查询记忆抽取管道全程脱敏进 LLM 前做 PII 打码记忆可删除——用户行使遗忘权时能按 person 精准清除关联卡片这也是 Advanced JSON Cards 结构化的额外红利没有结构就没有精准删除。小结三层次评估框架基础回忆 → 综合关联 → 消歧理解先定目标再选架构记忆三层次轨迹是流水、用户长期记忆是人、业务状态是事别混四种存储格式是能力/成本阶梯Simple Notes → Enhanced Notes → JSON Cards → Advanced JSON Cards生产用混合模式关键信息常驻、长尾信息检索User as Code 代表精确性路线的极限记忆即程序变更即 PR脱敏与可删除不是合规补丁而是记忆系统的一等公民设计约束。记住用户靠记忆系统记住领域知识就要靠 RAG 这颗外挂大脑了。