Agentic Memory - Learning Unified Long-Term and Short-Term Memory Management for Large Language Mo

📅 2026/8/6 9:02:18
Agentic Memory - Learning Unified Long-Term and Short-Term Memory Management for Large Language Mo
Agentic MemoryAgeMem整理日期2026-08-05论文Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model AgentsPDFACL Anthology1. 一句话总结AgeMem 训练 LLM Agent 自己判断什么应该记住或忘掉、什么时候检索旧信息以及当前对话太乱时应该总结或过滤什么。它的重点不是发明新的记忆数据库而是训练一个更聪明的“记忆管理员”。2. 长期记忆与短期记忆长期记忆LTM类似用户档案可以跨会话保存用户偏好重要事实历史经验可复用的任务知识。短期记忆STM类似当前桌面上摊开的材料包括当前对话当前任务Agent 的中间结果从长期记忆中检索出的信息。上下文窗口有限所以 Agent 需要不断整理这张“桌面”。3. 论文要解决的问题传统系统通常由程序员设置固定规则例如每隔若干轮对话总结一次每次回答前固定检索三条记忆上下文超过长度后删除旧内容。这些规则不够灵活。AgeMem 的目标是让 Agent 根据当前任务自主决定何时进行记忆操作。4. 六个记忆工具工具管理对象功能ADDLTM保存新信息UPDATELTM修改已有记忆DELETELTM删除错误或过时记忆RETRIEVESTM从长期记忆检索信息并加入当前上下文SUMMARYSTM将一段长对话压缩为摘要FILTERSTM从当前上下文移除无关内容示例用户我喜欢每次学习 60 分钟 AgentADD“用户喜欢 60 分钟学习” 用户60 分钟太短以后改成 120 分钟 AgentUPDATE“60 分钟”→“120 分钟” 用户按照我的学习习惯安排课程 AgentRETRIEVE“用户喜欢 120 分钟学习”5. 三阶段训练Stage 1学习记什么Agent 先接触一些信息但暂时不知道最后会被问什么。它需要判断哪些内容未来可能有用并选择性写入长期记忆。Stage 2学习如何整理当前上下文系统清空短期上下文但保留长期记忆然后加入大量无关信息。Agent 需要通过FILTER或SUMMARY控制噪声和上下文长度。Stage 3联合使用记忆完成任务正式问题出现后Agent 需要从长期记忆中检索相关信息管理当前上下文完成推理并回答问题。完整流程提前接触信息 ↓ 选择性写入长期记忆 ↓ 加入无关干扰信息 ↓ 过滤或总结当前上下文 ↓ 收到正式问题 ↓ 检索长期记忆并完成推理6. Step-wise GRPO训练时系统根据最终任务是否成功反过来评价前面的记忆操作记笔记 → 整理上下文 → 检索信息 → 完成考试 ↓ 根据考试成绩训练前面的行为优点是早期的记忆操作也能获得训练信号。缺点是归因比较粗糙如果最终回答错误系统不一定能准确判断是保存、过滤、检索还是最终推理出了问题。7. 实验结论实验主要说明仅仅给 Agent 提供记忆工具还不够经过强化学习后Agent 更会判断何时调用工具最终任务成绩明显提高长期记忆质量有所提高当前上下文使用的 token 略有减少在 HotpotQA 上训练出的策略可以迁移到多个受控 Agent benchmark。8. 局限训练数据主要来自 HotpotQA测试环境仍然比较受控尚未验证数月或数年的真实用户记忆记忆质量和答案质量较依赖 LLM Judge奖励函数仍包含不少人工设计规则Step-wise GRPO 不能精确判断每个记忆动作的实际贡献。因此更稳妥的结论是AgeMem 证明了在受控环境中Agent 可以学习统一管理长期记忆和短期上下文但它还没有完全解决真实产品中的长期记忆问题。9. 核心启发过去的思路是程序员规定何时保存、检索和总结。AgeMem 的思路是让 Agent 围绕最终任务目标自己学习何时保存、检索、更新、删除、过滤和总结。最值得记住的一点存储、检索、遗忘和上下文压缩不应该是彼此独立的模块而应该围绕同一个最终任务目标联合优化。