反思五轮,不如一次命中:EMG 把 Agent 纠错改成图匹配

📅 2026/8/5 14:33:16
反思五轮,不如一次命中:EMG 把 Agent 纠错改成图匹配
同样面对长程任务里的失败EMG 没有让模型在测试时反复“想一遍、试一遍”而是提前把失败轨迹与成功轨迹的差异算成可检索的纠正路径。在 ALFWorld 已见测试集上Qwen3-4B 搭配 EMG 只执行 1 轮成功率达到 53.57%。Reflexion、ExpeL 和 CDMem 最多执行 5 轮后最好结果是 ExpeL 的 38.57%。换到 ScienceWorld 已见测试集和 DeepSeek-V4-FlashEMG 单轮成功率为 28.87%最好迭代基线仍是 ExpeL为 19.07%。这份差距不只体现在排行榜上。ScienceWorld 的 Qwen3-4B 实验中EMG 在已见和未见测试集上的总推理时间分别为 116 分钟和 113 分钟三种迭代式基线对应的区间是 397-478 分钟和 432-499 分钟。这里的“单次”很容易被误解。它指每个测试任务只执行一轮与训练样本数无关也不代表模型犯错后瞬间自愈。纠错工作已经提前发生系统在训练集上比较失败探索轨迹与成功专家轨迹把差异整理成记忆测试时检索后直接执行。论文真正追问的是Agent 的失败恢复能否少依赖模型临场反思改成一个可计算、可复用的图匹配问题把失败恢复从“现场反思”搬到测试前常见的反思-重放方法会在任务失败后让 LLM 解释原因、修改计划再从环境里走一遍。它的问题很直接反思是否靠谱取决于模型和提示词每多跑一轮延迟、Token 与工具调用都跟着增加围绕当前测试任务写出的教训也未必能迁移到下一个任务。EMG 的处理顺序相反。训练阶段先为同一任务准备一条探索轨迹和一条成功专家轨迹再把二者转成可比较的动作决策图。失败图里已经走对的部分被保留走错的部分被编辑相似任务之间重复出现的正确动作模式则被提炼成跨任务经验。测试开始后Agent 只读取相关记忆不再进入失败、反思、重跑的循环。轨迹变成图以后错误才有了可编辑的位置一条普通轨迹只是按时间排列的观测与动作。把它直接交给 LLM模型要在很长的上下文里猜“最早是哪一步带偏了后续”。EMG 先换一种表示节点存动作边存执行下一个动作之前看到的观测。动作还会被归一化成“类型、对象、容器”这样的元组例如“拿取、苹果、桌子”同时保留原始动作文本方便最后生成可读经验。这套表示有两个细节很实用。第一个是节点复用。同一个动作在不同状态下再次出现时图里沿用原节点只增加带有新观测的入边。于是系统能看出“同一动作在什么条件下成立”而不是把每次出现都当成无关步骤。第二个是把连续无效动作并列起来。假设 Agent 在同一个有效状态下连续尝试了两个动作环境都只回复“nothing happened”随后第三个动作才真正改变状态。顺序轨迹容易把三个动作误读成一条因果链动作决策图会把它们都连回同一个决策点。这样提取出的纠正经验是“在观测o1 下避开a2 和a3”不会变成“看到无信息反馈o2 后避开a3”。公共子图负责保留编辑路径负责纠错对第i个训练任务探索轨迹对应的动作决策图记为Gi成功专家轨迹对应Gi∗。下标i表示任务编号星号表示作为参照的专家图。图匹配后EMG 得到公共子图Gic 和图编辑路径Gie上标c指共同部分上标e指把探索图改成专家图所需的编辑操作。公共子图回答“哪些步骤已经走对应该保留”。编辑路径回答得更具体在某个观测下删除哪个动作、补上哪个动作或者把一个动作重新标记成什么。论文用支持带标签边的 FGWAlign 做无监督图匹配同时比较节点标签与图结构。由于轨迹图通常只有几十个节点文中给出的求解复杂度O(||3 · |ℒ|) 仍在可处理范围内 是节点集合ℒ 是边标签类型集合。这些图操作本身不会给基础模型回传梯度也不会更新模型权重。公共子图和编辑路径还要经过一次 LLM 总结才变成 Agent 能读懂的自然语言经验。换句话说EMG 把“找出哪里错了”交给图计算但没有彻底移除 LLM。节点修正当前任务边提取可迁移的工作流经验记忆图里的节点与边分工不同。节点保存任务内经验探索成功时记录公共工作流探索失败时记录纠正路径在 ScienceWorld 这类连续奖励环境中部分成功的轨迹会同时保留正确部分和修正意见。边负责跨任务经验。系统先用查询嵌入找出语义相近的训练任务再匹配它们各自的专家图提取共同子图。例如“把铅笔放到架子上”和“把钢笔放到桌上”目标不同却可能共享“先找到并拿起物体再导航到目标位置”的高层动作模式。这类共性被存在任务节点之间的边上。测试时新查询先检索相似度最高的 top-K个节点再从每个节点的邻居里取 top-T条相关边。节点经验告诉 Agent 当前任务哪里容易错边经验补上可迁移的做法。随后二者一起进入提示词Agent 开始唯一一次执行。两个已见测试集上一轮都压过五轮论文在 ALFWorld 和 ScienceWorld 上评估 EMG。前者是具身家庭任务奖励只有成功或失败后者模拟交互式科学实验轨迹更长奖励可以反映部分完成度。指标包括成功率SR和平均奖励AR。测试模型分别是 Qwen3:4B-Instruct-2507-Q8 与 DeepSeek-V4-Flash。基线包括无记忆的 ReAct、使用反思或经验记忆的 Reflexion、ExpeL、CDMem 和 MemP其中 Reflexion、ExpeL、CDMem 最多运行 5 轮。论文主表中EMG 在两个模型、两个数据集以及已见和未见划分的全部 SR/AR 指标上都取得最高值。测试设置最佳迭代基线最多 5 轮EMG1 轮绝对提升ALFWorld 已见 / Qwen3-4B38.57%ExpeL53.57%15.00 个百分点ScienceWorld 已见 / DeepSeek-V4-Flash19.07%ExpeL28.87%9.80 个百分点表 1在论文选取的两个已见测试设置中EMG 单次执行与最佳五轮迭代基线的成功率SR对比。这个比较已经尽量照顾迭代方法表中采用基线最多跑 5 轮后的最好成绩没有停在第一轮。ALFWorld 上差 15.00 个百分点ScienceWorld 上差 9.80 个百分点。至少在这两组实验里多次反思没有追上提前整理好的结构化经验。消融结果暴露了小模型对跨任务经验的依赖EMG w/o NE 去掉节点和边相当于没有记忆的 ReActEMG w/o E 只保留节点不保留跨任务边。三者的差值把两类记忆的作用拆开了。在 ALFWorld 未见测试集上Qwen3-4B 的成功率从无记忆时的 21.64% 跳到仅节点记忆的 52.99%加上边后达到 60.45%。这里单个任务里的纠正路径已经解决了大部分问题跨任务经验继续补了一段。ScienceWorld 对小模型更难。Qwen3-4B 的未见成功率只从 8.53% 升到 9.48%加入跨任务边后才到 16.11%。同一设置换成 DeepSeek节点记忆已经把 13.74% 推到 23.22%边只再推到 24.17%。论文据此判断大模型自身的迁移能力更强小模型更需要显式的跨任务工作流。116 分钟对 397-478 分钟省的是在线重试时间实验使用 Qwen3-4B 和 ScienceWorld。已见测试集上EMG 总计 116 分钟CDMem、Reflexion、ExpeL 分别是 397、406、478 分钟未见测试集上EMG 是 113 分钟三种基线分别是 456、432、499 分钟。这些数值属于论文给定任务规模和运行配置不能直接换算成任意线上系统的延迟。不过成本来源很清楚迭代方法需要反复调用模型并重新与环境交互EMG 每个测试任务只跑一轮。只要单次执行仍占据主要成本减少重跑次数就会直接缩短总时间。省下测试成本之前先要支付离线成本EMG 没有消灭纠错成本只是把它移到测试前。论文使用 DeepSeek V3.2 收集探索轨迹构建 ScienceWorld 记忆图时使用 DeepSeek V3.2构建 ALFWorld 记忆图时使用 DeepSeek V4-Flash。每个训练任务还需要一条成功专家轨迹。图匹配之后LLM 要把公共子图和编辑路径写成自然语言经验。这笔投入适合被大量测试任务摊薄。如果业务不断重复同类流程且能积累可靠的成功案例离线建图可能比线上多轮试错划算。若任务几乎不重复、环境变化很快或者成功轨迹本身难以获得记忆图的维护成本就可能吞掉节省下来的推理时间。专家轨迹和两个文本基准限定了结论的范围专家轨迹是当前版本的前提。论文没有解决“没有成功示范时如何构建纠正路径”作者把它留作后续方向。图匹配可能不是全局最优。论文引用 FGWAlign 的原始评估称几十个节点的图对上预测编辑路径相对真实最短路径的召回率约为 90%。次优匹配仍能生成一条把探索图改成专家图的合法路径但可能多出冗余操作。这里的“合法”是图变换意义上的合法不等于真实环境里必然安全。证据来自两个文本交互基准。ALFWorld 和 ScienceWorld 能检验长程规划与迁移却不能代表网页操作、软件工程或真实机器人。论文目前是 arXiv v1实验结果也未在本文章制作过程中独立复现。还有一个容易被标题遮住的事实EMG 仍然让 LLM 总结经验并让 LLM 在测试时执行。它删掉了测试阶段的反思循环模型不确定性依旧存在。错误一旦结构化纠错就不必每次从零生成很多 Agent 纠错方案把主要精力放在“怎样让模型反思得更聪明”。EMG 换了一个更工程化的问题能否先把失败表示成可以比较的结构再从成功样本里算出修改路径这个思路未必只属于动作决策图。只要任务有重复结构、过程能被记录、成功标准足够明确就可以尝试把错误从一段模糊的文字总结改写成“在什么状态下哪个决策应被保留、删除或替换”。模型仍然负责执行但纠错依据不必每次都从零生成。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】