逃离自我确认陷阱:Agent经验学习的执行-蒸馏-验证新范式

📅 2026/8/8 6:36:26
逃离自我确认陷阱:Agent经验学习的执行-蒸馏-验证新范式
Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning作者Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang核心发表机构Zhejiang University、Shenzhen International Graduate School, Tsinghua University、Northwestern Polytechnical University、University of Science and Technology of China、Shanghai Jiaotong University论文链接arXiv:2606.24428v1发布于arXiv 预印本cs.CL|—|—|—|—|| NM (Minimax-M2.1) | 61.5 | 82.2 | 85.5 | 76.4 || NM (Mimo-V2-Flash) | 64.5 | 79.2 | 91.7 | 78.5 || NM (GLM-4.7-FP8) | 64.0 | 78.1 | 96.6 | 79.6 || RB (Minimax-M2.1) | 66.0 | 83.3 | 87.7 | 79.0 || RB (Mimo-V2-Flash) | 64.0 | 83.3 | 94.7 | 80.7 || RB (GLM-4.7-FP8) | 66.0 | 82.5 | 97.2 | 81.9 || Judge (Ensemble) | 66.0 | 84.7 | 93.9 | 81.5 || Router (Ensemble) | 68.0 | 85.2 | 97.2 | 83.5 ||EDV (Ours)|72.0|88.6|99.1|86.6|EDV 在 AIRLINE、RETAIL、TELECOM 三个子域以及平均分数上均取得了最优结果平均 Pass1 达到 86.6比最强基线 Router83.5高出 3.1 个百分点比 ReasoningBank 的最优配置GLM-4.7-FP881.9高出 4.7 个百分点。三组无记忆基线NM仅分布在 76.4–79.6 的区间内表明 EDV 的增益不仅来自骨干模型的能力提升更来自记忆构建机制本身的质量保证。值得注意的是Router 通过能力矩阵在推理时选择求解器也能带来一定提升但 EDV 的收益明显更大——这说明 EDV 的核心增益并不在于“选择了更好的模型”而在于“构建了更好的经验”。Mind2Web 结果Mind2Web 上的结果更为细致地展现了 EDV 的泛化能力和边界。下表列出了各方法与三种骨干搭配 NM/RB以及 Judge、Router 和 EDV 的完整数值%设置指标 (上界)Minimax-NMMinimax-RBMimo-NMMimo-RBGLM-NMGLM-RBJudgeRouterOurscross-TaskEA (74.26)39.9239.0642.3846.7742.6444.4641.3744.3748.62AF1 (74.26)59.1459.7558.3161.8355.7457.7856.0057.0263.10SSR (74.26)34.1933.9537.4842.0138.3140.9235.1440.2843.17SR (24.21)3.573.173.215.553.844.373.064.374.76cross-WebsiteEA (64.82)35.0336.4235.5536.8139.2641.6635.0139.9144.79AF1 (64.82)49.5949.7948.0249.6351.6553.4246.8552.1555.64SSR (64.82)29.1329.7230.2931.7831.1735.8327.6331.7636.56SR (20.34)2.822.824.764.123.394.521.873.394.76cross-DomainEA (65.42)36.2437.9536.4940.0940.4741.1342.6441.8243.39AF1 (65.42)52.0053.5851.7754.2352.2552.9855.7453.3756.38SSR (65.42)31.5233.5332.7336.7736.7637.0738.3138.7439.57SR (18.31)2.742.413.325.053.844.063.844.714.71EDV 在 EA、AF1、SSR 三个指标上的全部九组评测中均取得了最高分展现出稳定的全面优势。在跨任务、跨网站、跨域三种设置下EDV 的 SSR 分别达到 43.17、36.56 和 39.57显示其在完整步骤序列层面具有突出的连贯决策能力。然而在 SR任务级成功率上出现了值得关注的边界cross-Task 设置下最高 SR 由 Mimo-RB 取得5.55cross-Domain 下最高 SR 也由 Mimo-RB 取得5.05EDV 分别为 4.76 和 4.71并非最优仅在 cross-Website 下 EDV 与 Mimo-NM 并列最高4.76。这一结果说明在极严格的全任务成功判定下EDV 的步骤级优势并不能完全转化为任务级最优。可能的原因在于任务级 SR 极易受到任一环节微小错误的影响而检索模块的 Top-10 截断约束对完整导航链条的破坏作用在跨任务和跨域设置中更为致命。EDV 虽然能通过高质量经验减少决策层面的错误但无法完全弥补检索召回瓶颈对整个链条的制约。值得强调的是所有方法的 SR 绝对值都远低于理论上限24.21%/20.34%/18.31%这本身就说明长程网页导航任务在现有检索约束下仍有巨大的改进空间。MMTB 结果MMTB 上的结果进一步验证了 EDV 在多工具协同场景下的有效性MethodOverallA_sglA_chtA_clrA^PA^SA^{SP}Opt.PathAcc.ProgNM Minimax51.5656.6483.2036.7242.0412.509.5229.0529.31NM Mimo46.9056.6469.0531.3741.9418.7511.9014.2241.21NM GLM52.3454.3074.2239.4548.4125.0025.0040.6647.07RB Minimax53.6756.4783.9839.8442.0425.0020.7332.2240.03RB Mimo49.2257.0368.9036.3341.2931.2522.629.6251.09RB GLM52.6155.2075.0041.0247.1018.7527.7138.2447.22Judge54.7957.8175.7843.7550.9625.0025.0038.1753.10Router55.9659.3879.6944.1448.4118.7529.7635.3059.30Ours58.1060.9484.3846.0951.5937.5029.7639.8350.42EDV 在 Overall58.10上取得了最优成绩显著高于 Router55.96和 Judge54.79。在 Action-level 的三个指标上EDV 均取得最高——特别是在A c h t A_{\mathrm{cht}}Acht​84.38和A c l r A_{\mathrm{clr}}Aclr​46.09上的领先幅度较大说明 EDV 的经验不仅能改善工具调用还能提升纯对话交互和主动澄清能力。在 Multi-action 层面EDV 的A P A^{P}AP51.59和A S A^{S}AS37.50均为最优A S P A^{SP}ASP与 Router 并列最高29.76。但值得注意的是在 Trajectory 层面的 Acc. Prog 指标上Router59.30显著高于 EDV50.42。这表明 Router 在部分完成任务的过程中获得了更高的路径完成度——可能是因为推理时选择最合适模型直接作用于每一步决策而 EDV 的记忆引导主要影响整体策略方向在局部路径的“完成进度”上不如直接的模型选择来得立竿见影。不过EDV 在 Opt. Path39.83上仍是最优说明 EDV 引导智能体选择最优路径的能力更强。案例研究三个基准上的定量结果之外论文还通过具体的案例研究展示了 EDV 经验的实际效果。)在τ 2 \tau^2τ2-bench 的机票修改案例中图 7无记忆基线智能体反复尝试使用旅行凭证travel certificate支付改签费用陷入无限循环——它从未意识到该环境中的关键约束旅行凭证对预订修改无效。EDV 智能体则检索到了一条经过验证的经验“Travel certificates are invalid for updates; use credit/gift cards.” 这条经验直接引导智能体绕开了无效的支付方式。图 8 至图 10 进一步展示了该案例的对话细节基线智能体在对话中反复提交凭证支付请求而不断被系统拒绝而 EDV 智能体在获得记忆提示后立即选择了正确的支付工具成功完成了改签。这个案例直观地体现了 EDV 的记忆不是简单的轨迹存储而是经过多智能体共识过滤后的、可直接指导行动的高质量经验——它能帮助智能体跳出单智能体探索的认知上限。)))在 Mind2Web 的案例中图 11任务要求将阿姆斯特丹评分最高的活动加入愿望清单。基线智能体基于关键字匹配选择了“4 up”过滤选项选项 D这是一种立即次优的启发式行为——它没有真正理解“评分最高”意味着需要先获取评分数据再比较。EDV 智能体检索到了验证过的记忆“Verify Information… Actions must lead to actual information retrieval.” 这条记忆引导智能体选择了“Traveler Rating”选项 J实现了从概率匹配到程序化验证的转变。这一对比说明 EDV 的双嵌入检索策略能够注入鲁棒的推理模式缓解孤立探索中的幻觉倾向。在 MMTB 的翻译案例中图 12基线智能体将自然语言描述“English”“Russian”直接作为翻译工具的语言参数未满足工具对 ISO 639-1 代码的严格要求属于典型的“协议幻觉”。EDV 智能体检索到规范感知记忆“Use standardized language identifiers (e.g., ISO 639-1 two-letter codes).”从而将参数修正为 “en” 和 “ru”成功完成任务。图 13 至图 15 展示了这一案例的完整对话过程清晰地呈现了基线失败与 EDV 成功的对比。这个案例揭示了共享记忆系统的独特价值——它不只存储操作提示而是积累“可执行精度”弥合模糊用户意图与严格系统需求之间的鸿沟。4.3 消融实验 / Ablation Study论文在τ 2 \tau^2τ2-bench RETAIL 域上进行了系统的消融研究以 Pass1 为指标逐层拆解 EDV 各设计要素的贡献。渐进式范式消融下表展示从最简单的单智能体经验学习到完整 EDV 的渐进式扩展方法执行智能体数蒸馏角色验证角色Pass1Drop相对完整EDVBasic SA1SelfNone83.3-5.3SA Self-Verify1SelfSelf83.2-5.4SA Indep. Verifier1SelfExternal84.5-4.1MA Self-Distill2ExecutorExecutor85.9-2.7MA Third-Party Distill2ExternalDistill87.1-1.5EDV (Full)2ExternalExecutor88.6–这一系列对比揭示了 EDV 设计的四个关键发现。第一自我确认陷阱是单智能体固有的且内部自我检查无法解决。对比 Basic SA83.3和 SA Self-Verify83.2显式的自我验证不仅没有带来提升反而有轻微的性能下降。单一模型在自我审视时倾向于认可自己的错误但自洽的推理这一现象为“自我确认陷阱”提供了直接的实验证据。第二仅解耦执行与验证角色收益有限。当单智能体执行、外部独立验证器进行审查时SA Indep. VerifierPass1 仅提升至 84.51.2。根本原因在于单条轨迹无法为验证者提供充分的比较参照来识别深层错误——验证者能发现明显的逻辑断裂却难以辨认出那些在局部语境中看似合理的系统性盲区。这说明轨迹多样性是高质量验证的必要前提。第三多智能体执行与第三方蒸馏的组合有效释放了多元轨迹的价值。当执行扩展到两个智能体时MA Self-DistillPass1 提升至 85.9但由执行者自我蒸馏存在严重的选择偏差——执行组倾向于保留与自己认知一致的经验从而浪费大部分信息增益。换用中立第三方蒸馏后MA Third-Party DistillPass1 显著提升至 87.1说明第三方蒸馏器能够更有效地从多轨迹对比中提取可泛化的跨轨迹经验。第四共识验证是最终的质量把关。完整 EDV第三方蒸馏 执行组共识验证达到 88.6比 MA Third-Party Distill 再提升 1.5。即使蒸馏器是第三方它仍有自己的认知局限执行组的一致验证可以进一步过滤掉蒸馏器未能察觉的残余错误。六个配置的递进关系清晰地展示了 EDV 各阶段各自的贡献从单智能体到多智能体的解耦带来了 2.6 的提升第三方蒸馏带来了 1.2 的提升共识验证则带来了最后的 1.5 的提升。组件消融论文进一步消融了 EDV 的推理时组件类别变体配置Pass1Drop基线EDV-Full动态能力矩阵 共享/私有记忆层次88.6–能力矩阵EDV-Fixed移除能力矩阵固定最佳单一求解器86.6-2.0记忆层次EDV-Only-Shared移除私有记忆全部存入共享库85.7-2.9记忆层次EDV-Only-Private移除共享记忆全部存入私有库85.9-2.7移除能力矩阵导致 2.0 的性能下降。能力矩阵通过任务-求解器匹配带来稳定的边际增益它使得 EDV 能够在推理时选择最合适的智能体——这种选择不是盲目的而是基于经验构建阶段积累的“哪类任务由哪个智能体处理更好”的分布知识。移除记忆层次带来了更大的性能下降强制将个性化经验放入共享记忆会导致误用——部分智能体并不适用于该经验描述的情境检索到它反而产生干扰移除共享记忆则损害了跨智能体的知识共享和泛化能力。对记忆使用情况的进一步分析揭示了两种记忆类型的互补角色共享记忆的检索率为 72.3%每次命中带来 3.2% 的成功率增益对整体性能贡献 2.3%私有记忆在 31.8% 的任务中被检索每次命中增益 1.8%总贡献 0.6%。两者合计贡献 2.9%说明私有记忆在近三分之一的边缘任务中补充了共享记忆的覆盖盲区层次化设计不可被扁平结构替代。记忆质量审计论文在τ 2 \tau^2τ2-bench RETAIL 域上对实际存入记忆库的条目进行了人工审计5 分制指标RBEDV变化Groundedness/Correctness3.724.41↑ 0.69Actionability3.584.32↑ 0.74Specificity3.644.27↑ 0.63Noise/Hallucination1.210.63↓ 0.58Potential Harm if Reused1.080.51↓ 0.57EDV 在正确性、可操作性、具体性三个积极维度上全面优于 RB同时在噪声水平和误用潜在危害两个消极维度上显著低于 RB。这一结果直接量化了 EDV 在记忆插入前过滤低质量信息的能力共识验证机制不仅是性能层面的提升手段更是记忆库内容质量的源头保障。对记忆污染的敏感性为了直接模拟自我确认陷阱的危害论文以 RB 为基线向 RETAIL 任务注入错误但内部连贯的经验如错误的支付规则占总记忆量的 10%。结果显示RB 在τ 2 \tau^2τ2-bench RETAIL 域的 Pass1 从 82.5 急剧下降至 77.2下降 5.3 个百分点。这一结果结合记忆质量审计构成了强有力的证据链错误经验一旦进入记忆库其危害远不止“无效”——它们会主动误导后续任务导致正确行为被覆盖。而 EDV 之所以在真实环境下表现稳健正是因为它的共识验证机制在源头上截断了这类错误记忆的入库路径。训练收敛与扩展性分析论文在附录中提供了 EDV 与 ReasoningBank 在训练收敛、检索记忆数量扩展性以及召回阈值敏感性三方面的对比分析。图 4 展示了两种方法在不同训练 epoch 下的 Pass1 变化。EDV 在每个训练阶段均显著优于 RB差距约为 7%–9%。RB 在第二个 epoch 后出现停滞甚至下降从 0.830 降至 0.815而 EDV 保持了持续上升的趋势并在第 4 个 epoch 达到峰值 0.909。这表明 EDV 的经验库构建路径不易被低质量记忆的累积所阻塞能够持续从新任务中提取增益。图 5 展示了检索记忆数量对性能的影响。无经验时两种方法基线相同0.781。随着检索记忆数增加EDV 呈稳健的单调提升在检索 3 条经验时达到 0.886而 RB 在检索 1 条经验时达到峰值 0.825之后下降至 0.793。RB 的下降很可能源于低质量或不相关经验的“干扰”效应——随着检索数量增加一些由单智能体自我确认产生的错误记忆被引入上下文反而破坏了决策质量。EDV 更优的过滤与整合机制使其能够有效利用更多的检索数据而不被噪声阻碍这再次印证了“记忆质量比记忆数量更重要”的核心主张。)图 6 考察了召回阈值τ \tauτ对 EDV 性能的影响。EDV 在广泛的阈值范围内保持稳定Pass1 始终高于 0.860。最优阈值为τ 0.8 \tau0.8τ0.8得分 0.886当τ \tauτ提高到 0.9 时出现轻微下降说明过严的阈值会过滤掉部分潜在有用的经验而低阈值可能引入噪声。整体呈钟形曲线这一结果不仅为超参数调整提供了直接指导也从侧面说明 EDV 对阈值不敏感的特性使其在实际部署中具备较强的鲁棒性。推理效率论文还报告了 EDV 在推理效率方面的优势。在 RETAIL 子集上EDV 相比 ReasoningBank 在取得更好性能的同时将平均推理 token 消耗降低了 24.5%。这一效率提升来源于两个因素一是 EDV 存储的高层战略经验能从全局视角减少冗余操作步骤二是高质量记忆的引导让智能体在更少的尝试内找到正确路径。EDV 将长时程问题求解的成本从重复在线搜索转移到了高质量的离线经验构建实现了效果与部署成本的更好平衡。原论文对应图片Experience Helps on2 ^22-Bench: A Qualitative Case Study.)原论文对应图片Experience Helps on2 ^22-Bench: A Qualitative Case Study.)原论文对应图片Experience Helps on2 ^22-Bench: A Qualitative Case Study.)原论文对应图片Experience Helps on2 ^22-Bench: A Qualitative Case Study.)五、相关工作 / Related WorkEDV 的研究横跨两个紧密相关的领域智能体经验学习/记忆和多智能体协作。在经验学习与智能体记忆方向已有大量工作探索了如何让智能体从历史交互中积累可复用的知识。代表性工作包括 AgentEvolver、FLEX、Learning on the Job、Seed-Prover 1.5、MetaAgent 等它们普遍依赖从历史执行轨迹中提取经验。在智能体记忆方面ReasoningBank 证明了将原始轨迹蒸馏为推理记忆后比直接使用轨迹更可复用General Agentic Memory 提出了分层记忆组织方案CoPS 则探讨了单智能体跨任务经验共享。这些工作的共同特征是经验构建过程大多遵循单智能体闭环——同一个模型既执行任务又通过自我反思来总结经验并决定记忆内容。正如论文第二章所分析的这一模式在无真值反馈的开放世界环境中面临自我确认陷阱的系统性风险。EDV 与它们的根本区别在于将经验构建的完整管线拆分为执行、蒸馏、验证三个独立环节并引入了第三方蒸馏和共识验证这两个专门针对“自我确认偏差”的对抗性机制。在多智能体协作方向X-MAS 强调模型异质性在协作中的价值CoMAS 关注多智能体交互驱动的改进Multi-Agent Evolve 探索了智能体的共同演化Xolver 则将多智能体协作与经验积累结合起来。这些工作与 EDV 的区别在于关注点的不同它们主要利用多智能体来提升单任务的解决性能或者关注经验在智能体之间的分享与转移但并未系统性地利用多智能体分工来提升经验构建本身的可信性。EDV 将多智能体的协作聚焦于经验构建阶段的验证与过滤——异构执行提供了多样性的证据基础第三方蒸馏提供了独立的分析视角执行组共识则构成了最终的质量闸门。这种“为记忆可靠性而协作”的定位是 EDV 与已有方法在范式层面最显著的差异。六、局限性与展望 / Limitations Future Work论文在讨论局限时坦诚地指出了 EDV 面临的三个主要挑战。首先共识偏差风险Risk of Consensus Bias。EDV 的验证机制依赖异构智能体的一致性判断来确保经验可靠但如果异构智能体共享某个失败模式——例如它们基于相似的预训练数据产生了相同的错误倾向——那么共识机制可能无意中验证噪声。换言之共识并不等同于正确它只是降低了单个体犯错的概率但无法消除群体层面的系统性偏差。这一局限在高度同质的模型池中尤为突出提示实际部署时应尽量选择训练分布差异更大的模型组合。其次低质量智能体的干扰问题Interference from Low-Quality Agents。在执行组中一个明显表现不佳的智能体可能阻碍共识达成——它对候选经验投出的否决票可能并非基于合理的判断而是源于自身能力的不足。这会使验证过程过度保守将本应有价值的经验也一并丢弃。如何在验证机制中区分“合理的否决”与“能力不足导致的否决”是一个值得深入的问题。最后归因困难Attribution Difficulty。在 EDV 中蒸馏器与执行器之间存在多轮交互这使得失败归因的复杂度远超线性系统——当经验验证失败时问题可能出在执行轨迹的多样性不足、蒸馏器提取了错误的信息、验证机制过于严格等多个环节定位具体环节需要额外的分析成本。此外从系统设计角度看还有两个值得关注的潜在局限。记忆库采用最小增量更新策略新记忆只做追加不做聚类、去重或剪枝。这虽然有利于实验的可归因性——避免复杂记忆管理模块引入混淆变量——但长期运行会使记忆库无限增长带来检索效率和上下文噪声的问题。另外EDV 依赖多个异构商用 API 的调用经验构建阶段的离线运行虽然有可并行化的优势但总体的计算和 API 成本仍然高于单智能体方法这可能限制其在资源受限场景下的应用。论文指出的未来工作方向主要有两个。第一是长期记忆动态管理由于记忆库会持续增长作者计划引入“记忆价值函数”memory value function来进行智能剪枝与合并丢弃过时数据并合并相似记忆从而在保持记忆质量的同时控制记忆库规模。第二是自适应智能体扩展在推理时根据任务复杂度动态调整参与执行的智能体数量并分析“异构性扩展定律”Scaling Laws of Heterogeneity——刻画智能体池从约 3 个扩展到约 10 个时性能的变化规律为构建更大规模的协作智能体系统提供理论指导。七、总结 / ConclusionEDV 论文的核心贡献在于识别了一个此前未被充分正视的系统性问题——单智能体经验学习中的自我确认陷阱——并给出了一个结构清晰、实证充分的解决方案。通过将经验构建过程解耦为 Execute、Distill、Verify 三个阶段EDV 完成了从“孤立自我反思”到“协作构建与过滤”的范式转换。多智能体的并行执行提供了轨迹多样性第三方对比蒸馏消除了执行者中心的总结偏差执行组共识验证则确保了写入记忆的每一条经验都经过了多视角的审查。在τ 2 \tau^2τ2-bench、Mind2Web 和 MMTB 三个基准上的实验表明EDV 一致地超越了无记忆基线、单智能体记忆方法ReasoningBank以及推理时集成方法Judge、Router在绝大多数指标上取得了最优结果。系统的消融研究进一步揭示了每个阶段的独立贡献而记忆质量审计和污染敏感性实验则直接证明了 EDV 在记忆写入前过滤错误和噪声内容的能力。更深远的意义在于EDV 的实验证据有力地支持了一个关于智能体自我进化的本质洞见有效的自我进化不仅取决于积累多少经验更取决于在记忆插入之前构建的经验有多可靠。当智能体不再被自己的认知盲区所禁锢而是通过群体的多样化视角和共识验证来建立对世界的判断它才真正获得了持续进化的坚实基础。原文摘要:Experience-driven self-evolution is critical for large language model (LLM) agents to improve through open-world interaction. However, existing experience learning methods mostly rely on single-agent loops, where the same agent executes tasks, summarizes outcomes, and determines memory content. This setup makes agents vulnerable to the Self-Confirmation Trap: wrong-but-self-consistent trajectories are misidentified as successful experience, leading to cumulative errors during retrieval and reuse. To address this issue, we propose EDV, an Execute-Distill-Verify framework for reliable experience learning. In the Execute stage, multiple heterogeneous agents explore the same task space in parallel to generate diverse candidate trajectories. In the Distill stage, a dedicated third-party agent comparatively analyzes these trajectories to produce candidate experiences, reducing executor-centric summarization bias. In the Verify stage, the execution group validates candidates via a consensus mechanism, and only approved experiences are written into shared or private memory. By decoupling the three stages, EDV transforms experience learning from isolated self-reflection into collaborative construction, filtering erroneous and noisy content before memory insertion. We evaluate EDV on three challenging long-horizon benchmarks: tau2-bench, Mind2Web and MMTB. Results show EDV consistently outperforms strong baselines, validating that reliable experience construction is essential for robust agent self-evolution. Our code is available at https://github.com/shidingz/EDV.PDF链接:https://arxiv.org/pdf/2606.24428v1部分平台可能图片显示异常请以我的博客内容为准