Agent 训练的新信号:模型不只要“做对”,还要学会复盘自 📅 2026/7/25 5:13:51 今天分享一篇来自清华大学关于 Agent 强化学习的最新论文个人感觉写的很好故分享给大家。这篇文章没有设计一个更复杂的 RL 框架而是抓住了一个很现实、也很容易被忽略的问题我们现在训练 Agent往往只告诉模型一件事最后任务有没有完成。但一个 Agent 真正出问题的地方通常不在最后一刻。它可能前面搜索路径是对的只是在核对商品规格时漏了一项也可能最终完成了任务但中间绕了很多无效步骤。也就是说模型拿到了“成败结果”却没有真正学到“过程经验”。 这篇论文想解决的正是这个问题能不能让 Agent 在训练时学会复盘自己把成功经验和失败教训变成下一次行动的能力。Figure 1: Overall performance overview对短任务来说这个问题还不致命。答一道数学题、写一段代码、做一次单轮问答最终结果本身就能提供相当强的信号。但 Agent 不一样。它要多轮交互要查信息要调用工具要从环境反馈里修正动作。一次失败轨迹里可能前 80% 都是对的只是最后买错了商品规格一次成功轨迹里也可能藏着一套可复用的搜索策略。传统 outcome-based RL 只看终局奖励很容易把这些中间经验压扁成一个标量。这就是论文里说的 supervision gap终局级奖励和 token 级策略学习之间存在监督粒度差距。SEED 的判断是完整轨迹结束之后里面其实多了很多“在线决策时看不到的信息”。结束之后再看才知道哪个观察是关键哪个工具调用是多余的哪个动作导致失败哪套流程可以复用。这件事很像工程团队做 postmortem。线上事故发生时大家只能救火事故结束后复盘才知道真正的问题是监控缺口、回滚流程还是某个隐含假设错了。SEED 把这种复盘机制放进了 Agent 训练。SEED 怎么做先复盘再蒸馏SEED 分两步。第一步先让模型学会“看轨迹、写技能”。研究团队先收集离线轨迹再用外部分析器给每条完成轨迹生成 hindsight skill也就是事后技能。成功轨迹里技能可能是可复用工作流失败轨迹里技能可能是避错规则。第二步进入真正的自进化训练循环。当前模型先作为 actor 去环境里跑轨迹。轨迹结束后同一个模型又切换成 analyzer分析自己的完整轨迹生成 hindsight skill。Figure 2: Overview of SEED然后关键动作来了SEED 不把这个 skill 直接塞到推理 prompt 里而是在训练时做一次对照。同样的动作 token模型分别在普通上下文和“带复盘技能”的上下文下重新打分。如果某个 token 在带技能上下文里概率明显更高说明这个技能支持这个动作SEED 就把这种概率变化转成稠密的 token 级蒸馏信号。最后这个 OPD 蒸馏损失和 GRPO 这样的结果奖励一起优化。所以 SEED 的训练信号有两层一层来自环境最终结果告诉模型“这局有没有赢”另一层来自复盘技能告诉模型“哪些具体动作更像是好决策”。推理时则不需要额外技能库、检索模块或加长 prompt。论文强调hindsight skill 只作为训练期特权信息最终被内化到模型参数里。这点很重要。因为很多 Agent 方案的代价是推理时越来越重更长上下文、更多记忆、更多检索、更多规则。SEED 走的是另一条路训练时多做复盘部署时保持干净。结果最有意思的地方小模型也明显吃到红利以 Qwen2.5-3B-Instruct 为例SEED 在 ALFWorld 平均成功率达到 91.8%而 GRPO 是 75.0%WebShop 成功率从 GRPO 的 63.3% 提升到 78.9%。在 Qwen3-1.7B-Instruct 上差距更夸张ALFWorld 平均成功率从 GRPO 的 46.1% 提升到 92.0%WebShop 成功率从 38.3% 提升到 77.3%。Figure 3: Training curves and interaction efficiency这说明 SEED 的价值不只是“多一个技巧”。它尤其适合那些还没有强大规划能力的小模型。小模型最缺的往往不是最终奖励而是中间过程里的可学习信号。更值得注意的是样本效率。论文显示在 ALFWorld 上SEED 只用 60% 训练数据就达到 80.7%超过 GRPO 用 100% 数据得到的 75.0%。在 WebShop 上SEED 也在不同数据比例下持续优于 GRPO。Figure 4: Sample efficiency analysis这背后的含义很现实Agent 训练贵不只是因为模型大还因为环境交互、轨迹采样、评估验证都很贵。如果每条轨迹只能提供一个最终奖励数据利用率就很低。SEED 试图从同一条轨迹里榨出更多监督。它和“写更好的 prompt”不是一回事很多人看到 hindsight skill第一反应可能是这不就是把经验总结成 prompt 吗不是。论文里对比了 Skill-Prompt 和 Skill-GRPO。结果显示只在推理时把技能塞进上下文效果不如把技能蒸馏进模型。SEED 在大多数聚合指标上都超过了带技能推理的 Skill-GRPO。这点对 Agent 产品很有启发。过去一年很多 Agent 系统都在堆 prompt、堆 memory、堆 workflow。短期看有效但长期会遇到几个问题上下文膨胀、规则冲突、检索噪声、推理成本上升。SEED 的方向更像是把经验从“外部提示”变成“内部能力”。这并不意味着 memory 和 workflow 不重要而是说明真正可规模化的 Agent 训练不能只靠运行时把说明书越写越长。它需要把高频、稳定、可迁移的行为模式压进模型本身。Figure 6: Qualitative comparison on ALFWorld但也别把 SEED 看成万能解SEED 仍然有几个需要保留判断的地方。第一它依赖轨迹质量和环境反馈。没有可验证任务、没有稳定环境、没有成败信号就很难形成可靠循环。第二它前期仍然需要外部分析器。论文中 SFT 阶段使用 GLM-5.2 来生成初始 hindsight skill。后续虽然变成自进化但启动阶段不是完全无监督。第三实验仍主要集中在基准环境。ALFWorld、WebShop、Search QA 能代表一类长程 Agent 问题但真实企业工作流更混乱权限、异常状态、工具不稳定、业务规则变化都会影响复盘质量。第四复盘本身也可能学偏。如果模型的 analyzer 能力不足它总结出来的“技能”可能只是漂亮但错误的解释。SEED 用 on-policy 和置信门控缓解这个问题但不能彻底消除。所以更准确的判断是SEED 不是把 Agent RL 问题解决了而是给出了一条很值得跟进的训练范式。Agent 的下一步可能是“会做事”到“会复盘”过去我们评价 Agent经常看它能不能完成任务。接下来更重要的问题可能是它能不能从自己刚刚做过的任务里提炼出下一次更少走弯路的经验。这也是 SEED 最有价值的地方。它把 Agent 训练从“结果驱动”往“经验内化”推了一步成功不是只拿来加分失败也不是只拿来扣分。每条轨迹都可以变成更细的监督每次行动都可能反过来改善模型的复盘能力。如果这条路线继续走下去Agent 系统的竞争点会发生变化。不是谁能写出最长的 system prompt也不是谁能堆最多外部记忆而是谁能把真实交互中的经验更高效地变成模型自己的能力。对开发者来说这个信号很明确未来做 Agent不只是设计 workflow还要设计可复盘、可验证、可蒸馏的经验闭环。能完成任务只是第一步。能从完成和失败中持续长出新能力才是 Agent 真正开始变强的地方。参考资料论文https://arxiv.org/abs/2607.14777今日荐文如何从零开始成为一名智能体人工智能工程师深度爆料训练一个层就能吊打全参数大模型RL后训练惊现“权力中心”DSparkDeepSeek 如何让大模型推理提速 85%Codex 插件进了 Claude CodeAI 编程开始从“单模型冲锋”变成“多模型协作”Agent记忆框架选型自己搭还是用开源AIHOT 更新了一版这次它更像一个真正能用的信息工作台谷歌DeepMind最新报告AGI之后人类将面对什么任何文件都可转 Markdown一个值得收藏的 Agent 开发工具智能体开发实战从零开始构建 Claude Code五Skill 机制与按需加载领域知识我最近是怎么用 Codex 的把它真正用顺手的 6 个方法大多数公司根本没有为 AI 做好准备Claude 越来越能干活Anthropic 先解决的却是“它最多能闯多大祸”如果你对大模型的前沿技术感兴趣欢迎关注“大模型视界”一起学习更多AI知识这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容