LLM Agent的自进化方法研究综述

📅 2026/8/10 12:15:37
LLM Agent的自进化方法研究综述
一、Agent自进化RSI简述Agent自进化RSI已成为LLM Agent在垂直领域可靠落地的最热门前沿课题之一其核心思路是让Agent在运行过程中不断自我修正做到越用越好、越用越聪明。目前行业共识正从投入巨资打造全能行业模型转向推动通用模型在具体场景中持续自我进化。自我修正的核心方法论可以概括为一句话不只看结果更要看过程。具体来说就是充分利用以下三类信息源执行过程轨迹Agent在完成任务过程中的每一步推理、每一次工具调用、每一个中间状态构成了丰富的“过程数据”。这些轨迹中隐藏着比最终结果更丰富的信息——成功的步骤可复用失败的步骤可标记和规避。历史记忆跨任务、跨时间积累的经验库包括过去的成功案例、失败教训、环境认知等让Agent不必每次从零开始。人工参与的反馈领域专家对Agent行为的纠正、评价和引导。在金融等专业领域人类专家的经验和直觉仍然是不可替代的稀缺资源将这些隐性知识显性化是Agent进化的重要推力。从这些信息中抽取出有效且明确的信号即“显性信噪”后有两条核心的固化路径参数固化训练路径将经验通过后训练内化到模型参数中。优点是模型推理时无需外部依赖经验已成为模型“本能”缺点是训练成本高、迭代周期长。外挂固化非训练路径将经验沉淀为外挂Harness的上下文、记忆或可复用技能Skill。优点是灵活轻量、可快速迭代缺点是依赖检索和上下文窗口。两条路径并非互斥而是协同进步的外挂记忆和技能库的不断积累为下一轮参数固化提供了高质量训练数据来源而参数能力的提升又让Agent能更高效地利用外挂知识。这种“参数-外挂”双循环协同进化模式构成了Agent自进化体系的核心架构。二、代表性方法探研当前Agent自进化方向上涌现了大量研究。按照是否进行模型参数更新可大致分为“训练”与“非训练”两大类。以下选择五篇代表性论文进行简要介绍分别代表了这两类路径的前沿探索。1. SEED自我演化的在线策略蒸馏训练类SEEDSelf-Evolving On-Policy Distillation来自清华大学等机构解决的核心问题是强化学习训练Agent时往往只在任务结束后给一个“成功/失败”的笼统奖励Agent根本不知道自己几十个动作里哪个做对了、哪个做错了——就像老师只告诉你期末考试及格与否却不告诉你哪道题错了。SEED的核心思路可以用一句话概括让AI做自己的私教。具体做法分为两步第一步先用强模型如GLM-5.2微调教会待优化模型“事后复盘”的能力。对一批历史轨迹写“事后总结”——成功的总结套路失败的总结教训然后让待优化模型学着写这种总结。第二步则是精髓——让模型边训练边自我复盘边内化。每次训练时先用当前模型跑一批任务得到轨迹然后让同一个模型“换个身份”当分析员回头看自己的轨迹提炼出“事后技能”关键的一步——把同一批动作样本放在两个不同背景下重新打分一个版本给模型看事后技能当“老师”另一个不给看当“学生”。两个版本的打分差距就是该动作“该不该做”的精细信号被摊到轨迹中每一个token上作为稠密学习损失并与GRPO的环境奖励损失结合一起优化模型。最妙的设计是事后技能只在训练时当“私教”推理时完全消失所有经验已被“吃进”模型参数里。模型越训越强后既能跑得更好、复盘也复得更好两者手拉手一起进化——这就是“自演化”的精髓。消融实验还发现用静态经验库替代“自己当下跑出来的经验”掉分最狠恰说明on-policy的自演化才是这套方法的命根子。2. LLM-as-a-Coach体验式学习的教练模型训练类LLM-as-a-Coach来自微软研究院提出了“体验式学习”Experiential Learning, EL框架。传统RL用评估模型Judge给答案打分只输出一个标量分数但评估过程中产生的大量文本分析被全部丢弃了。这就是信息瓶颈两个答案同样得7分但一个逻辑更强、一个文笔更好优化器无从区分。EL的核心创新是把评估模型从“裁判”升级为“教练”。教练的产出不只是一个分数而是一段“可迁移的经验知识”——通用的、可复用在类似任务上的改进建议。该框架涉及三类模型策略模型优化对象中小规模、评估模型越强越好必然优于策略模型、教师模型策略模型的初始冻结副本。训练时将经验知识作为额外上下文输入教师模型教师与策略模型对同一回答分别计算每个位置下一个token的概率分布然后计算两个分布的反向KL散度作为损失让策略分布向教师靠拢。这段经验知识的信息量是标量奖励的数千倍能提供远超分数的稠密监督信号。实验显示EL在开放式任务上一致优于基于评分的RL泛化性更好不易出现“刷分”reward hacking。但EL也有局限Coach模型质量决定上限错误放大比RL更严重反复迭代会导致基础指令遵循能力下降训练成本大幅增加且经验提取有效性依赖Prompt工程。3. RHI递归式Harness自改进非训练类RHIRecursive Harness Self-Improvement来自Sakana AI和UC Berkeley聚焦于多Agent协同场景。现在很多复杂编码任务不是单个模型独立完成的而是一群Agent分工合作。这套分工协作的“规矩”行话叫Harness编排层/外壳层包含角色role、工作流workflow、信息契约contract、执行步hop等组件。厂商给的通用Harness模板往往不够好用而用户自己写一套特化规矩又太难。RHI的思路是让这套规矩自己进化。具体做法是一个四步循环用当前Harness跑一遍任务生成代码仓库找个裁判对比本次结果和上次结果判输赢把历次输赢记录攒起来当“势头”参考让一个“Harness优化器”AI看着历史记录把规矩文本改一版进入下一轮。这里有两个巧妙的设计。第一只跟昨天的自己比不搞多方案PK——以前的方法搞一堆候选互相竞争成本是平方级别。RHI只跟前一轮比单次信号虽噪但攒成历史就很稳成本从平方降到常数。第二评判标准不直接告诉“改规矩的AI”优化器只看裁判的输赢记录RHI是隐式地往评估标准靠而不是直接拿奖励信号去最大化——这反而更稳。此外Harness写成文本prompt而非代码让任何闭源的coding agent都能用。实验效果令人惊讶Claude Sonnet配RHI打败了同模型开最大推理强度的版本Opus配RHI连官方最强的ultracode都打不过它且推理成本降60%。而且输出token数基本不变——增益不是来自“想得更久”而是来自“配合得更好”。论文还提出了一个信息论假设来解释RHI的隐含优化目标让组件跟任务更相关加法项让组件之间少重复减法项——既要更懂活儿又要不啰嗦。核心洞察是真正决定多Agent效率的不是每个Agent的思考量而是Agent之间的信息流。4. MCSE从记忆到技能的证据驱动协同进化非训练类MCSEMemory-Skill Co-Evolution来自MemTensor和中国科学技术大学等机构解决的核心问题是现有Agent的记忆系统大多是“被动检索”——把过去的交互记录原样塞回上下文窗口让Agent重新推理既费Token又容易抓错重点。即便一个Agent装了十次插件、找了十次测试文件第十一次还是从头摸索。MCSE构建了三级记忆层级L1轨迹记忆每一步的状态、动作、观察、自我反思、价值不存原始观察只存归一化证据是最底层的“证据卡片”所有高层抽象都必须能追溯到L1。L2策略记忆从跨回合轨迹中归纳出的可复用“套路”——触发条件、步骤、验证规则、适用边界。L3环境认知抽象出“这个环境长什么样”——如目录结构、包管理器类型、系统约束等声明式知识。关键设计是技能结晶的门控机制一个L2策略要“晋升”成技能卡需过两道关——一是确实有正收益用了它成功率更高二是近期表现稳定不是偶尔蒙对。过关后结晶成一张“技能卡”带有触发条件、执行过程、验证规则、适用边界、证据出处、决策指引含反模式、可靠性评分。技能还有生命周期管理试用→活跃→归档用砸了就降级。MCSE另一个巧妙设计是“反思加权价值回填”Agent每一步都写一句自我反思然后用LLM给反思的靠谱程度打分——反思越实在、越跟结果因果相关权重越高。最后用这个权重把终端成功/失败的反馈“倒推”分摊到每一步得到每一步的精细价值。实验中MCSE在EvoAgentBench五个领域Pass1均第一且展现出跨域迁移能力和终身进化特征。5. AgentBrew强师出高徒的知识酿造非训练类AgentBrew来自香港大学解决了一个非常实际的部署场景训练期能用强模型Teacher但生产环境只能跑弱模型Student且不能更新弱模型参数。环境只给二元反馈通过/失败没有专家示范轨迹。AgentBrew提出了一套“酿造-服务”框架。酿造阶段当弱模型执行任务失败时成功则不需要介入强模型介入分析失败轨迹。关键创新是“学生感知”——强模型必须站在弱模型的认知水平上去写操作指南颗粒度校准到弱模型强模型认为“显然”的推理步骤必须拆开写清楚概念用弱模型熟悉的词汇表达操作具体到弱模型可直接执行的颗粒度。然后通过“Ralph循环”验证将候选笔记塞回弱模型让它在同一任务上重跑——只有确实帮助弱模型从失败翻转为成功这条笔记才算“酿造成功”存入外部记忆库。服务阶段弱模型推理时从冻结的记忆库中检索Top-K笔记拼入prompt全程不需要强模型参与也不需要更新参数。实验显示弱模型加酿造后只跑一次就追平甚至超过Reflexion的多次反思在Terminal-Bench真实任务上弱模型加酿造能以三分之二的API成本取得比强模型更高的通过率——知识的“可执行性”比“深度”更重要。三、LLM Agent自进化方法总结综合以上五篇代表性工作可以提炼出Agent自进化方法的几个核心共识第一从“黑盒优化”到“白盒学习”。所有方法的总体思路都是不只看结果黑盒优化而是从推理决策过程轨迹和人类反馈中在低信噪比的情况下用各种方法抽取出显性信噪。SEED通过on-policy事后总结、LLM-as-a-Coach通过教练经验知识、RHI通过递归历史对比、MCSE通过反思加权价值回填、AgentBrew通过结构化笔记都在打开这个黑盒。即便环境反馈本身稀疏且嘌杂通过对过程轨迹的精细分析和人类反馈的校准仍可以提炼出高质量的监督信号。第二两种固化路径并行发展。这些显性信噪要么进行模型参数后训练要么进行harness上下文要么沉淀为记忆与技能。训练路径SEED、LLM-as-a-Coach将经验内化到模型参数中推理时无需外部依赖非训练路径RHI、MCSE、AgentBrew将经验外挂到Harness上下文、结构化记忆或技能中灵活轻量。两条路径并非对立而是互补外挂经验的持续积累为参数固化提供了高质量训练数据参数能力的提升又让Agent更高效地利用外挂知识。第三On-Policy与Off-Policy各有侧重。On-Policy方法如SEED强调的“自己当下跑出来的经验”重视本次执行与自身经验确保学习信号与当前策略分布一致。Off-Policy方法如AgentBrew的跨任务记忆库、MCSE的跨回合策略归纳重视历史与别人经验的迁移让Agent站在更宏大的经验基础上。实践中两者结合——既有即时反思又有历史积淀——往往效果最好。第四从“记忆”到“技能”的范式升级。记忆不应只是被动检索的“日记本”而应被组织成可执行、可验证、可进化的“技能”。这一思路贯穿了几乎所有方法SEED的“事后技能”、RHI的“优化后的Harness”、AgentBrew的“结构化笔记”——本质上都是将原始经验转化为可复用知识单元。四、展望Agent自进化与领域数字孪生纵观当前的技术格局LLM与Agent在产业垂直领域真正释放产能目前看来有两条最为关键的技术方向两者互为支撑、缺一不可第一个方向是Agent自进化。它解决的是“模型如何越用越好”的问题。通过从执行轨迹、历史记忆和人类反馈中持续萃取高质量信号让Agent的能力随使用而增长形成正向飞轮。它让产业应用不再依赖“等待下一个更强的基础模型发布”而是让现有模型在实战中自我成长。第二个方向是领域数字孪生许多人称之为“本体”。它解决的是“领域知识如何被模型高效理解和利用”的问题。产业垂直领域积累了海量结构化与非结构化知识但这些知识的组织形式通常面向人类阅读而非面向模型推理。将其以LLM-friendly的方式重构为语义结构如知识图谱、本体模型可以大幅提升Agent在领域内的理解和推理效率。如果说Agent自进化解决的是“学习能力”那么领域数字孪生解决的就是“学习素材”。相信这两大方向的深度结合将大幅度推进LLM与Agent在金融、医疗、法律、制造等产业垂直领域的产能释放。当模型既拥有结构化的领域知识底座又具备在实践中不断自我修正的能力“AI赋能产业”才能真正从概念走向现实。