清华大学:经验时代Agent的核心竞争力

📅 2026/7/28 12:03:53
清华大学:经验时代Agent的核心竞争力
AI Agent 的下一步不是更聪明而是更会长脑子当大模型走出训练集真正决定能力的变成部署后的经验与自我进化《Self-Improving Agents in the Era of Experience》******【文末附资源免费下载地址】******由清华大学与 Horizon Research联合发布。这篇综述抛出了一个判断下一代 Agent 的核心竞争力不再只是预训练时见过多少数据而是部署后能不能从真实交互中持续学习、自我修正、主动进化。作者把这叫作经验时代Era of Experience。在这个时代里Agent 不是一次训练定终身的模型而是一个长期运行的系统。它会留下痕迹、积累经验、更新技能、形成记忆甚至改变自己的控制结构。问题是这套自我进化的机制真的可靠吗【文末附资源免费下载地址】核心洞察让 Agent 在部署后变得更聪明是一个从痕迹到能力的工程问题捕获经验、分配合适的更新位置、验证价值、并在系统变化时保持控制。《Self-Improving Agents in the Era of Experience》核心判断01三代 Agent 演进从任务循环到自进化运行时Harness 正在变成 Agent 的操作系统论文把 Agent 系统的发展压缩成三代。第一代是任务边界清晰的循环。用户给任务模型推理、调用工具、拿到结果任务结束状态清零。WebGPT、ReAct、SayCan 都属于这一代它们证明了语言模型可以与外部世界交互但经验无法跨任务复用。第二代引入了持久化运行时。Voyager 的自动课程和技能库、MetaGPT 的多角色协作、LangGraph 的状态图与可恢复执行让 Agent 状态可以跨任务保留。但这一代仍由人类设计和配置运行时表面虽然持久却还没有系统性地在部署后自我进化。第三代把运行时支架Harness本身变成工程对象。Claude Code、Codex、Cursor 3 的产品形态已经说明Agent 运行环境正在成为开发的底层 substrate。OpenClaw、Hermes Agent、MetaClaw 等研究则进一步探索如何让 Harness 在交互后自动更新。Harness 不再只是调用模型的包装而是捕获痕迹、路由动作、暴露反馈、治理可变状态的完整控制层。02经验流向五个出口技能、记忆、环境、参数与元控制不是所有经验都值得写进模型权重部署后的经验有五个主要去向。第一个是技能Skills把成功经验变成可复用的程序或工作流存入技能库需要的时候检索、组合、执行。第二个是记忆Memory把上下文、用户偏好、历史交互持久化改变后续决策的输入。第三个是环境Environment把软件工具、API、MCP/A2A 协议标准化让 Agent 能在可执行、可验证的边界内行动。第四个是模型参数RL Continual Learning当经验足够稳定、足够有价值时通过强化学习或持续学习内化到模型权重中。第五个是元控制Meta-Evolution不只更新 Agent 能做什么还更新谁来决定更新什么——包括组件、规则、预算、评估器和更新机制本身。论文强调这五个层面对应两种时间尺度。Harness 层面的更新快而便宜模型参数层面的更新慢而昂贵。聪明的系统设计会先把经验放在正确的表面而不是一切改动都走模型微调。03自我进化的安全边界技能劫持、记忆投毒与对齐漂移会学习的系统也是会动的攻击面当 Agent 可以自我修改安全就从静态认证变成了动态治理。论文列出了五种典型威胁Skill Hijacking恶意技能被植入或篡改、Memory Poisoning记忆被污染后持续影响决策、Protocol Exploit工具协议或环境接口被利用、Feedback Manipulation反馈信号被操纵以诱导错误学习、Alignment Drift长期自我更新后目标偏离原始对齐。这些威胁的共同点是它们都发生在部署后。传统上模型发布前做一次安全评估就够了但对自进化 Agent 来说一次认证无法覆盖后续一连串修改。改进与控制之间存在张力——系统越能自我更新就越难保证它不会偏离预期。这也引出了一个更深层的问题谁来决定什么可以改、什么不能改论文把这个问题交给 Harness 的治理层包括权限、审批、回滚、停止条件和升级路径。没有这些自我进化就不可信。04评估还没跟上当前基准测不出真正的自我改进Longitudinal evaluation 是下一个硬骨头论文花了整整一节讨论评估问题。现有的 Agent 基准大多测量单次任务成功率但自我改进是一个长期过程。作者提出六个关键维度Held-out Gain在未见过任务上的真实提升、Backward Retention不遗忘旧能力、Improvement Efficiency单位经验能带来多少进步、Path Attribution进步来自哪一次更新、Longitudinal Stability长期运行是否稳定、Safety Non-regression安全能力不退化。目前很少有基准能同时覆盖这六个维度。论文还提出了 SIP-Bench 作为协议层评估框架试图把自我改进的测量从跑分提升到追踪能力演化轨迹。这背后的现实是我们连 Agent 在多次自我更新后是持续进步、饱和还是震荡都还不清楚。如果连演化轨迹都测不准谈什么放心部署最后唠两句为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200% 远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。那0基础普通人如何学习大模型 深耕科技一线十二载亲历技术浪潮变迁。我见证那些率先拥抱AI的同行如何建立起效率与薪资的代际优势。如今我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理分享于此为你扫清学习困惑共赴AI时代新程。我整理出这套 AI 大模型突围资料包【允许白嫖】✅从入门到精通的全套视频教程✅AI大模型学习路线图0基础到项目实战仅需90天✅大模型书籍与技术文档PDF✅各大厂大模型面试题目详解✅640套AI大模型报告合集✅大模型入门实战训练这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图0基础到项目实战仅需90天全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤640套AI大模型报告合集⑥大模型入门实战训练如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】