不换模型,效果提升104%!上海AI Lab让Harness也能自进化了 📅 2026/7/22 2:14:20 上海人工智能实验室团队提出的Self-Harness近期被LangChain CEO、联合创始人Harrison Chase转发也被前OpenAI副总裁Lilian Weng收进自进化Agent相关博客。让AI自己改自己的Agent Harness这事已经被顶级Agent社区注意到了。上海人工智能实验室团队提出的Self-Harness近期被LangChain CEO、联合创始人Harrison Chase转发也被前OpenAI副总裁Lilian Weng收进自进化Agent相关博客。它盯上的不是换模型而是Agent外层那套Harness。做法很直接。模型先检查自己的运行轨迹从失败里挖出模式再提出有边界的Harness修改最后交给回归测试决定要不要采纳。实验结果显示在Terminal-Bench-2.0上底层模型、工具环境和评测协议都保持不变只改Harness三个模型后端都拿到了held-out提升。其中Qwen3.5-35B-A3B总提升达到104%MiniMax M2.5和GLM-5分别提升28%和24%。论文和项目已经公开文末附链接。△LangChain CEO/co-founder Harrison Chase转发Self-Harness让Harness自己进化Agent Harness可以理解为包在模型外层的一套运行装置覆盖系统提示词、工具使用规则、验证器、运行时控制策略和轻量middleware。在多轮工具任务里它决定Agent怎么调用工具什么时候停失败后怎么恢复产物又该如何验证。过去这套东西主要靠工程师手调。要读大量执行轨迹找失败原因改提示词或工具规则再反复跑benchmark。模型越多、任务越杂Harness就越难继续按“一模型一套人工调参”的方式扩展。△三种Harness改进范式人工改、强模型外援改以及Self-Harness让模型基于自身轨迹改Self-Harness怎么工作换到Self-Harness流程被压成三步。先挖弱点再提改法最后跑回归。Weakness Mining从失败轨迹挖弱点系统先让当前Harness驱动固定模型完成一批任务记录完整执行轨迹、工具调用和评测结果。失败样本不会被当成孤例处理。Self-Harness会结合验证器反馈、Agent行为和失败之间的因果关系把可复用的失败机制聚起来。这样“某个任务没过”会变成“这一类失败可能来自同一种Harness缺陷”。比如缺少最终产物、重复执行无效命令、工具报错后不恢复或者探索太久却迟迟不进入实现。Harness Proposal提有边界的改法拿到结构化失败证据后同一个模型会切换成proposer针对已挖出的失败机制提出候选Harness edit。这些edit只能落在预先声明的可编辑表面上不能把整个Agent控制架构推倒重来。每个提案都要说明想改变哪种行为可能带来什么回归风险以及为什么可能修好当前失败模式。Proposal Validation用回归测试拍板候选Harness会在同一评测协议下重跑并和当前Harness对比。接受规则很保守。held-in或held-out至少一个split要提升另一个split不能退化才会进入下一代Harness。这也是它和普通“自动改prompt”的差别。Self-Harness不让模型凭感觉拍板而是把每一次改动都放进可记录、可复现、可回退的评测闭环里。△Self-Harness自改进闭环包括弱点挖掘、修改提案和回归验证不换模型只改外层也能涨论文在Terminal-Bench-2.0上做了系统评测。Terminal-Bench-2.0是一个多轮智能体benchmark任务运行在容器化终端环境中覆盖文件管理、命令执行、错误恢复、产物验证等真实工具使用能力。在固定模型、工具集、任务环境和评测配置的前提下Self-Harness只改Harness。结果三个模型都出现提升。MiniMax M2.5总提升28%Qwen3.5-35B-A3B总提升104%GLM-5总提升24%。这组结果的重点不是又换了一个更强模型而是在同一个模型外面Harness本身也可以被搜索、验证和迭代。△Terminal-Bench-2.0结果三个模型后端在Self-Harness后均获得held-out提升更重要的是每个候选修改都经过held-in和held-out回归测试。换句话说Self-Harness不是堆更长的提示词而是在一次次验证门控后只留下真的带来收益、又没有明显回退的Harness edits。△Qwen3.5 Self-Harness进化路线通过多轮验证门控保留有效edits不同模型暴露出不同弱点Self-Harness的另一个观察更像工程现场。不同模型不是同一种失败。MiniMax M2.5找到线索后迟迟不交付在初始Harness下MiniMax M2.5有时会持续探索数据集。即使已经找到关键元信息也迟迟不创建评测所需的答案文件最后因为缺少产物或超时失败。Self-Harness保留的修改会鼓励Agent更早识别必需输出先创建初始产物并在工具调用过长时转向具体实现和验证。Qwen3.5-35B-A3B工具失败后容易陷入循环Qwen3.5-35B-A3B的常见问题是工具失败后进入重复编辑、重复覆盖或重复命令循环甚至在停止前删除评测必需文件。Self-Harness为它引入依赖预检查、失败后产物恢复、避免完全相同命令重试以及由工具错误触发的artifact-focused提醒。△Qwen3.5保留下来的code-level Harness edits集中在依赖预检查、产物恢复和重试约束。GLM-5更需要管住shell状态和节奏GLM-5暴露出的弱点更集中在shell会话状态以及从探索切到实现的时机。改进后的Harness会提醒Agent在修改环境变量、安装工具或调整路径后确认这些变化能跨命令持续可用。当长时间探索还没有形成产物时系统也会推动它转向实现与测试。这说明Self-Harness不只是给所有模型加一段通用提示。它会根据每个模型在真实轨迹中暴露出的弱点生成并筛选适合它的Harness改动。为什么会引起关注Agent越来越像跑在工具环境里的系统而不是只回答单轮问题的模型。在这种设定里模型能力只是一部分。外层Harness决定它是否知道何时调用工具如何从错误中恢复是否保留正确产物退出前有没有做验证。过去Harness工程更像经验活。Self-Harness给出的方向是让模型自己参与这套经验的挖掘和改写但最终仍由评测而不是自评来拍板。它没有证明“Agent可以完全自己进化”也没有绕过benchmark范围。论文里的结果主要来自Terminal-Bench-2.0和固定模型后端。但作为一个自进化Agent的组件它给出了比较清楚的边界改什么怎么改怎么验什么时候拒绝。研究团队该工作来自上海人工智能实验室团队论文题为Self-Harness: Harnesses That Improve Themselves。从现有文档看团队公开了论文和项目地址读者可以查看具体实验设置、Harness edits和代码。