提升大模型Agent成功率9.3个百分点!Harness-R1学习编辑可执行运行时 代码已开源

📅 2026/8/8 16:27:12
提升大模型Agent成功率9.3个百分点!Harness-R1学习编辑可执行运行时 代码已开源
部署后的大模型Agent能自己改错提升性能吗你有没有发现现在基于大模型的智能 Agent 部署后就一直“原地踏步”明明已经积累了一堆失败交互轨迹比如调用工具错格式、走流程丢状态、重复踩同一个坑却没法自己根据这些失败自动改进运行逻辑。之前想要优化 Agent要么改大模型本身的权重对推理部署成本要求很高要么靠人工写固定的改进规则或者让大模型prompt改harness但效果忽上忽下甚至越改越差。来自上海交通大学和小红书的研究团队提出了全新思路让专门的“harness工程师”从失败轨迹里学习直接改Agent的运行时逻辑不用动目标Agent的权重就能稳定提升性能。论文技术速览▌核心贡献首次提出基于在线强化学习的失败条件可执行运行时Harness学习编辑方法▌性能指标原生Qwen3.5-9B成功率从44.3%提升至53.6%(9.3pp)|目标微调后再提5.0pp▌代码状态已开源▌技术谱系固定规则Harness优化 → 固定编辑器Harness搜索 → 在线强化学习训练编辑器Agent进化赛道上被忽略的关键环节大模型Agent要持续自我进化其实有两个可以优化的地方一个是改决策核心大模型的权重另一个是优化大模型外面的“ harness”——也就是负责组装上下文、转发工具调用、校验动作、出错恢复的整套运行逻辑。相同的大模型权重换个好的harness性能能差出一大截。一开始大家优化harness都是靠固定规则比如统一加个Self-Refine自我反思步骤结果实验发现这个规则在三个基准测试里全都是降性能。后来有工作让强模型当编辑器改harness但编辑器本身是固定不动的改完好不好全看碰运气收益不稳定有时候甚至改完更差了。还有一些工作只优化prompt、记忆这类单一组件没法全生命周期改整个现有运行时。那能不能专门训练一个“harness工程师”让它根据目标Agent的失败轨迹学怎么改可执行的运行时改完好不好用实际跑出来的结果说了算这就是Harness-R1要解决的核心问题。分离训练9B工程师改harness目标Agent冻住不碰Harness-R1的核心设计非常巧妙把“改harness的工程师”和“做任务的目标Agent”完全分开全程只训练工程师目标Agent的权重一动不都动相当于专门训练一个AI给另一个AI修bug改流程。我们可以把这个过程类比成餐厅里目标厨师炒菜手艺不变我们专门训练一个配菜流程设计师厨师每次炒失败菜设计师就根据失败记录改配菜、出餐的流程改完让厨师重新炒同一批菜好吃不好吃直接给设计师打分只改设计师的设计能力不改厨师的手艺。图2Harness-R1整体框架收集目标Agent的失败轨迹打包工程师生成可执行补丁修改运行时四个生命周期节点补丁装好后目标重跑任务结果反馈用来训练工程师。具体来说整个方法分为两个核心部分1. 可干预的运行时生命周期钩子Harness-R1允许工程师在目标Agent运行时的四个节点加修改钩子完全不碰目标Agent本身的权重回合初始化设置起始上下文和回合状态决策前在目标做决策前给上下文加检索引导、接口约束动作前在动作发给环境前做规范化、重写或者拦截无效动作反馈后拿到环境反馈后检查轨迹卡住的时候触发恢复所有补丁都会先做有效性校验无效补丁不会生效不会把整个Agent改崩。2. 两阶段训练冷启动SFT 基于结果的GRPO优化冷启动监督微调SFT先让强教师大模型根据失败轨迹生成合格的harness修改过滤掉无效补丁后做成微调数据集初始化工程师模型让工程师先学会怎么出格式正确、能运行的补丁。基于结果的分组相对策略优化GRPO从SFT初始化的策略开始对每个失败包采样8个候选补丁每个补丁装好后让目标Agent重跑同一批任务按照任务结果算奖励同一个失败包的8个候选做奖励归一化得到优势再用 clipped 代理损失更新工程师参数全程只有工程师参数更新目标一直冻结。三大基准测试验证性能提升稳定可靠我们来看Harness-R1在WebShop、ALFWorld、DBBench三个经典交互式Agent基准上的实验结果表1三大基准的主实验结果Score是整形奖励Succ.是任务成功率Avg.是三个基准成功率的等权重平均。图1三个基准的匹配基线奖励变化菱形是等权重平均值固定Self-Refine在三个基准上都降低了奖励现有其他编辑器收益不稳定。从主结果可以得到三个核心结论训练过的工程师提升远优于其他方法原生Qwen3.5-9B目标AgentHarness-R1把平均成功率从44.3%拉到53.6%涨了9.3个百分点比只做SFT的工程师高7.1个百分点也比最强的固定大模型编辑器GLM-5.2的48.8%高4.8个百分点。而固定方法Self-Refine反而降了2.5个百分点证明固定规则远不如学习出来的编辑策略可靠。工程师和目标Agent可以共同进化如果先把目标Agent做微调平均成功率已经升到59.2%再针对这个微调后的目标训练专门的Harness-R1工程师还能再涨5个百分点到64.2%说明哪怕目标已经升级了harness编辑还是能带来额外收益二者可以共同进化。图3跨目标泛化的成功率提升所有 unseen 目标的平均提升都是正的。泛化能力极强训练好的工程师直接用在20个训练时没见过的目标模型上平均成功率涨了7.06个百分点63组目标-基准组合里56组都有提升所有目标的平均提升都是正的。对于没见过的任务用10个失败生成的补丁能让1270个留存任务平均涨8.9±1.5个百分点而大模型固定编辑器反而会降性能说明结果驱动训练出来的编辑能力比单纯堆模型尺度更可靠。图4(a)稀疏失败证据下对留存任务的泛化结果Harness-R1在所有随机种子上都能实现正提升远优于大模型固定编辑器。最后做消融实验看哪个生命周期节点改了最有用去掉动作前置校验会降3.9个百分点去掉反馈后恢复会降3.3个百分点说明动作管控和失败恢复是harness提升的核心而且不同环境的核心节点不一样Harness-R1能自动学习适配这也是固定规则做不到的。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】