Agent 变强,往往不是换模型,是换了 Harness

📅 2026/7/22 16:25:42
Agent 变强,往往不是换模型,是换了 Harness
有人拿同一模型换脚手架编码基准能差出好几倍。也有人不动权重只改系统提示、加自检钩子Terminal-Bench 再涨十几个点。我看这些实验越来越怀疑线上 Agent 干不干活常常不是模型够不够聪明而是外面那层运行系统有没有搭好。这层东西现在很多人叫 Agent Harness。2026 年有篇综述 Agent Harness Engineering: A Survey把它单独拎出来讲还给了一套七层分类 ETCLOVG。下面按这篇综述的说法把词掰开。Prompt、Context、Harness 三层工程范围从单次调用到闭环运行系统从单次调用到闭环运行系统一、Harness 到底指什么Harness 原意是挽具。套在马上力往哪传、跑偏怎么勒都靠它。套到 LLM Agent 上意思差不多模型还是那个模型外面多了一套约束它怎么跑的设施。具体管什么上下文怎么进窗口工具用什么协议发现和调用代码在哪类沙箱里跑状态跨步骤怎么存失败了重试还是停轨迹能不能看结果怎么验收权限、审计、人工审批卡在哪。框架名里有没有 「Agent」 不重要这些事有没有人负责才重要。它和旁边几个词容易糊在一起。Agent Framework 多半是开发时的抽象怎么声明 Agent、挂工具、画流程图。Harness 更偏运行时——这一次任务实际被哪些边界箍着跑完。Prompt 和 Context Engineering 管模型这一步看见什么、被怎么吩咐Harness 还要管看见之后去哪执行、有没有权限、失败怎么回来、谁签字验收。模型能力是智力上限Harness 决定这份智力在真实环境里能兑现多少会不会半夜把仓库改崩。更早有工作把单个 harness 拆成六块执行环、工具注册表、上下文、状态库、生命周期钩子、评估接口。ETCLOVG 换了切法按工程界面分层把可观测性和治理从「钩子的副作用」里拆出来。生产里这两块常常有自己的工具栈也常归不同团队硬塞进 lifecycle 钩子里讲不清楚。二、从写提示到管上下文再到管整机范围是一层包一层不是三代产品互相踢掉上一代。写 prompt管的是单次调用系统提示、示例、输出格式、推理模板。做 context管的是信息状态检索什么、记忆怎么取、历史怎么压、顺序怎么排——窗口当工作内存用别当无限聊天记录。做 harness还要把执行环境、工具协议、持久状态、编排、观测、验证、治理接进闭环。模型吐出一句话之后它会不会变成一次写文件、一次删库环境结果怎么喂回去什么时候必须人批这些都在这层定。AutoGPT、BabyAGI 那阵子的老毛病——跑飞、上下文爆、状态丢、副作用没人看——当时不少人怪提示词。现在回头看更像基础设施没跟上。ETCLOVG 七层结构核心 E/T/C/L 与控制平面 O/V/G结构核心 E/T/C/L 与控制平面 O/V/G三、ETCLOVG一张表够用了综述把 harness 切成七层。前四层是结构核心后三层更像控制平面。表能扫一眼就行不必背缩写。层名字它在问EExecution代码跑在哪沙箱边界是什么TTooling外部能力怎么描述、发现、调用CContext短会话、跨会话状态、长期记忆谁管LLifecycle单环、多 Agent、Issue 到 PR 怎么编排OObservability轨迹、成本、故障看得见、分得清吗VVerification跑前检查、跑中采集、跑后评判和回归GGovernance权限、策略、审计、人工兜底放哪我自己记这张表靠的是出事时会不会卡住。沙箱是容器还是本机裸跑工具菜单是不是大到选不过来一百轮后它脑子里的任务状态还对不对子 Agent 回来是带回产物和未决问题还是一段没法恢复的闲聊trace 里分得清模型蠢、工具说明骗人还是环境缺包权限是写明的还是嘴上说「别乱来」综述扫了 170 多个开源项目开源侧更密的是执行、工具、编排、验证可观测和治理更薄多半在商业平台或内部工程文章里。Demo 能跑、上线就慌缺的常常是后两块。四、难的是层和层会打架七层背下来没用。综述后半截更刺的是跨层矛盾。沙箱越强越安全也更慢更贵上下文越厚越连贯token 烧得越凶评估越深越好查因迭代越拖。线上谈「质量」其实是在问哪些风险值得付这套贵控制。工具菜单开大能干的事变多选错和提示注入面也变大记忆留得久过期和隐私麻烦跟着来沙箱放得松自主性上来一次误操作的杀伤半径也上来。这些不是上线后补的安全附录设计阶段就得拍板。还有耦合。改沙箱会改评测分数工具描述会挤占上下文trace 里没有身份和权限粒度就很难当治理证据评测如果奖励某种重试编排就会养成对应坏习惯。只改提示词、只换记忆库局部好看、整体变差的情况很常见。测 harness得按系统变更来测。「换更强模型」有时像开挂有时几乎没感觉多半因为瓶颈不在同一层。沙箱保真度、工具契约、状态漂移这些控制问题加智力解决不了推理真不够时换模型才对路。五、两个场景比清单好用场景一编码 Agent 通宵改仓库。先问三件事它能不能rm -rf、能不能推保护分支、写文件是在沙箱还是你本机。这三条没钉死模型再强我也当定时炸弹。再看工具和上下文是不是把半个 npm 生态都挂成工具搜索结果原样灌进窗口长任务里每隔几十轮它还记不记得「别动支付模块」这种约束——不记得多半不是窗口太小是状态在漂。子任务派出去再收回来如果只剩一段聊天摘要第二天你基本没法接手。场景二演示很稳一上真实流量就花。看板里 span 花花绿绿却说不清这次失败该怪模型、工具契约还是评测环境缺依赖。更糟的是生产异常看过就算了没有落成回归用例下周同一类锅再来一遍。这种时候别急着换模型。先把「看得见」和「判得对」接上——O 和 V 不通你只是在看热闹。选型或自研时我通常按这个顺序抠先执行和治理再工具与上下文预算再交接与编排最后才把观测和回归闭环。模型变强了记得做减法。Anthropic 提过对更强模型某些上下文重置反而变成多余成本脚手架证伪了就拆别只增不减。结尾换模型当然还重要。等模型已经「够用」再往上抠可靠性往往是在抠 harness边界、协议、状态、编排、观测、验收、治理。Agent Harness Engineering 听起来像新名词实际更像一次重新划界Agent 产品拼到后半程拼的是运行系统。模型给出上限外面这层决定你能兑现多少。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。