【论文自读】AgentSlimming: 面向高效与成本感知的多智能体系统 📅 2026/8/11 16:18:34 发表年份2026年7月2日至7日会议ACL 2026 Long PaperCCF-A作者单位上海交通大学、南京大学、悉尼大学、南京航空航天大学、上海人工智能实验室等摘要基于大语言模型的多智能体系统MAS在复杂任务中展现出了卓越的能力。然而手动设计最优的通信拓扑结构耗时费力而自动化扩展方法则常导致结构臃肿、包含大量冗余智能体进而造成过高的令牌消耗。为解决该问题我们提出了AgentSlimming——一种面向图结构多智能体工作流的即插即用型压缩框架。受神经网络中剪枝与量化技术的启发AgentSlimming通过以下步骤压缩工作流首先采用混合机制估算每个智能体的重要性分数然后移除冗余智能体或用低成本智能体进行替换其中每次操作均通过基于基线锚定的接受规则进行验证以防止性能崩塌。实验表明AgentSlimming在性能损失可忽略的前提下平均令牌成本最高可降低78.9%且有时甚至能提升准确率在成本与质量之间实现了强劲的帕累托最优权衡。我们的代码已公开于GitHub - CitrusYL/AgentSlimming: A research framework for optimizing graph-structured LLM agent workflows. · GitHubAgentSlimming示意图为识别冗余AgentSlimming对每个智能体节点计算四种不同的排名指标度中心性、介数中心性、成本比较和近似沙普利值。剪枝和量化均基于计算得到的重要性分数选择候选节点按重要性从低到高排序优先优化排名最低的候选节点。每次操作后执行重新评估。若得分降至可接受阈值以下则触发回滚机制以撤销当前操作并立即终止该阶段从而保持优越的性能。问题定义作者将多智能体系统的优化问题表述为在有向图上的离散结构搜索问题明确权衡任务性能和执行成本。核心思想把每个智能体当作图上的节点通过多维指标反复评估每个节点对团队是否‘不可或缺’然后大胆删掉‘闲人’或把‘高薪低效’的人换成‘实习生’每动一步就检查一下团队业绩准确率一旦业绩下滑就立刻撤销操作。最终得到一个精简、省钱且依然能干活的智能体团队。具体实现第一步先得到一个性能很强、但比较“臃肿”的初始 Workflow。具体而言在本文的主实验中作者先用AFlow构建了一个initial high-performance workflow graph初始的高性能工作流图把它定义为Gbase。第二步用Dprobe和Dval这两个集合来优化这个高性能Workflow。具体而言有三个数据集。Dval是就是每个 benchmark 自己划出来的验证集。针对哪个 benchmark 优化 workflow就用哪个 benchmark 自己的Dval。Dprobe是Dval的一个子集它用来快速估计每个 Agent 节点的重要性和成本贡献。作者进一步在 HotpotQA 上测试了 10、50 和 100 三种 probe size。其中 50 个样本时取得了最高准确率且作者指出 30–60 个 probe samples 通常已能产生较稳定的节点重要性排序。因此可以把 50 理解为一个较具代表性的 probe size但论文并未明确说明所有主实验统一固定为 50。表7HotpotQA上探针数据集大小的敏感性分析。我们改变了用于节点重要性评估的探针大小并报告了由此产生的任务准确率和每个问题的平均推理成本。小结Dval和Dprobe的用处Dprobe告诉你“改谁”。Dval告诉你“改完之后这个方案能不能要”。Dtest最后评估这个优化后的 Workflow 到底有多好。Dval 是每个 benchmark 自己划分出的验证集Dprobe 则是从该验证集 Dval 中进一步抽取出来的一个更小的数据子集。若假设取 50 个样本那么 Dprobe 就可以看作是从 Dval 中抽出的 50 个样本组成的小数据集。有了初始高性能工作流 Gbase以及 Dprobe、Dval 和 Dtest 三类数据后就可以开始理解 AgentSlimming 的具体优化流程。Stage 1 AgentPruner 裁剪阶段第一步先判断每个 Agent 节点有多重要我们在Dprobe这个数据集上对Gbase里面的每个节点去计算四个信号值①Degree Centrality度中心性定义衡量一个节点在图中连接了多少个邻居。也就是看这个节点和多少个其他智能体有直接信息往来。计算方式入度 出度或有向图中边的总数。论文中的使用逻辑连接越少的节点越容易被剪枝。因为它在拓扑结构上处于边缘位置删掉它对整体信息流通影响最小。【平白的理解就是说那些没什么连接的结点相对于其他连接比较多的节点信息量相对较少所以去除它带来的影响比较少。】② Betweenness Centrality介数中心性定义衡量一个节点在图中充当信息桥梁中间人的程度。如果很多其他节点之间的最短路径都要经过它那它的介数中心性就高。计算方式【在从 A 到 B 的所有最短路径中经过 该节点 的比例是多少累加】论文中的使用逻辑介数越低的节点越容易被剪枝。因为它在信息流通中不是关键枢纽删掉它不会阻断重要的信息传递。③Approximate Shapley Value近似沙普利值定义从功能贡献的角度来衡量一个节点。它来自合作博弈论用来评估“如果把某个玩家节点从团队中拿掉团队的整体收益准确率掉了多少”。掉的越少说明这个节点越不重要。计算方式留一法 LOO论文中的使用逻辑沙普利值越小的节点越容易被剪枝或量化。因为它对最终答案的准确率贡献最小。④Delta-Cost增量成本信号定义衡量删除或替换这个节点能省多少钱。这是从经济/成本维度来评估节点的重要性。计算方式使用逻辑增量成本越高的节点越优先被剪枝或量化。因为剪掉它能带来最大的经济收益。第二步把四个指标融合成一个 RRF 排名所有指标都会转换成排名然后通过 RRF 统一融合最终融合分数越低节点越该被优化掉。第三步真的把最不重要的 Agent 删除比如现在RRF判断AgentB是最终不重要的那就把B删掉。然后作者做了一个Graph SurgeryA-B-C删除B之后自动补一条:A-C也就是把被删除节点的 predecessor 和 successor 重新连接起来确保 workflow 仍然可执行。论文对此给出了明确规则对于 s∈In(v) 和 t∈Out(v)删除 v 后补上 s→t。第四步这时候 Dval 就开始发挥作用了Dprobe 刚才只是告诉我们Agent B 看起来最值得删但是它不能最终决定真的删还要检查SGp是否够好。即其中Tp 0.95。也就是说假设Gbase是80%那么最低接收线就是0.95*80%76%。如果删掉Agent B后SGp79%7976就接受就把agent B删掉如果不是那就rollback。AgentPruner 整个阶段一句话总结就是Dprobe 找“谁可以删” →删掉→Dval 检查“能不能接受” →接受/回滚→重新计算→继续下一轮第二阶段 Agent Quant核心思想考虑哪些剩余 Agent 可以从 GPT-4.1-mini 换成 GPT-4.1-nano。第一步重新评估哪些节点最适合“降级模型”AgentQuant 仍然使用第一阶段的RRF 排序机制区别在于第一阶段的 Shapley 是把 Agent v 删掉以后性能掉多少。而第二阶段不是删除v而不是把v的大模型换成了更便宜的模型再观察性能变化。比如说在Dprobe上面测试将C节点换成了更便宜的模型nano性能只掉了0.2%那就说明这个节点没必要用那么贵的模型。反之如果性能掉了很多那就不能换。经过前两个阶段以后我们得到新的Gp。第三阶段是AgentTunerAdaptive MCTS Fine-tuning前两阶段是在“逐节点”做贪心优化而第三阶段开始把整个 workflow 当成一个搜索对象做离线的局部结构搜索。具体而言就是从这个 Gq 出发进一步搜索有没有更好的完整 workflowAgentTuner 从压缩后的 Gq 出发把完整 workflow 当成搜索节点借鉴 AFlow 的 MCTS 思路通过修改 prompt、连接关系和 operator 组合产生候选 workflow并在 Dval 上比较 score 和 cost进一步寻找更优的成本–性能折中。三个阶段都是迭代的。AgentPruner反复删节点它不是只删一个节点。直到 Top-k 候选节点都不能继续安全删除或者 pruning budget 用完才停止。AgentQuant也反复量化多个节点第二阶段同样不是只把一个节点换成便宜模型。每一轮重新排名→选择候选节点→尝试替换模型→Dval验证→接受/拒绝然后继续下一轮。评估数据集 benchmark1标准基准测试Standard Benchmarks我们使用了完整的AFlowZhang等2025c套件包括GSM8KCobbe等2021MBPPAustin等2021完整集合HotpotQAYang等2018和DROPDua等2019随机采样的1,000个实例子集对于MATHHendrycks等2021我们遵循其特定子集即涵盖四个类别的617个Level-5问题。这些数据集采用1:4 的验证/测试划分即验证集占20%测试集占80%。注AFlow 套件AFlow suite不是一个数据集也不是一个软件包。AgentSlimming 为了和 AFlow 公平比较直接沿用了 AFlow 的那套 benchmark。你可以把它理解成2高难度基准测试High-difficulty Benchmarks为评估在复杂推理和编码任务上的性能我们纳入了AIME美国数学协会Art of Problem SolvingMuSiQueAnsTrivedi等2022LiveCodeJain等2025这些数据集采用3:7 的验证/测试划分即验证集占30%测试集占70%。跨这两个类别我们的评估套件共同覆盖了三种核心能力数学推理Mathematical Reasoning、编码Coding和问答Question Answering确保了对智能体系统性能的全面评估。注各benchmark的简单介绍基线方法我们将AgentSlimming与一系列多样化的基线方法进行比较I人工提示策略Manual Prompting Strategies标准思维链CoTWei等2022自一致性思维链SC-CoTWang等2023自我精炼Self-RefineMadaan等2023LLM-DebateDu等2023II自动化工作流优化Automated Workflow OptimizationADASHu等2025AFlowZhang等2025cIII成本感知型AFlowCost-Aware AFlow我们实现了一个修改版的AFlow变体该变体在搜索阶段将成本比较明确地集成到其选择机制中直接在成本效率上进行竞争。注Cost-Aware AFlow 并非本文方法而是作者基于原始 AFlow 实现的成本感知版本用作强对比基线。它在 AFlow 的搜索阶段显式加入成本比较机制以验证 AgentSlimming 的优势并非仅来自“考虑了成本”而是来自其基于节点重要性评估的剪枝与语义量化机制。实验结果(1) Standard BenchmarksAFlow自带的那些数据集表1标准基准测试上的性能和推理成本比较。成本表示平均API费用美元/问题。加粗表示基于工作流的方法不包括简单提示词基线中的最佳结果。绿色百分比表示与AFlow相比的相对成本降低突显了在保持有竞争力的准确率的同时节省了多少推理预算。(2) High-difficulty Benchmarks文章新加的数据集表2高难度基准测试上的性能和推理成本比较。成本表示平均API费用美元/问题。加粗表示基于工作流的方法不包括简单提示词基线中的最佳结果。绿色百分比表示与AFlow相比的相对成本降低。消融实验①第一组消融Prune 和 Quantize 的顺序重要吗表3反转流程顺序的消融实验。我们在MATH、MBPP和LiveCode上比较了基线、反转顺序流程先量化后剪枝以及最终的先剪枝后量化结果这三个数据集分别代表数学推理、程序合成和面向执行的代码生成。实验表明反转顺序产生了大致相似的最终成本-准确率权衡仅在贪心回滚机制下因搜索轨迹略有不同而产生微小差异。尽管如此我们在框架中仍采用“剪枝→量化”的设计因为先剪枝可以提前移除冗余节点缩小搜索空间从而使后续的量化阶段更加高效并降低框架的整体搜索成本。作者真正想说明的是两种顺序最后都能得到比较好的 cost–accuracy trade-off最终效果主要来自 Pruning 和 Quantization 的联合效果而不是依赖一个特殊的执行顺序。注Baseline不进行压缩直接使用原始的高性能 workflowQuantization → Pruning先对 Agent 进行低成本模型替换量化再删除冗余 Agent 节点Pruning → QuantizationOriginal Method先删除冗余 Agent 节点再对剩余节点进行低成本模型替换这是AgentSlimming 默认采用的原始流程。②第二组消融为什么一定要 RRF 多指标融合表4重要性排序策略的消融研究。我们比较了基于拓扑的信号仅度中心性、仅介数中心性、基于功能的信号仅沙普利值以及它们通过倒数排名融合RRF进行融合后的效果。评估涵盖四个代表性基准测试DROP阅读理解和离散数值推理、MATH和AIME数学与符号推理其中AIME进一步针对竞赛级别的问题求解、以及MBPP程序合成。我们报告了任务准确率Acc.和每个问题的平均推理成本$/问题。RRF行中的百分比表示与基线相比在每个基准测试上的相对变化。注意Baseline不压缩原始的高性能 workflowBetweenness-only只用介数中心性决定优先压缩谁Degree-only只用度中心性Shapley-only只用 ShapleyRRF (ours)把多种指标融合后再决定优先压缩谁。另外论文没有单独报告 Delta-Cost-only 这一行。虽然完整 RRF 方法包含成本信号但 Table 4 的单指标消融只报告了 Degree、Betweenness 和 Shapley 三种。