32 个软件应用、604 个工具,最强模型也只做对 38.6%——ICLR 2026 的 Toolathlon 揭了 Agent 评测的短

📅 2026/8/12 15:20:21
32 个软件应用、604 个工具,最强模型也只做对 38.6%——ICLR 2026 的 Toolathlon 揭了 Agent 评测的短
系列第 7 篇 · 子领域评测 / Evaluation【来源信息】 - 类型顶会论文 - 标题The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task ExecutionToolathlon - 作者/机构未具名通讯作者团队基于 MCP 服务器构建 - 出处ICLR 2026 · arXiv:2510.25726 - 原文https://zhaoyang97.github.io/Paper-Notes/ICLR2026/llm_agent/the_tool_decathlon_benchmarking_language_agents_for_diverse_realistic_and_long-h/ - 本文性质论文解读非原创研究关键结论以原文为准一句话结论现有 Agent 榜单多用「玩具级」单步任务分数虚高ICLR 2026 的 Toolathlon 用 32 个真实软件应用、604 个工具、108 个长程任务把最强模型 Claude 按在地上摩擦——成功率只有 38.6%。榜单测不出的差距才是真实差距。背景与痛点语言 Agent 要在真实世界干跨应用、多步骤的活管日历联动邮件、监控数据库出报告。这要求工具发现、多轮推理、状态追踪、跨系统协调一起上。但现有 Agent 基准三大硬伤领域窄聚焦单一工具或 API任务假一两步调用就完事环境假用空白或极简初始状态不是真实软件里的复杂数据。结果Agent 在简单榜上分数漂亮真实场景频繁翻车分数和实际能力严重脱节。核心方法讲人话Toolathlon 是第一个同时满足四个维度的 Agent 综合基准多样应用覆盖32 个软件应用、604 个工具真实环境状态不是空壳而是带真实复杂数据的初始状态长程复杂任务平均约 20 轮工具调用执行式验证不靠 LLM 裁判或字符串匹配而是基于程序执行做确定性判定。它基于 Model Context ProtocolMCP构建工具层部分由团队自研或修订保证接口质量和一致性。实验与数字108 个任务604 个工具32 个应用平均约20 轮工具调用。最强模型Claude-4.5-Sonnet 成功率仅 38.6%——这就是真实长程 Agent 能力的天花板。执行式验证确保每个任务完成与否有确定性判定杜绝 LLM 打分的主观误差。为什么重要反直觉点我们以为 Agent 已经很强是因为榜单太温柔。当任务变成「真实软件 长链路 多应用协调」连顶尖模型都不到四成。这对工程的直接意义别再拿单步工具调用榜当 KPI。你要测的是「在带真实数据的环境里跑 20 轮还不丢状态」的能力——这才是上线后用户真正会遇到的。复现 / 落地思路论文基于 MCP 服务器可自行搭建类似执行式评测用确定性校验脚本替代 LLM 裁判给你自己的 Agent 加一类「长程多工具」回归测试初始状态灌入真实数据参考 Toolathlon 的维度给你的 Agent 打分卡补上「环境真实性」和「轮次长度」两栏。今日可做的 3 件事把你现用的 Agent 评测从「单步准确率」升级成「执行式 长程 真实状态」三件套。用 MCP 把你的内部工具封装成标准接口照 Toolathlon 思路做一轮内部基准。给你的 Agent 设定一个「20 轮工具调用」压力测试看它在第几轮开始丢状态。下篇预告第 8 期我们读训练方法看 ICML 2026 一篇合成数据的信息论判据——为什么「模型自己教自己」用错了会崩用对了能不标注就训出推理能力。