论文标题: AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers论文地址: https://arxiv.org/abs/2607.29626作者单位: Fudan University, Shanghai Innovation Institute, East China Normal University, OpenMOSS发表时间: 2026年7月31日背景知识在深入解读 AgentHPOBench 之前有必要先厘清几个核心概念。什么是 Sequential Hyperparameter Optimization (HPO)序列超参数优化是指在有限的计算预算下通过多次实验迭代逐步调整模型超参数以提升目标性能的过程。与传统的一次性网格搜索不同序列优化利用前序实验的反馈如验证集指标、训练日志来指导下一次配置的选择形成实验→观察→决策→再实验的闭环。什么是 LLM Agent 作为优化器近年来LLM 不再仅用于生成静态代码而是被赋予工具调用能力成为能够执行实验、解析结果并自主决策的 Agent。在 HPO 场景中LLM Agent 接收任务描述、历史配置、指标和日志输出下一组超参数配置。这要求 Agent 具备数值推理、日志诊断和序列决策的综合能力。什么是 Execution-Grounded Benchmarking传统的 HPO 基准如 HPO-B、YAHPO Gym通常提供清洗过的表格数据或代理目标函数抽象掉了真实研究仓库中的脚本依赖、日志格式和失败模式。Execution-Grounded 基准则要求 Agent 在真实的、可执行的研究仓库上运行实验处理原始日志和异构指标从而更贴近实际研究流程。一、背景从静态代码生成到序列实验优化的评估鸿沟1.1 为什么需要 AgentHPOBench随着 LLM 能力的演进Agent 已经能够完成越来越复杂的实证研究工作流。现有基准测试如 MLGym、MLE-Dojo、PaperBench、RE-Bench 等虽然提供了交互式实验环境但它们评估的是广泛的研究或工程流程——改进可能来自数据处理、代码修改、架构设计、调试、超参数调优或这些动作的组合。这导致一个关键能力长期缺乏针对性评估Agent 是否能够解读已执行实验的证据指标 日志并将其转化为下一组有效的超参数配置在典型的 ML 研究流程中研究者执行基线实验后会检查目标指标和辅助指标结合执行日志判断训练状态收敛、过拟合、振荡等然后决定调整哪些参数。AgentHPOBench 正是为了孤立地评估这一能力而设计。1.2 现有基准的结构性盲区现有工作可分为两类但都存在局限传统 HPO 基准HPO-B、LCBench、YAHPO Gym、JAHS-Bench-201提供受控的表格、代理或可执行目标但抽象掉了日志、配置和仓库执行上下文。优化器面对的是一个干净的数值接口而非真实的研究仓库。Agent 研究基准MLAgentBench、MLR-Bench、AIRS-Bench评估 Agent 在代码库使用、模型训练、论文复现等方面的能力但关注的是广义的研究执行或复现而非将实验反馈转化为超参数决策的专门能力。AgentHPOBench 的核心定位是在可执行的研究仓库中评估 Agent 通过序列干预进行超参数优化的能力。它既保留了传统 HPO 的可控性固定干预空间、统一评分又引入了真实仓库的复杂性原始日志、异构指标、执行失败模式。二、核心创新任务构建协议 统一执行框架 评分审计层AgentHPOBench 的技术精髓可以概括为将真实 ML 仓库转化为标准化的序列优化任务通过统一执行框架确保可比性借助评分审计层区分相对改进与绝对达成。2.1 任务构建协议从仓库到可执行优化任务AgentHPOBench 包含 30 个任务源自 30 个可执行的 GitHub ML 研究仓库覆盖 7 个研究领域NLP、CV、时间序列预测TS、图学习Graph、强化学习RL、大语言模型LLM和结构化学习SL。每个任务的构建遵循三个原则实质性实验决策任务必须在可执行的训练或评估流程中需要真正的实验决策而非简单的配置选择。可测量反馈每次干预后必须提供可量化的反馈以评估 Agent 如何利用历史结果指导后续决策。贴近真实研究保留原始仓库的脚本、依赖、日志和失败模式。每个任务包含五个核心要素参考基线Reference Baseline一个经过验证的共享基线配置所有 Agent 和传统优化器从此出发。目标指标Target Metric由仓库定义的评价指标如准确率、MSE、FID 等。干预空间Intervention Space从官方训练脚本、配置文件或文档中提取的可配置字段及其有效值。锚点Anchor论文或仓库报告的性能参考值。标准化任务接口Executable Task Interface定义如何启动实验、提取指标、记录输出。2.2 问题形式化序列决策过程AgentHPOBench 将自主超参数优化形式化为一个序列决策问题对于任务ttt在预算设置rrr下设xt,0∈Ωtx_{t,0} \in \Omega_txt,0∈Ωt为参考基线配置执行后得到基线性能yt,0ft,r(xt,0)y_{t,0} f_{t,r}(x_{t,0})yt,0ft,r(xt,0)。在第kkk次干预k∈{1,…,K}k \in \{1,\ldots,K\}k∈{1,…,K}Agent 观察累积的历史轨迹Ht,k−1{τt,0,τt,1,⋯ ,τt,k−1}\mathcal{H}_{t,k-1} \{\tau_{t,0}, \tau_{t,1}, \cdots, \tau_{t,k-1}\}Ht,k−1{τt,0,τt,1,⋯,τt,k−1}其中每个轨迹条目τt,k{xt,k,yt,k,ℓt,k}\tau_{t,k} \{x_{t,k}, y_{t,k}, \ell_{t,k}\}τt,k{xt,k,yt,k,ℓt,k}包含配置、性能指标和执行日志。Agent 基于此提出新的有效配置xt,k∈Ωtx_{t,k} \in \Omega_txt,k∈Ωt执行后获得yt,ky_{t,k}yt,k过程重复KKK次。这与传统 HPO 的关键区别在于目标嵌入可执行仓库而非通过干净的目标函数接口暴露。Agent 必须解读实验证据包括日志、指标、任务约束和先前执行结果并将其转化为下一次实验的有效配置。2.3 统一执行框架与三级评分体系执行框架Evaluation Harness标准化了 Agent 与异构研究仓库之间的交互维护 Agent 可见的轨迹记录验证提案配置确保在干预空间Ωt\Omega_tΩt内执行实验并记录完整序列审计任务轨迹的完整性和一致性评分体系使用三个互补指标指标定义含义MBNS(Mean Bounded Normalized Score)1T∑t1Tmin{1,max{−1,s~t,r−b~t,ra~t−b~t,r}}\frac{1}{T}\sum_{t1}^T \min\{1, \max\{-1, \frac{\tilde{s}_{t,r}-\tilde{b}_{t,r}}{\tilde{a}_t-\tilde{b}_{t,r}}\}\}T1∑t1Tmin{1,max{−1,a~t−b~t,rs~t,r−b~t,r}}相对于基线的有界改进0基线1达到锚点负值退化BWR(Baseline Win Rate)最终结果严格优于基线的任务比例衡量正向改进的覆盖率MAA(Mean Anchor Attainment)最终结果相对于锚点的绝对达成度衡量达到报告性能的程度其中s~,b~,a~\tilde{s}, \tilde{b}, \tilde{a}s~,b~,a~为统一方向化后的最终得分、基线和锚点。MBNS 区分了相对改进MAA 区分了绝对达成BWR 则揭示了改进的稳定性。三、实验验证30 个任务上的 Agent 能力全景图3.1 主实验有限预算下的整体表现在有限预算协议下基线 5 次干预每次约原实验 10% 预算论文评估了 6 个开源权重 Agent、6 个 API Agent以及 3 种传统 HPO 基线随机搜索、TPE、BOHB 变体方法类别代表模型Overall MBNSBWR (%)MAA (%)传统 HPORandom Search-0.03448.962.6传统 HPOTPE-0.11340.062.4传统 HPOBOHB variant0.01845.665.3开源权重Qwen3-32B0.14860.069.1开源权重Phi-4-14B0.13063.366.9API AgentGPT-5.50.30566.776.7API AgentClaude Sonnet 4.60.40776.779.5关键发现Claude Sonnet 4.6 全面领先在 Overall MBNS、BWR、MAA 三项指标上均获最高且在 CV、TS、Graph、LLM 四个类别上领先。API Agent 整体优于开源权重 AgentGPT-5.5 和 Claude Sonnet 4.6 的 MBNS 显著高于所有开源模型表明更强的实验诊断和决策能力。传统 HPO 方法整体落后但在特定领域仍有竞争力如 TPE 在 TS 类别说明领域特性对方法选择影响显著。无 universally best 方法Qwen3-32B 在 NLP 领先GPT-5.5 在 RL 领先GLM-5.1 在 SL 领先。3.2 全预算与 Harness 消融全预算结果Table 3将训练预算扩展至原始仓库的完整预算后Claude Sonnet 4.6 的 MBNS 从 0.407 提升至 0.472MAA 达 89.1%。但 BWR 并未均匀提升Claude 维持 76.7%Qwen3-32B 从 60.0% 降至 56.7%说明更多计算资源改变了基线和最终性能的相对位置而非单纯提升胜率。Harness 消融Table 4对比原生 AgentHPOBench Harness 与 Claude Code CLI / Codex CLI。原生 Harness 在 MBNS相对改进上更高而 CLI Harness 在 MAA绝对达成上略高。这表明执行接口的选择会影响 Agent 产生的配置和最终性能强调了统一 Harness 对公平比较的重要性。3.3 序列优化轨迹分析进步与回退并存Figure 3 展示了各 Agent 在 5 次干预中的 MBNS 变化轨迹Claude Sonnet 4.6 和 Qwen3-32B在前两次干预中获得显著提升且能保留改进。GPT-5.5改进更渐进但在最终干预达到最高 MBNS。DeepSeek-R1-Qwen-14B初期低于基线后恢复显示不稳定性。Phi-4-14B早期改进后在第 4 次干预部分丢失最终恢复。Kimi-2.6第 4 次干预下降后反弹。Gemma2-2B 和 Llama-3.1-8B大部分时间在基线附近波动。关键洞察当前 Agent 能够识别有益配置但持续保留和改进早期收益的能力不一致。发现有用配置与可靠地精炼它是两个不同的能力。3.4 中间反馈消融实验证据的必要性对 Qwen3-32B 的消融实验Table 5显示移除中间实验反馈仅保留基线观察隐藏干预 1-4 的指标和日志后反馈设置Overall MBNSBWR (%)MAA (%)标准反馈0.14860.069.1无中间反馈0.05250.065.2所有 7 个类别的 MBNS 均下降Overall MBNS 下降 65%。这提供了直接证据访问中间实验结果对序列优化至关重要。Agent 需要利用累积的实验证据来形成有效的后续决策而非仅依赖初始基线观察。3.5 代表性决策轨迹Agent 的行为模式差异Table 15 展示了 tunedGNN Cora GCN 任务上不同 Agent 的决策轨迹基线 Blr0.001, hidden512, layers3, dropout0.7, acc83.5%Agent决策模式最终准确率Claude Sonnet 4.6I1 联合改动后受损 → I2 保守修正 → I3 孤立架构改动 → I4-I5 保留85.2%GPT-5.5I1 保守修正 → I2 保留 → I3 测试单变量深度→ I4-I5 保留84.4%Qwen3-32BI1 激进改动后受损 → I2 恢复 → I3-I5 停止探索83.8%Llama-3.1-8B早期找到强配置85.0%但继续探索最终丢弃81.0%Gemma2-2B重复执行基线未测试替代方案83.5%这揭示了 Agent 行为的深层差异强 Agent 能够从有害初始改动中恢复识别并保留改进弱 Agent 则要么过早停止探索要么在找到好配置后继续扰动导致退化。四、学术洞见AgentHPOBench 揭示了哪些深层规律洞见一序列 HPO 是实验诊断与配置决策的联合能力AgentHPOBench 的最大贡献在于将评估焦点从Agent 能否生成代码或Agent 能否复现论文收窄到Agent 能否将实验证据转化为有效配置。实验表明生成代码 ≠ 优化实验Agent 可以生成语法正确的配置但不一定理解训练日志中的收敛、过拟合或振荡信号。有用配置的识别与保留是两个独立挑战即使发现了好配置Agent 也可能在后续干预中因过度探索而丢弃它如 Llama-3.1-8B 在 tunedGNN 上的表现。中间反馈是序列优化的必要非充分条件移除反馈显著降低性能但仅有反馈不足以保证持续改进部分 Agent 仍出现平台期或回退。洞见二LLM Agent 已展现出超越传统 HPO 的潜力但优势不稳定在 Overall MBNS 上Claude Sonnet 4.60.407和 GPT-5.50.305显著优于传统 HPO 方法。然而优势高度依赖任务领域没有 Agent 在所有 7 个类别上领先。BWR 揭示不稳定性即使最强的 Claude Sonnet 4.6 也在 23.3% 的任务上未能超越基线。开源权重与 API Agent 存在明显差距最强的开源模型 Qwen3-32B0.148仅为 Claude Sonnet 4.6 的 36%表明模型规模和能力对实验诊断至关重要。这与传统认知不同传统 HPO 方法如 TPE、BOHB在结构化搜索空间和干净目标上表现稳健但在需要解读日志、理解任务上下文的真实仓库中LLM Agent 的语义理解能力提供了额外优势——前提是模型足够强。洞见三“最终步评估” vs “最佳历史评估” 揭示了不同的能力侧面论文同时报告了 Final-Step 和 Best-So-Far 两种评估标准Final-Step衡量 Agent 在完整轨迹后保留和精炼改进的能力。Best-So-Far衡量 Agent 在干预预算内发现有用配置的能力。有趣的是在 Best-So-Far 标准下传统 HPO 方法的排名大幅上升Random Search 达 0.325超过所有开源 Agent。这说明传统优化器善于探索多样配置但缺乏保留最佳配置的能力而强 LLM Agent 的优势在于既能发现又能保留改进。五、局限性与未来方向论文坦诚讨论了以下局限评估成本高昂30 个任务 × 12 个 Agent × 5 次干预 × 仓库执行消耗大量计算资源。有限预算协议10% 原始预算虽使广泛评估可行但可能掩盖了某些需要充分训练才能显现的配置差异。任务覆盖局限当前 30 个任务虽跨 7 个领域但未涵盖多物理场耦合、3D 视觉、大规模分布式训练等更复杂场景。API Agent 的不可复现性API 端点不暴露不可变的检查点构建、服务副本或端到端随机种子重复运行会测量模型与服务变化的混合效应而非纯基准随机性。Harness 敏感性原生 Harness 与 CLI Harness 产生不同配置偏好执行接口的选择会影响结果。干预空间的人工构建干预空间由人类从仓库文档中提取可能存在偏差或遗漏。未来方向包括代理评估Surrogate Evaluation用轻量级代理模型预测候选配置性能减少完整训练成本。自适应预算分配当前每次干预获得相同预算未来可探索动态资源分配。跨仓库迁移学习建立历史优化轨迹库使 Agent 能在新任务上复用先前经验。更丰富的反馈信号除标量指标和日志外引入训练曲线可视化、梯度统计等更细粒度的诊断信息。科学微调 LLM在实验优化轨迹上进一步微调 LLM提升其数值推理和日志诊断能力。六、核心思想总结与可借鉴点AgentHPOBench 的核心思想可以用一句话概括不要把 Agent 的实验能力评估当成静态代码生成问题而要把它当成在真实仓库中解读实验证据并做出序列超参数决策的动态优化问题通过统一执行框架确保公平通过多维度评分区分发现能力与保留能力。这个原则背后是三层可迁移的方法论任务标准化将异构研究仓库转化为具有共享基线、固定干预空间和统一评分的可执行任务是进行大规模 Agent 评估的前提。多维度评分MBNS相对改进、BWR改进稳定性、MAA绝对达成三个指标互补避免单一指标掩盖 Agent 的真实行为模式。轨迹分析不仅看最终结果还要分析序列轨迹中的进步、平台期和回退才能揭示 Agent 的决策逻辑。对研究者的借鉴当评估 LLM Agent 的实验能力时最终步性能比最佳历史性能更能反映真实的序列决策质量。AgentHPOBench 的 Final-Step 评估标准是一个值得复用的设计模式。中间实验反馈是序列优化的必要非充分条件。在设计 Agent 系统时确保 Agent 能够访问并有效利用累积的实验证据而不仅是最终标量至关重要。LLM Agent 的优势在于语义理解传统 HPO 的优势在于数值探索。混合范式如 LLM 做诊断 传统优化器做搜索可能是未来的高效路径。对工程师的借鉴如果你正在构建自动化 ML 实验系统务必引入配置保留机制当 Agent 发现显著改进时应倾向于保守保留而非持续扰动。AgentHPOBench 中 Llama-3.1-8B 丢弃强配置的案例是典型反面教材。执行 Harness 的选择会影响 Agent 行为。在对比不同 Agent 时必须使用统一的执行接口和验证逻辑否则比较将失去意义。冒烟测试 预算信封是科学 Agent 的安全护栏AgentHPOBench 的验证层确保配置在干预空间内、实验可执行、结果可提取。任何自动化实验系统都应具备类似的三级验证配置合法性 → 执行可行性 → 结果完整性。AgentHPOBench 通过将 LLM Agent 的评估从静态代码生成转向真实仓库中的序列超参数优化在 30 个跨领域任务上系统性地揭示了当前 Agent 的实验能力与局限它们能够识别有益配置并超越传统 HPO 方法但在持续迭代优化、复杂日志诊断和稳定保留改进方面仍面临显著挑战为开发具有更强实验诊断和序列决策能力的 AI 研究 Agent 提供了坚实的评估基础和明确的改进方向。