字节:区分指令遵循与模型默认行为

📅 2026/8/21 7:26:00
字节:区分指令遵循与模型默认行为
标题Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents来源arXiv, 2608.11727v1️文章简介研究问题如何准确评估编码智能体在复杂工作流中究竟是真正遵循了特定指令还是仅仅因为该行为符合其未受提示时的默认偏好主要贡献论文提出了Harness-IF基准测试及AP-Acc指标通过规则级评估和先验控制分离了指令遵循与巧合并揭示了不同指令表面的优先级顺序。重点思路构建多表面指令环境将指令分布在系统提示、工具描述、技能描述、项目文件和用户指令五个可配置表面模拟真实部署场景而非仅关注用户提示。建立原子规则库从642条原子约束中筛选出60个现实的多轮编码任务每条规则独立评分确保评估粒度细化至具体操作规则而非整体任务成功率。引入AP-Acc指标提出对抗先验准确率AP-Acc专门评估那些与模型无提示默认行为相悖的规则通过零注入探针识别默认行为从而剔除因巧合而得分的情况。设计冲突实验通过控制变量法在保持规则语义不变的情况下改变其所在表面或制造表面间冲突以分析不同指令来源的优先级和遵循难度。分析总结普遍存在遵循差距所有12个前沿模型在对抗先验规则上的表现均显著低于整体准确率平均差距为5.81个百分点证明传统聚合分数高估了模型的合规性。失败模式集中大部分失败源于未能执行要求的动作短缺型失败而非过度执行禁止动作输出控制和工流程类规则的失败率最高。表面优先级非深度决定实验显示系统提示、项目文件和用户指令具有同等最高的优先级优于工具和技能描述这一结果反驳了简单的提示词深度决定论。排名受先验影响虽然顶级模型排名未变但考虑先验控制后部分相邻模型的排名发生交换表明不同模型对默认行为的依赖程度存在差异。个人观点论文洞察了现有基准测试混淆“能力”与“习惯”的缺陷追问高分背后的动机是听从指令还是顺应本能。