[论文学习]OSReward:为跨平台计算机使用奖励模型建立标准化评估

📅 2026/8/3 23:24:01
[论文学习]OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward为跨平台计算机使用奖励模型建立标准化评估论文重点OSReward是一个针对计算机使用智能体CUA轨迹验证任务的标准化评估基准由来自香港大学、南京大学、新加坡国立大学等多所顶尖机构的23位研究者共同完成。研究发现当前最先进的视觉语言模型VLM作为CUA轨迹的评判者存在系统性的宽松偏差leniency bias——倾向于将失败轨迹误判为成功而少数足够可靠的模型又因成本过高而无法规模化部署。为此研究团队构建了OS-Shepherd系列开源奖励模型9B和35B在匹配商业级评判模型性能的同时将成本降低至前者的30-60分之一。核心研究内容问题定义计算机使用智能体CUA正在快速渗透数字世界的各个角落——网页、移动应用、桌面软件。一个CUA轨迹记录了智能体的动作、状态和推理过程验证该轨迹是否完成了任务指令是CUA评估、数据筛选和强化学习的核心环节。然而无论是人工编写的验证器还是人类标注者都无法在大规模场景下提供这种验证。因此该领域越来越依赖VLM作为CUA轨迹的“评判者”。但一个根本性的问题始终未被认真审视这些VLM评判者到底有多可靠创新方法OSReward的核心创新体现在三个层面1. 基准构建OSReward Benchmark不同于复用现有Agent基准中的现成轨迹这种做法会将评判者错误与轨迹本身缺陷混为一谈OSReward从零搭建了专用的跨平台数据基础设施在网页、移动端和桌面端四个平台上运行多种Agent主干模型执行人工验证的指令再通过多阶段人工标注生成高质量的“金标准”标签。2. 挑战集设计OSReward进一步衍生出两个子集——OSReward-Hard专注于真正困难的案例标注者自身都存在分歧的轨迹用于诊断评判模型的错误模式OSReward-Multi则在二分类判定之上叠加了细粒度的效率和对齐评分。3. 开源奖励模型OS-Shepherd基于评估发现的洞见团队构建了包含10万条推理标注轨迹评判的开放语料库OS-Shepherd-100K并采用两阶段训练策略训练出OS-Shepherd-9B和OS-Shepherd-35B两款开源奖励模型。研究成果研究团队对27个模型进行了迄今为止最全面的VLM评判者评估。核心发现包括准确性上限在OSReward完整集上只有最前沿的闭源模型接近90%的二分类准确率Claude-Opus-4-8达到89.7%但到了OSReward-Hard上最佳评判者准确率跌破70%平均仅52%。系统性宽松偏差所有VLM评判者共享一个令人不安的特征——对失败轨迹过于宽容尤其是当智能体“声称”任务完成但实际失败时评判者极易被误导。开源与闭源的鸿沟闭源模型在几乎所有维度上领先开源模型差距在小规模开源VLM上最为显著。但OS-Shepherd在OSReward-Hard的成本-准确率前沿上以极低成本达到了接近最昂贵商业模型的表现。实际落地应用的可能性OSReward的价值具有多重落地场景CUA训练与评估为CUA的强化学习提供可靠且低成本的奖励信号使规模化训练成为可能。数据筛选与质量把控在构建CUA训练数据集时自动过滤低质量轨迹。模型选型参考为开发者提供了一个标准化的评判模型对比平台。开源生态建设OS-Shepherd系列模型和OS-Shepherd-100K数据集已全部开源极大降低了CUA研发的门槛。技术细节数据采集与标注流程OSReward的数据构建采用了严格的端到端流程环境准备在桌面和移动端搭建专用的执行环境远超一般基准的覆盖范围。指令编写针对各平台生成经过人工验证的指令集。Agent执行在多种Agent主干模型上执行指令收集完整轨迹包含截图、动作序列和推理过程。多阶段人工标注每条预筛选的轨迹由三位独立标注者进行标注标注者之间存在分歧的案例被归入OSReward-Hard。评价指标体系研究采用了多维度的评价指标二分类准确率Binary Accuracy最基本的评判指标。成功召回率Success Recall真正成功的轨迹中被正确接受的比例——低值表示评判者过于严格。失败召回率Fail Recall真正失败的轨迹中被正确捕获的比例——低值表示评判者过于宽松。平衡准确率Balanced Accuracy上述两者的均值避免了类别不平衡OSReward中成功/失败比例为43%/57%对结果的扭曲。在OSReward-Multi中成功轨迹还会在对齐度Alignment和效率Efficiency两个维度上接受3级评分0/0.5/1。两阶段训练策略OS-Shepherd的训练采用了针对宽松偏差的专门设计第一阶段建立准确的轨迹评判能力。第二阶段直接针对“虚假成功false success”——即研究揭示的最严重失败模式——进行优化。成本-性能分析研究的一个重要贡献是绘制了OSReward-Hard上的成本-准确率前沿cost-accuracy frontier。分析显示可靠的评判模型极为昂贵而低成本的开放模型又表现不佳。OS-Shepherd恰好填补了这一空白——以远低于前沿模型的成本达到了接近其准确率的水平。研究设定硬件与软件配置模型规模OS-Shepherd提供9B和35BMoE架构两个版本。推理设置研究中固定了帧数、红色点击标记等参数并在消融实验中逐一扰动分析。解码策略采用贪心解码greedy decoding。数据规模OSReward基准包含1,019条跨平台轨迹。OSReward-Hard284条高难度案例。OS-Shepherd-100K从超过30万个评判实例中筛选出的近10万条训练样本。实验设计研究对27个VLM模型进行了系统评估涵盖了从开源到闭源、从小型到超大规模的各类模型。实验设计特别注意了训练集与测试集的严格分离——OS-Shepherd的训练语料与OSReward基准完全不相交。综合分析核心贡献的学术价值OSReward的贡献远不止于提供一个基准。它系统地揭示了一个此前被忽视但至关重要的问题VLM作为评判者的可靠性远未达到理想状态。这一发现对CUA领域的发展具有警示意义——如果连任务完成与否的判断都不可靠那么基于此的评估、数据筛选和强化学习都可能建立在不稳固的基础之上。尤为值得关注的是宽松偏差的系统性。研究发现这种偏差并非某个模型的偶然缺陷而是跨模型、跨平台的普遍现象。这意味着简单的“换一个更好的模型”无法解决问题——需要从根本上重新思考评判模型的设计和训练范式。方法论上的创新OSReward在方法论上提供了一个值得借鉴的范式先系统性地诊断问题再有针对性地构建解决方案。研究团队没有止步于“发现VLM评判者不可靠”这一结论而是基于诊断结果构建了OS-Shepherd-100K训练语料和两阶段训练策略。这种“诊断→数据→模型”的闭环思路为AI安全和对齐研究提供了可复用的方法论参考。开源生态的意义OSReward团队将代码、基准、数据集和模型权重全部开源。考虑到CUA是当前AI领域最热门的赛道之一这一决定具有重要的生态价值——它使得中小型团队也能开展CUA相关研究而无需承担高昂的商业API调用成本。OS-Shepherd将成本降低至商业模型的1/30到1/60这一数量级的差距足以改变整个领域的研究范式。局限性与展望从论文摘要和初步分析来看OSReward仍存在一些值得关注的局限性动态验证的缺失当前基准基于静态轨迹的离线评判而实际的CUA强化学习需要在线奖励信号——这一差距如何弥合尚不明确。人类标注的质量边界即使是多阶段人工标注“金标准”本身也受限于人类标注者的判断能力——OSReward-Hard正是标注者分歧的集合说明有些案例连人类也难以达成共识。跨平台泛化能力虽然OSReward覆盖了四个平台但CUA的应用场景仍在快速扩展基准的覆盖面能否跟上领域发展仍需观察。实践应用对研究者的建议评估CUA时请勿盲信VLM评判者OSReward的研究表明即使是GPT-5.5、Claude-Opus-4-8等前沿模型在困难案例上的准确率也仅徘徊在70%左右。建议在研究设计中加入人工抽检或交叉验证机制。优先使用OS-Shepherd作为奖励模型对于需要规模化部署CUA奖励信号的场景OS-Shepherd-35B在成本-性能权衡上表现最优。如果资源有限9B版本也是一个合理的选择。关注宽松偏差的缓解在构建自己的评判模型时应有意识地在训练数据中增加失败案例的比重特别是那些“看似成功实则失败”的边界案例。对工程师的建议直接使用开源资源OSReward的代码、模型权重和数据集均已开源可立即集成到现有CUA开发流程中。成本优化策略如果当前使用GPT-4o或Claude等商业模型进行轨迹评判迁移到OS-Shepherd可将成本降低30-60倍同时保持相近的准确率。利用OSReward-Hard进行压力测试在部署CUA系统前可使用OSReward-Hard子集对评判模型进行压力测试识别其在困难案例上的表现短板。对决策者的建议重视CUA的可验证性问题OSReward揭示的评判者可靠性问题提醒我们CUA的“自动化”不能以牺牲“可验证性”为代价。在将CUA投入关键业务场景前应建立多层次的质量把控机制。投资开源基础设施建设OSReward的成功表明开源社区能够以远低于商业方案的成本提供高质量的AI基础设施。在AI研发投入上支持开源生态可能比单纯采购商业API更具长期价值。参考资料原始论文https://arxiv.org/abs/2607.28609项目主页https://os-copilot.github.io/OSReward-Home/论文PDFhttps://arxiv.org/pdf/2607.28609