OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
摘要
计算机使用智能体(CUA)正在整个数字世界快速推进。CUA轨迹记录智能体的动作、状态与推理。验证轨迹是否完成了任务指令,是CUA评估、数据筛选与强化学习的核心。无论是人工编写的验证器还是人工标注者都无法规模化地提供这种验证,因此该领域日益转向视觉-语言模型(VLM)作为CUA轨迹的评判者。但一个根本问题长期未受检验:这些VLM评判者足够可靠吗?为系统研究这一问题,我们提出OSReward,一个在CUA轨迹上评估VLM评判者的真实、高质量基准。轨迹来自多样化的智能体骨干在跨平台上执行经人工核验的指令,随后通过多阶段人工标注以真值判决进行严格标注。在此基础上,我们衍生出聚焦真正困难样本的挑战集OSReward-Hard,以及用于细粒度效率与对齐评分的OSReward-Multi。迄今对VLM评判者最全面的评估发现,即使最先进的模型也达不到理想评判者的水平,它们共有一种系统性的宽容偏差,会把失败的运行误标为成功。少数可靠到足以信赖的模型运行成本过高、难以规模化,而价格可负担的开源模型则远远落后。为弥合这一差距,我们构建并发布了OS-Shepherd-100K,一个面向CUA社区、带推理标注的轨迹判决开放语料库。在其上,我们训练了OS-Shepherd(9B与35B)开源奖励模型,提供低成本、稳定且可靠的奖励信号,以比前沿模型低30至60倍的成本匹敌商业评判者。大量分析进一步为大规模可靠CUA奖励的设计提供参考。我们的代码、基准、数据集与模型检查点已发布于 https://os-copilot.github.io/OSReward-Home/。
