论文
SeekJudge:面向计算机使用智能体强化学习的实用奖励框架
SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
摘要
判定一条轨迹是否真正完成其指令,决定了我们如何在长程图形用户界面任务上度量计算机使用智能体(computer-use agents),以及如何用强化学习(RL)训练它们。这种判定长期依赖基于规则的评估。规则评估常与人类意图不一致,并在应用更新或其在线内容漂移时过时。现有的基于模型的裁判试图解决这些问题,但判定准确率仍然有限。我们提出SeekJudge框架,其四个智能体——Condense、Ground、Seek与Analyze——通过对轨迹的Seek-Analyze循环得出判定。为了在密集标注轨迹上训练专用模型,我们提出种子驱动的蒸馏流水线,把少量人工标注的种子轨迹扩展为1万条此类轨迹。为评估步骤级判定,我们构建了CUAStepBench,一个把轨迹判定与密集步骤标签配对的人工标注基准。除准确率外,SeekJudge的成本远低于闭源大模型。我们进一步提出rollout overlap,一种降低RL训练中奖励模型开销的奖励服务器设计。据我们所知,以留出RL测试目标上的下游成功率衡量,SeekJudge是首个在在线RL中匹敌或超越原生规则奖励的基于模型的奖励。在离线判定中,SeekJudge-9B在AgentRewardBench上还以9.5 F1超过基于规则的评估。