论文
交互式奖励智能体:通过环境状态验证进行GUI任务评估
Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
摘要
图形用户界面任务评估旨在判断GUI智能体是否成功完成了用户指令。自动化GUI任务评估受到越来越多的关注,因为评估结果可以作为测试时扩展与后训练的奖励信号。然而,可靠的GUI任务评估仍然具有挑战性,因为判断往往需要访问执行轨迹截图之外的环境状态,例如系统配置、文件数据与应用设置。本文提出基于先提议后验证框架的交互式奖励智能体(IRA),从执行后的环境中获取并验证证据。给定任务指令与GUI智能体执行后的GUI环境,IRA先提出任务完成条件,再通过调用系统工具、应用工具与GUI工具加以验证。这一设计在交互过程中结合了来自可见界面与环境状态的证据。我们进一步提出GUI-RewardBench,一个包含覆盖10类Ubuntu桌面应用的321条GUI任务轨迹的基准。实验表明,IRA在GUI-RewardBench上达到86.9%的准确率,优于现有评估器基线。我们进一步将IRA应用于GUI智能体的强化学习,取得34.0%的OSWorld成功率,证明IRA能为训练GUI智能体提供有效的奖励信号。
