论文

恢复策略引起的错误:鲁棒 GUI智能体 的基准测试和轨迹综合

Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents

模型评测基准与评测资源

摘要

虽然 GUI智能体 发展迅速,但它们往往缺乏从自身错误中恢复的稳健性,从而阻碍了实际部署。为了弥补评估和数据层面的这一差距,我们引入了 GUI-RobustEval 并提出了鲁棒性驱动的轨迹综合。 GUI-RobustEval 包含 1,216 个可执行测试用例,可系统地测量广泛且现实的错误模式范围内的错误恢复能力。在数据层面,RoTS 是一个可扩展的综合框架,可通过基于树的管道创建 80 万条高质量数据,主动发现各种错误模式并综合相应的恢复步骤。我们的两个模型 RoTS-7B 和 RoTS-32B 在我们的数据集上进行了微调,都在 GUI-RobustEval 和传统 GUI 基准测试上展示了显着的进步。值得注意的是,RoTS-32B 在 OSWorld 上实现了最先进的性能,成功率为 $47.4\%$ ,All-Pass@4 得分为 $33.8\%$,这表明改进的长范围错误恢复能力有助于提高鲁棒性和整体性能。我们的代码可在 https://github.com/AlibabaResearch/RoTS 获取。