论文

OS-Themis:面向通用GUI奖励的可扩展评判框架

OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

强化学习(RL)有潜力提升GUI智能体在随机环境中的鲁棒性,但训练对奖励函数的质量高度敏感。现有奖励方法难以同时实现可扩展性与性能。为此,我们提出OS-Themis,一个可扩展且准确的多智能体评判框架。与单一评判者不同,OS-Themis将轨迹分解为可验证的里程碑,以隔离决策所需的关键证据,并在作出最终裁决前采用复核机制严格审查证据链。为便于评估,我们进一步推出OmniGUIRewardBench(OGRBench),一个面向GUI结果奖励的综合跨平台基准,所有被评估模型在OS-Themis下均取得最佳表现。在AndroidWorld上的大量实验表明,OS-Themis用于支撑在线RL训练时带来10.3%的提升,用于自训练循环中的轨迹验证与过滤时带来6.9%的收益,凸显了其驱动智能体演进的潜力。

OS-Themis:面向通用GUI奖励的可扩展评判框架:论文配图
图1:现有GUI环境奖励建模方法的局限性分析,构成OS-Themis可扩展通用GUI奖励评论家框架的提出动机。