论文
GSAR:面向移动GUI智能体的目标状态锚奖励与自演化数据合成
GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis
摘要
基于视觉语言模型(VLM)的GUI智能体可从在线强化学习(RL)中显著受益。然而其训练受制于两个根本问题:当前面向GUI智能体的数据合成方法依赖特定环境,难以生成多样化数据;现有评估器要么可扩展性受限,要么提供不准确、不可靠的奖励信号。为克服这些挑战,我们提出GSAR(Goal-State-Anchor Reward,目标状态锚奖励),一个支持可扩展任务生成并交付可靠奖励信号、以实现稳定高效策略优化的RL奖励框架。本方法的特点是自演化数据合成:通过任务执行产生多个环境,并生成多样的任务与目标状态。与之互补,状态锚机制会在成功的目标状态中自动标注与任务相关的UI元素作为参考锚。在RL训练中,这些参考锚提供准确、可扩展的奖励信号,显著提升效率。大量评估表明,该框架在离线轨迹验证上取得超过90%的准确率,表现最接近基于规则的方法。此外,使用我们的奖励框架训练的智能体在AndroidWorld和我们构建的基准上都表现出强劲性能,为GUI智能体训练确立了一条可扩展的路径。
