论文

GUI-AC:在 GUI智能体 中加强持续学习

GUI-AC: Enhancing Continual Learning in GUI Agents

模型训练强化学习

摘要

图形用户界面 (GUI) 是人机交互的主要媒介,但构建 GUI智能体 来泛化现实世界界面环境的多样性,并具有与人类自然表现出的相同的灵活性和鲁棒性,仍然悬而未决。值得注意的是,GUI 数据本质上是非平稳的:以前未见过的界面实例(例如新的域和分辨率)的不断出现会导致持续的分布变化,从而严重阻碍了现有 GUI智能体 的持续学习。强化微调(RFT)作为一种有前途的方法引起了相当大的关注。然而,RFT 的视觉定位能力表现出明显的不稳定性,表现为急剧的奖励不连续性和高方差振荡。采样轨迹结果的不平衡分布给优势评估带来了很大的噪音,导致政策过度自信。固定的裁剪界限抑制了适应新分布所需的政策概率的增加,导致勘探能力的崩溃。为了应对这些挑战,我们提出了 GUI-AC,这是一种增强 GUI智能体 持续学习能力的方法。 GUI-AC 引入了视觉定位置信度来支持两个核心机制:(i)自适应优势,降低噪声优势估计的权重,以防止政策过度自信; (ii) 动态裁剪,放宽裁剪界限以鼓励探索范围。大量的实验表明,这些机制共同提高了性能,使我们的方法超越了最先进的基线。代码可在 https://github.com/Can-Lin/GUI-AC 上匿名获取。