论文
PAIR:个性化界面下移动 GUI Agent 的跨用户可靠性
Can Agents Work for Everyone? Cross-User Reliability for Mobile GUI Agents in Personalized User Interfaces
摘要
移动 GUI 智能体越来越多地在受用户历史和偏好影响的界面上运行,但其在不同用户之间的可靠性仍未得到充分探索。我们引入了 PAIR(个性化应用程序状态实例化和渲染),这是一个用于构建用户调节的应用程序状态的管道,可以跨不同用户对同一任务进行受控评估。我们进一步介绍了 RePAIR(带有个性化感知交互奖励的强化学习),这是一种训练方法,可以从子目标结果的跨用户差异中学习,以提高跨用户调节的移动环境的可靠性。在六个智能体中,我们发现不同用户的 任务成功率 存在显着差异,并且在用户调节的 UI 上下文中子目标实现率始终较低(6.98 到 15.4 pp)。对于从每个用户自己的内容中提取的个人目标,这一差距进一步增加(8.77 到 22.0 pp)。这些情况下的失败通常涉及选择另一个项目而不是预期目标,特别是在目标暴露之前。最后,与未见过的用户的监督微调父级相比,RePAIR 改进了用户条件 SAR(+5.87 pp)、全部成功(+7.50 pp)和总体任务 SR(+9.42 pp),提供了初步证据,证明从跨用户变化中显式学习可以提高 GUI-智能体的可靠性。
