论文

PAIR:个性化界面下移动 GUI Agent 的跨用户可靠性

Can Agents Work for Everyone? Cross-User Reliability for Mobile GUI Agents in Personalized User Interfaces

智能体系统Agent任务评测长程任务评测

摘要

移动 GUI 智能体越来越多地在受用户历史和偏好影响的界面上运行,但其在不同用户之间的可靠性仍未得到充分探索。我们引入了 PAIR(个性化应用程序状态实例化和渲染),这是一个用于构建用户调节的应用程序状态的管道,可以跨不同用户对同一任务进行受控评估。我们进一步介绍了 RePAIR(带有个性化感知交互奖励的强化学习),这是一种训练方法,可以从子目标结果的跨用户差异中学习,以提高跨用户调节的移动环境的可靠性。在六个智能体中,我们发现不同用户的 任务成功率 存在显着差异,并且在用户调节的 UI 上下文中子目标实现率始终较低(6.98 到 15.4 pp)。对于从每个用户自己的内容中提取的个人目标,这一差距进一步增加(8.77 到 22.0 pp)。这些情况下的失败通常涉及选择另一个项目而不是预期目标,特别是在目标暴露之前。最后,与未见过的用户的监督微调父级相比,RePAIR 改进了用户条件 SAR(+5.87 pp)、全部成功(+7.50 pp)和总体任务 SR(+9.42 pp),提供了初步证据,证明从跨用户变化中显式学习可以提高 GUI-智能体的可靠性。

PAIR:个性化界面下移动 GUI Agent 的跨用户可靠性:论文原图
图 3:PAIR 概述。 (i) 给定用户和应用程序配置文件,PAIR 提取用户偏好并根据其与每个应用程序的相关性对其进行过滤。 (ii) 然后,它使用显式实体偏好的精确匹配和一般偏好的语义相似性对候选应用程序实体进行评分。 (iii)选择排名最高的实体并在相应的应用程序状态中实例化,该应用程序状态被呈现为用户调节的界面。