论文

PSPA-Bench:面向智能手机 GUI 智能体的个性化基准

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

智能体系统Agent任务评测

摘要

智能手机 GUI 智能体通过直接操作应用界面来执行任务,为无需深度系统集成即可获得广泛能力提供了一条路径。然而,现实世界中的手机使用高度个性化:用户采用多样的工作流与偏好,这要求智能体提供定制化协助而非通用方案。由于用户特定数据稀疏且缺乏细粒度评估指标,现有 GUI 智能体基准无法充分刻画这一个性化维度。为填补这一空白,我们提出 PSPA-Bench,一个专门用于评估智能手机 GUI 智能体个性化的基准。PSPA-Bench 包含超过 12,855 条与真实世界用户行为对齐的个性化指令,覆盖 10 个代表性日常使用场景和 22 款移动应用,并引入了一种结构感知的过程评估方法,可在细粒度层面衡量智能体的个性化能力。我们通过 PSPA-Bench 对 11 个最先进的 GUI 智能体进行了评测。结果显示,现有方法在个性化设定下表现不佳,即使最强的智能体所能取得的成功也很有限。我们的分析进一步指出了推进个性化 GUI 智能体的三个方向:(1) 推理导向模型始终优于通用 LLM;(2) 感知仍是一项简单却关键的能力;(3) 反思与长期记忆机制是提升适应能力的关键。这些发现共同确立了 PSPA-Bench 作为个性化 GUI 智能体系统研究与未来进展的基础。

PSPA-Bench:面向智能手机 GUI 智能体的个性化基准:论文配图
图 1:GUI 代理正在从通用的一次性任务执行转向个性化的长期服务。 (i) 给定相同的指令,代理应根据用户偏好调整其执行路径; (ii) 对于同一用户,代理利用历史执行经验提供长期支持;截至时间 tt 的经验告知类似指令在 t+1t+1 时的精细执行。