论文
PIRA-Bench:从响应式GUI智能体到基于GUI的主动意图推荐智能体的转变
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
摘要
当前的图形用户界面(GUI)智能体主要在响应式范式下运行:用户必须给出明确指令,智能体才会执行任务。然而,智能的AI助手应当是主动的,能够直接从连续视觉输入(如手机或桌面截图)预判用户意图,并在没有用户明确提示的情况下及时给出推荐。向这种主动范式转变存在重大挑战。真实世界的屏幕活动很少是线性的,它由充满噪声浏览、无意义动作与多线程任务切换的长时程轨迹构成。为填补这一空白,我们提出PIRA-Bench(主动意图推荐智能体基准),一个评估多模态大语言模型(MLLM)在连续、弱监督视觉输入上表现的新基准。与响应式数据集不同,PIRA-Bench的特点是包含多个交错意图的复杂轨迹,以及带有各种用户画像情境的噪声片段,挑战智能体在贴合用户偏好的同时检测可行动事件。此外,我们提出PIRF基线,一个具备记忆感知与状态追踪的框架,使通用MLLM能够管理多个任务线程并处理误导性视觉输入。PIRA-Bench是迈向稳健、主动的基于GUI的个人助手的初始一步。
