论文

GUIDE:理解和帮助用户完成开放式 GUI 任务的基准

GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks

模型评测基准与评测资源

摘要

图形用户界面 (GUI) 代理有潜力帮助用户与复杂软件(例如 PowerPoint、Photoshop)进行交互。虽然之前的研究主要集中在通过点击和击键来自动化用户操作,但这种范式忽视了人类的意图,即用户重视在保持代理的同时探索、迭代和完善他们的想法的能力。为了超越自动化并走向协作,GUI智能体 必须了解用户在做什么以及为什么这样做。我们引入 GUIDE(GUI 用户意图检测评估),这是一个基准,用于评估 AI 模型感知用户行为、推断意图以及为开放式 GUI 任务提供帮助的能力。 GUIDE 包含 120 个新手用户演示的 67.5 小时屏幕录像,其中包括 10 个软件的有声思考旁白。 GUIDE 定义了三个任务 - (i) 行为状态检测、(ii) 意图预测和 (iii) 帮助预测,测试模型识别行为状态、推理目标以及决定何时以及如何提供帮助的能力。对 8 个最先进的多模态模型的评估表明,所有模型都举步维艰,在行为状态和帮助预测方面仅达到 44.6% 和 55.0% 的准确度。然而,提供用户上下文显着提高了性能,将帮助预测提高了 50.2 个百分点,凸显了结构化用户理解在有效帮助中的关键作用。我们的数据集可在 https://guide-bench.github.io 上获取。