论文

FineState-Bench:细粒度 GUI 状态下的条件化目标定位评测

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

模型评测基准与评测资源

摘要

尽管大型视觉语言模型 (LVLM) 取得了快速进展,但细粒度、状态条件的 GUI 交互仍然具有挑战性。目前的评估覆盖范围有限,目标状态定义不精确,并且过度依赖最终任务的成功,从而掩盖了智能体失败的地点和原因。为了解决这一差距,我们引入了 \textbf{FineState-Bench},这是一个基准,用于评估代理是否可以正确地将指令发送到预期的 UI 控件并达到确切的目标状态。 FineState-Bench 包含跨桌面、Web 和移动平台的 2,209 个实例,涵盖四个交互系列和 23 个 UI 组件类型,每个实例都明确指定了细粒度状态设置的确切目标状态。我们进一步提出 \textit{FineState-Metrics},一个具有阶段成功率的四阶段诊断管道:定位成功率 (SR@Loc)、交互成功率 (SR@Int)、定位时的精确状态成功率 (ES-SR@Loc) 和交互时的精确状态成功率 (ES-SR@Int),以及生成描述和边界框定位的即插即用 \textit{Visual Diagnostic Assistant} (VDA)提示通过受控的带/不带比较来诊断视觉目标定位原因。在 FineState-Bench 上,确切的目标状态成功率仍然很低:ES-SR@Int 在 Web 上的峰值为 32.8\%,在跨平台上平均为 22.8\%。通过 VDA 本地化提示,Gemini-2.5-Flash 获得了 +14.9 ES-SR@Int 点,这表明改进的视觉基础有很大的空间,但整体精度仍然不足以实现可靠的细粒度状态条件交互\href{https://github.com/FengxianJi/FineState-Bench}{Github。}