论文
AutoGUI-v2:全面的多模式 GUI 功能理解基准
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
摘要
能够导航图形用户界面(GUI)的自主代理拥有彻底改变数字生产力的潜力。然而,实现真正的数字自治不仅仅限于电抗元件匹配。它需要界面动力学的预测心理模型以及预见交互产生的“数字世界状态”的能力。尽管现代视觉语言模型 (VLM) 具有感知能力,但现有基准仍然存在分歧(要么关注黑盒任务完成,要么关注静态、浅层基础),因此无法评估智能体是否真正理解 GUI 的隐含功能和转换逻辑。为了弥补这一差距,我们引入了 AutoGUI-v2,这是一个综合基准测试,旨在评估对 GUI 功能的深入理解和交互结果预测。我们使用新颖的 VLM-人类协作管道构建基准,该管道将多平台屏幕截图递归解析为分层功能区域,以生成不同的评估任务。 AutoGUI-v2 跨六个操作系统提供 2,753 个任务,严格测试代理的区域和元素级语义、基础和动态状态预测。我们的评估揭示了 VLM 中惊人的二分法:虽然根据代理数据进行微调的开源模型(例如 Qwen3-VL)在功能基础方面表现出色,但商业模型(例如 Gemini-2.5-Pro-Thinking)在功能字幕方面占主导地位。至关重要的是,所有模型都在与不常见行为的复杂交互逻辑作斗争,这凸显出深入的功能理解仍然是一个重大障碍。通过系统地测量这些基础功能,AutoGUI-v2 为推进下一代 GUI智能体 提供了新的视角。