论文

GoClick:用于自主 GUI 交互的轻量级元素定位模型

GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction

模型优化小模型/轻量模型

摘要

图形用户界面 (GUI) 元素基础(根据自然语言指令在屏幕截图上精确定位元素)是代理与 GUI 交互的基础。对于需要低延迟的 GUI智能体 来说,直接在手机等资源受限的设备上部署此功能变得越来越重要。然而,这一目标面临着重大挑战,因为当前的视觉基础方法通常采用大型视觉语言模型 (VLM)(超过 2.5B 参数),由于内存和计算限制,使得它们对于设备上执行来说不切实际。为了解决这个问题,本文介绍了 GoClick,这是一种轻量级 GUI 元素定位 VLM,仅具有 230M 参数,可实现出色的视觉定位精度,甚至可以与更大的模型相媲美。简单地缩小现有仅解码器的 VLM 的大小是设计轻量级模型的一种直接方法,但我们的实验表明,这种方法会产生次优结果。相反,我们选择了一种编码器-解码器架构,该架构在 GUI 基础任务的小参数范围内优于仅解码器的替代方案。此外,小型 VLM 的有限容量鼓励我们开发渐进式数据细化管道,利用任务类型过滤和数据比率调整从 1080 万原始数据集中提取高质量的 380 万样本核心集。使用此核心集训练 GoClick 可显着提高定位精度。我们的实验表明,GoClick 在多个 GUI 元素基础基准测试中表现出色,同时保持了小尺寸和高推理速度。当集成到设备-云协作框架中时,GoClick 还增强了 GUI智能体 性能,其中 GoClick 帮助基于云的任务规划器执行精确的元素定位并实现更高的成功率。我们希望我们的方法能够成为 GUI智能体 社区中有意义的探索。