论文

DragOn:面向拖拽式GUI交互的基准与数据集

DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

模型评测基准与评测资源

摘要

GUI 代理——基于视觉的模型,通过图形用户界面控制桌面、Web 浏览器和移动设备——有望实现各种数字任务的自动化。虽然百万级数据集在点击定位上取得了实质性进展,但拖动定位(例如拖放、滑动、突出显示)数据仍然小一个数量级,并且当前模型在复杂的基于拖动的交互方面存在不足。我们介绍 DragOn,一个拖动定位基准和训练数据集,涵盖四个领域:文本突出显示、单元格选择、元素调整大小和滑块操作。该数据集包含 286K 训练屏幕截图和 350 万个训练任务,以及包含 2000 个示例的评估套件。我们评估专有(GPT、Claude)和开放权重(Qwen、Kimi、Holo)模型,以及根据我们的训练数据进行微调的 Qwen VLM。结果表明,我们的数据集可以提高最先进模型在下游计算机使用任务上的性能。

DragOn:面向拖拽式GUI交互的基准与数据集:论文配图
(a) 成功拖拽-计算机使用专业化政策(holo3-35b-a3b)。左:拖动之前的观察,执行的拖动调用以红色覆盖。右:下一个观察,其中代理产生了有效的拖动来选择所需的单元格范围;试验最终成功。(b) 失败的阻力——通才基本政策(qwen3-5-35b-a3b-fp8)。左:拖动之前的观察,执行的拖动调用以红色覆盖。右:下一个观察,其中代理没有产生有效的阻力,选择了错误的单元格范围;图 4:OSWorld 任务 libreoffice_calc_19 的定性端到端比较:计算机使用专用策略(图 4(a))执行成功的拖动并解决任务,而具有相同架构和参数计数的通用基本策略(图 4(b))在相同的初始状态下产生失败的拖动;完整设置请参见附录 C。