论文
迈向 GUI智能体:GUI 基础的视觉语言扩散模型
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
摘要
自回归 (AR) 视觉语言模型 (VLM) 长期以来一直主导着多模式理解、推理和图形用户界面 (GUI) 基础。最近,离散扩散视觉语言模型(DVLM)在多模态推理中表现出强大的性能,提供双向注意力、并行词元生成和迭代细化。然而,它们在 GUI 基础上的潜力仍未被开发。在这项工作中,我们评估离散 DVLM 是否可以作为 GUI 基础 AR 模型的可行替代方案。我们采用 LLaDA-V 进行单轮动作和边界框预测,将任务框架为从多模态输入生成文本。为了更好地捕获边界框几何的层次结构,我们提出了一种混合掩蔽方案,该方案结合了线性掩蔽和确定性掩蔽,与使用线性掩蔽训练的 GUI 适应的 LLaDA-V 相比,步骤成功率 (SSR) 的界面元素定位精度提高了 6.1 个点。对涵盖网络、桌面和移动界面的四个数据集的评估表明,尽管预训练有限,但具有混合掩蔽的自适应扩散模型始终优于线性掩蔽变体,并且与自回归模型相比具有竞争力。系统消融表明,增加扩散步骤、生成长度和块长度可以提高准确性,但也会增加延迟,超过一定数量的扩散步骤后,准确性会趋于稳定。使用不同的 GUI 域扩展训练数据进一步减少了约 1.3 秒的延迟,并将基准测试中的界面元素定位精度平均提高了 20 个点。这些结果表明,离散 DVLM 是一种有前途的 GUI 基础建模框架,代表着朝着基于扩散的 GUI智能体 迈出了重要一步。