论文
DiffSpot:VLM 能否发现 Web 界面中细粒度的视觉差异?
DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?
摘要
视觉语言模型(VLM)在高级图像文本对齐方面取得了长足进步,但它们感知细微视觉差异的能力仍然有限。我们在渲染的 Web 界面中研究这个问题,其中局部视觉变化既是细粒度感知的诊断测试,也是对 GUI智能体 和设计工具的实际要求。我们引入了 \textbf{DiffSpot},这是一个代码驱动的基准测试,用于在 Web 界面上进行开放式的找出差异。 DiffSpot 通过改变自包含 HTML 中目标元素的单个 CSS 属性、重新渲染页面并记录更改的属性、元素和突变幅度来构造受控图像对。定位核验门仅保留其渲染像素差异仅限于目标元素的对。该基准测试包含 4{,}400 个对,其中包括 3{,}900 个在 13 个 CSS 属性运算符和三个难度级别上平衡的有差异对,以及用于幻觉控制的 500 个无差异对。通过零样本评估 13 个前沿 VLM,我们发现即使是最好的模型也只能识别 $40.7\%$ 的真实变化,每个模型的硬层召回率都低于 $23\%$。 DiffSpot 进一步表明,难度与属性密切相关:在 CSS 运算符中,像素大小和 CLIP 距离都不能可靠地预测召回率。