论文
空间中不可见,时间中可见:针对 GUI 代理的运动视觉验证码
Invisible in Space, Visible in Time: Motion Vision CAPTCHA against GUI Agents
摘要
大多数现有的视觉验证码仍然可以在空间上解决:所需的信息通过静态外观、局部结构和界面状态公开。多模态大语言模型(MLLM)和图形用户界面(GUI)代理的进步削弱了这一假设,它们表现出强大的视觉感知、推理和浏览器交互能力。我们提出了运动视觉验证码(MVCAP),这是一种基于分层运动的验证码框架,其中目标语义被实例化为运动定义的前景结构,并且只能通过与动态演变的背景的时间隔离来恢复。基于这一共享原则,MVCAP 在三个感知渐进级别上进行实例化:连贯运动、结构运动和生物运动。为了评估该框架,我们引入了 MVCAP-Bench,这是一个基于浏览器的基准测试,具有 600 个实时验证码实例,以及匹配的仅前台控制基准测试 MVCAP-Bench-FG。我们评估人类、浏览器使用代理、本机计算机使用代理以及源自相同实例的补充离线 VQA 设置。结果揭示了人类与智能体之间的巨大差距:在完整的 MVCAP-Bench 上,人类准确率达到 99.6%,而最好的 GUI 智能体仅达到 16.8%,接近六向机会水平。仅前台控件进一步表明,关键困难来自动态背景伪装,而不是单独的答案格式或浏览器交互。这些发现确定了可测量的人类与智能体感知差距,并将 MVCAP-Bench 定位为研究当前智能体运动定义感知的基准。