论文

看到证据,却错过答案:工具引导的视觉语言模型关于视觉错觉

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

智能体系统Agent 工具调用

摘要

视觉语言模型(VLM)在面对经典的视错觉时表现出系统性偏差:无论图像是否经过反事实修改,它们都压倒性地将错觉预测为“真实”。我们为 DataCV 2026 挑战赛(任务 I 和 II)提出了一个工具引导的推理框架,该框架无需任何 模型训练 即可解决这种故障模式。现成的视觉语言模型可以访问一小组通用图像处理工具:线条绘制、区域裁剪、并排比较和通道隔离,以及幻觉类型路由系统提示,该提示规定了每个感知问题类别调用哪些工具。至关重要的是,每个工具调用都会生成一个附加到持久注册表的新的、不可变的图像资源,因此模型可以在整个推理链中引用和组成任何先前带注释的视图。这种通用工具加路由的设计不是硬编码特定于错觉的模块,而是产生了强大的跨结构泛化:从验证集到包含结构上不熟悉的错觉变体的测试集,性能保持一致(例如,马赫带从垂直堆叠旋转到水平堆叠)。我们进一步报告了三个我们认为值得进一步研究的经验观察结果:(i)强烈的阳性检测偏差可能源于不平衡的错觉训练数据,(ii)像素精确的空间推理和自我生成注释的逻辑推理之间的显着分离,以及(iii)对导致误报的图像压缩伪影的明显敏感性。