论文
在跳跃之前进行检测:视觉语言模型中的海市蜃楼检测
Detect Before You Leap: Mirage Detection in Vision-Language Models
摘要
视觉语言模型 (VLM) 可以在没有相关视觉证据的情况下产生可信的答案,这种失败模式称为海市蜃楼(Asadi 等人,2026)。我们研究发布前海市蜃楼检测:决定是否应该发布或保留 VLM 答案。我们的模型无关方法,文本条件逐层内部对齐(TC-LIA),跟踪冻结 CLIP ViT-H/14 编码器各层的问题图像对齐,通过最终相似性、后期层 top-k 对齐、早到晚增益和斜率总结补丁文本对齐。 TC-LIA在部署时是无需训练,具有固定的投影和评分权重,无需任何特定于标签的训练,并独立提供强大的检测。此外,当与空白/噪声检测、域路由和 VLM 自我评估相结合时,它形成一个集成,其监督训练可以提高性能,但它是一个可选的附加组件。在跨越 10 个 VQA 域的 19,004 个样本中,14 个最先进的 VLM 表现出 57.3-75.0% 的基本幻影率。我们提出的 TC-LIA 单独将其降低到 7.5%,相关/不相关/空白噪声分类精度为 83.5%,并且集合达到 84.5-88.4% 的精度,5.9-7.2% 的海市蜃楼率(最佳联合结果:88.4% 的精度,6.4% 的海市蜃楼率)。值得注意的是,在单个主干上训练的集成可以很好地传输到不可见的主干,最佳传输源在 13 个保留的 VLM 中的每个主干训练的准确度点保持在 0.7% 以内。