论文
SAFE:用对比解码探针识别视觉依据不足的幻觉
What Do Hallucinations Reveal About Multimodal Reasoning? Diagnosing Visual Grounding Failures via Contrastive Decoding Probes
摘要
当强大的多模态模型已广泛可用,研究进展需要超越基准分数,把模型当作理解行为的实验工具。本文考察能否用大型视觉语言模型研究其自身失败机制,并聚焦视觉幻觉,提出无需训练的SAFE解码框架。SAFE对比保留视觉证据与移除视觉输入的生成路径,计算词元级视觉证据对齐分数,识别模型何时更依赖语言先验而非图像。该信号既用于检测缺少视觉支持的词元,也用于在解码时施加惩罚。分析得到三项观察:视觉依赖随生成过程减弱;幻觉会在时间上成簇出现;尽早干预能够减少这种聚集,同时不会明显损害流畅性。SAFE在MMHalBench上显著超过所比较的基线,在其他评测上的结果则更不一致。研究以此说明,构建对比探针可将模型用作科学理解的实验工具。代码:https://github.com/zhaozhipeng1997/SAFE_public。