论文
当视觉信号误导模型:视觉语言模型属性幻觉的机制研究
When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models
摘要
属性幻觉——视觉语言模型(VLM)正确识别一个物体,但却错误地描述了它的属性——很普遍,但从机制上却知之甚少。占主导地位的解释,即语言先验优势,激发了先验抑制方法,但这种解释尚未在属性级别进行直接测试。我们提出了 VISOR(视觉操作修复),这是一个将基于空图像的诊断与路由修复结合起来的统一框架。其 VSNR 诊断将每个预测分解为视觉 logits 信号和语言先验信号。在来自三个 VLM 系列和三种属性类型的 10,791 个负 真值 样本中,视觉信号强烈预测误报,而语言先验信号几乎是偶然的。 VISOR 使用此诊断来区分两种故障模式:颜色/状态属性中的低裕度但方向正确的视觉信号,以及材料属性中的低 SNR 或未对准的视觉信号。相同的诊断将每个查询路由到适当的操作员:校准阈值放置错误,放弃 无需训练 低 SNR 处理,或针对先前抑制无法纠正的材料故障进行有针对性的视觉适应。在 Qwen、InternVL 和 LLaVA 中,VISOR 减少了属性误报,而不依赖于先验优势假设。