论文
注意力头的角色断裂:理解和检测 VLM 中的幻觉
Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs
摘要
尽管视觉语言生成方面取得了显着进展,但视觉语言模型(VLM)仍然容易产生幻觉,产生与输入图像不一致或不受输入图像支持的内容。现有的工作主要围绕一种特定的幻觉模式(例如视觉文本不平衡)设计检测或缓解方法,但真正的 VLM 幻觉是由多种模式的混合产生的,因此绑定到单一模式的信号很难在模型和任务中保持稳定。在统一的头部视图下,我们发现幻觉引起的变化表现为每个头部忠实的情境行为的局部偏差,我们将这种现象称为角色断裂。详细的分析表明,这些偏差是通过注意力头、上下文源和偏差方向系统地组织的,并且一旦保留了头身份,所得到的信号就是线性可读的。基于这些发现,我们在 Role-Break 之上构建了一个轻量级线性检测器,不需要 VLM 的 微调,其特征维度保持在 5,000 以下,并且在 6 个 VLM 和 4 个基准测试中达到平均 AUROC 为 93.23。小规模干预实验进一步表明,检测到的词元可以在判别设置中直接起作用。