论文

在 LLaVA 中瞄准物体幻觉背后的注意力头

Targeting the Attention Heads Behind Object Hallucination in LLaVA

模型评测模型行为与机制分析

摘要

LLaVA-1.5-7B 等视觉语言模型在生成字幕时通常会产生图像中不存在的物体的幻觉。我们询问此故障的可解释性诊断是否可以指导有针对性的修复,并衡量该修复实际发生的变化。我们根据幻觉对象词周围的图像注意力下降多少来对注意力头进行排名,然后通过消除候选头并测量幻觉标记对数概率的变化来筛选入围名单,从而产生 32 个头的集合。我们限制对这些头的两种干预:头切片 LoRA 适配器和推理时间视觉证据对齐控制器。在 400 张保留的 COCO 图像上,组合方法将 CHAIRs(带有幻觉物体的标题的分数)从 0.370 降低到 0.230,将 CHAIRi(幻觉物体提及的分数)从 0.156 降低到 0.096(p < 0.001,配对符号翻转测试)。两个控件可增强归因。随机头 LoRA 控制,逐层匹配并进行相同的训练,其性能并不比单独的 200 个图像控制分割上的匹配基线更好,支持头选择的作用而不是 LoRA 容量。在固定解码预算下,CHAIR 的减少持续存在并随着预算的增加而增长(64 个词元时为 23%,128 个词元时为 58%),反对纯粹的最大词元或截断工件,尽管该方法仍然更短且更保守。由此产生的行为减少了不支持的对象提及,同时也降低了对象召回率(0.78 至 0.70)。我们提出了一个针对物体幻觉的诊断到干预流程,更重要的是,对诊断信号实际作用的控制说明:它以真实的、非随机的杠杆作用定位干预部位,报告为行为概况而不是单一分数。