论文
通过屏障调节自适应封闭式转向减轻视觉语言模型中的幻觉
Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering
摘要
大型视觉语言模型 (LVLM) 通常会产生输入图像中不存在的物体的幻觉,这主要是因为随着解码的进行,视觉基础会减弱。现有的推理时间缓解方法会在整个生成过程中修改 logits 或隐藏状态,但它们受到三个关键限制:它们缺乏明确的视觉证据关联目标,即使模型已经视觉证据关联良好也会进行干预,并且使用不适应视觉证据关联故障严重程度的固定校正强度。我们提出了 BRACS(障碍调节自适应封闭式转向),这是一种 无需训练 转向框架,它通过障碍调节自适应封闭式转向来解决这些问题。 BRACS 监控模型自身的注意力来测量视觉基础,并仅在基础恶化时才对隐藏状态进行修正。校正更新以封闭形式进行分析计算,无需辅助网络训练或模型再训练。 LLaVA-1.5-7B 和 Qwen-VL-Chat 上的实验表明,BRACS 在幻觉基准上始终优于先前的方法,将 CHAIR$_s$ 降低了 9.4 个点,将 POPE F1 提高了 2.7 个点,同时在四个通用多模态基准上匹配或提高了性能。 BRACS 还保持高效,以 80% 的贪婪解码吞吐量运行,平均速度比基线高 1.3 倍。