论文
在重要的地方进行转向:词元级 用于 LVLM 幻觉缓解的视觉灵敏度转向
Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation
摘要
大视觉语言模型(LVLM)已经取得了快速进步,并被部署在各种应用程序中,但幻觉仍然是一个重大挑战。激活转向因其最小的训练开销和推理时间的可控性而颇具吸引力。然而,我们发现在自回归解码期间,视觉条件在解码步骤中稀疏且局部地影响标记预测,并且许多现有的在整个序列上平均图像与无图像差异的方法稀释了这些关键信号,产生低信噪比转向方向。此外,许多现有方法应用固定的引导强度,这会错误分配干预预算,过度干扰非关键词元,并可能导致不稳定。为了解决这些限制,我们提出了 词元级 视觉灵敏度引导(TLVS)来缓解幻觉。我们的方法首先提取 词元级 转向向量并对其进行细化,然后仅在重要的地方应用细粒度、视觉灵敏度自适应转向。这种轻量级、即插即用的机制只需要最少的校准训练,并且可以应用于不同的视觉语言模型。它调节每个解码步骤的转向强度,选择性地抑制容易产生幻觉的跨度,同时保留有证据的内容。我们在多个基准上评估 TLVS,包括 POPE、AMBER、CHAIR (COCO)、MMHal 和 HallusionBench,证明了与之前的转向方法相比的一致改进。