论文

ROT:将隐藏状态旋转到上下文向量以减轻 LVLM中的幻觉

ROT: Rotating Hidden States towards Contextual Vectors for Hallucination Mitigation in LVLMs

模型推理推理验证与自校正

摘要

大视觉语言模型 (LVLM) 经常遭受物体幻觉的困扰。现有的无需训练干预主要操纵注意力权重,这间接影响到达最终预测层的深层语义。在这项工作中,我们将焦点转移到自注意力和残差相加之后提取的隐藏状态向量。实证分析表明,产生幻觉的token并不是简单地过度依赖语言先验;而是依赖于语言先验。相反,它们表现出异常的上下文偏差,与中间层中的文本和视觉上下文的相似性显着降低。受此启发,我们提出了 ROT,一个特定于层的无需训练框架。 ROT 动态检测中间层的语义偏差,并应用范数保持旋转来引导隐藏状态返回上下文所跨越的局部多模态上下文平面。对于后续层,引入了代表性平滑机制来稳定校准轨迹。对多个基准的大量实验表明,ROT 能够持续减少各种模型架构和规模的幻觉,为视觉定位生成提供高效、几何驱动的解决方案。

ROT:将隐藏状态旋转到上下文向量以减轻 LVLM中的幻觉的原论文方法或结果图
图 1:所提出的 ROT 方法的总体框架。该过程由两个阶段组成:(1)关键中间层的动态幻觉检测,根据隐藏状态和多模态上下文之间的相似性来识别上下文偏差; (2)特定于层的隐藏状态缓解,它在中间层中应用保持范数的旋转,以将偏离的表示引导回视觉定位事实平面,然后在后续层中采用表示平滑机制,以保持传播过程中的稳定性。