论文
ROT:将隐藏状态旋转到上下文向量以减轻 LVLM中的幻觉
ROT: Rotating Hidden States towards Contextual Vectors for Hallucination Mitigation in LVLMs
摘要
大视觉语言模型 (LVLM) 经常遭受物体幻觉的困扰。现有的无需训练干预主要操纵注意力权重,这间接影响到达最终预测层的深层语义。在这项工作中,我们将焦点转移到自注意力和残差相加之后提取的隐藏状态向量。实证分析表明,产生幻觉的token并不是简单地过度依赖语言先验;而是依赖于语言先验。相反,它们表现出异常的上下文偏差,与中间层中的文本和视觉上下文的相似性显着降低。受此启发,我们提出了 ROT,一个特定于层的无需训练框架。 ROT 动态检测中间层的语义偏差,并应用范数保持旋转来引导隐藏状态返回上下文所跨越的局部多模态上下文平面。对于后续层,引入了代表性平滑机制来稳定校准轨迹。对多个基准的大量实验表明,ROT 能够持续减少各种模型架构和规模的幻觉,为视觉定位生成提供高效、几何驱动的解决方案。
