论文

Revis:通过稀疏潜在引导缓解大型视觉语言模型的物体幻觉

Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models

模型推理解码与生成控制

摘要

尽管大型视觉语言模型(LVLM)能力先进,它们仍频繁出现物体幻觉。一个原因是视觉特征与预训练文本表示常在较深的网络层中纠缠在一起。为此,我们提出REVIS,一个免训练框架,旨在显式地重新激活这种被抑制的视觉信息。REVIS根植于潜在空间几何,通过正交投影提取纯视觉信息向量,并采用经校准的策略仅在发生抑制的精确深度执行稀疏干预。这种精准介入的方式以极小的计算成本有效恢复视觉信息。在标准基准上的实证评估表明,REVIS较最先进基线将物体幻觉率降低约19%,同时保持通用推理能力。

Revis:通过稀疏潜在引导缓解大型视觉语言模型的物体幻觉
图1:Revis 概览。在应用正交投影将纯视觉向量从语言先验中分离出来之后,Revis 引导 LVLM 生成忠实且有依据的描述,有效纠正初始的幻觉(例如“chocolate”、“strawberries”)。