论文
RVSD:检索视觉稀疏解码,用于减轻大型视觉语言模型中的视觉幻觉
RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models
摘要
大型视觉语言模型在视觉语言任务中取得了显着的成功。然而,它们仍然容易出现视觉幻觉(VH),从而损害了它们在现实应用中的可靠性。现有的解决方案通常需要精心策划的数据集、额外的训练或多轮解码,从而导致相当大的计算开销。在本文中,我们提出了 \textbf{RVSD} (\underline{R}etrieval \underline{V}ision \underline{S}parse \underline{D}ecoding),这是一个 无需训练 和即插即用解码框架,首次在单个解码过程中统一了标记稀疏化和 \textbf{语义空间视觉检索} (SSVR)。在 RVSD 中,我们引入了 \textbf{语义引导的标记选择} 策略,该策略有选择地稀疏冗余标记,同时保留关键的视觉信息。我们进一步提出了 SSVR 机制,它将视觉补偿重新表述为共享语义空间内的按需跨模态检索过程。大量实验表明,RVSD 在减轻 VH 方面实现了最先进的性能,同时在长上下文生成设置下保持了强大的抑制能力。我们的代码可以在这里找到。\footnote{https://github.com/canjie-liu/RVSD}