论文

通过空间光谱视觉锚学习减轻 MLLM 中的视觉退化

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

摘要

尽管多模态 大语言模型 (MLLM) 取得了进展,但它们仍然在视觉感知方面表现出缺陷。在视觉指令调整之后,内部 MLLM 表示在推理过程中迅速偏离其原始语义状态,导致严重的信息退化。虽然现有方法试图利用外部视觉基础模型(VFM)来对齐内部表示,但我们发现与 VFM 的直接对齐可以增强视觉语义,但无法减轻表示偏差。为了解决这个问题,我们提出了空间光谱视觉锚学习(SSVAL)。 SSVAL的核心是视觉锚点提示注入(VAPI),它引入了在训练过程中从外部VFM吸收丰富知识的提示,使它们能够作为稳定的视觉锚点,减轻推理过程中的表示偏差。此外,我们结合了辅助空间和频域表示对齐损失,以在中间 LLM 层提供补充的视觉特定监督。大量实验表明 SSVAL 显着优于现有方法。代码可在我们的\href{https://msls38.github.io/SSVAL/}{项目页面}上找到。