论文
潜在去噪改善了大型多模态模型中的视觉对齐
Latent Denoising Improves Visual Alignment in Large Multimodal Models
摘要
LLaVA 等大型多模态模型 (LMM) 通常使用自回归语言建模目标进行训练,仅对视觉标记提供间接监督。这通常会在分布变化下产生较弱的内部视觉表征和脆弱的行为。受学习高质量视觉分词器的潜在去噪最新进展的启发,我们表明相同的原理提供了一种有效的视觉监督形式,可以改善 LMM 中的内部视觉特征对齐和多模态理解。我们提出了一种潜在的去噪框架,该框架使用显着性感知的掩蔽和高斯噪声的混合来破坏投影的视觉标记。 LMM 经过训练,通过使用解码器从选定的中间 LLM 层的隐藏状态恢复干净的教师补丁特征来对这些损坏的标记进行去噪。为了防止表示崩溃,我们的框架还保留了教师的图像内相似性结构并应用图像内对比补丁 蒸馏。在推理过程中,损坏和辅助头被禁用,不会引入额外的推理时间开销。在一系列广泛的标准多模式基准中,我们的方法持续改进了强基线上的视觉理解和推理,并在组合鲁棒性基准(例如 NaturalBench)上产生了明显的收益。此外,在应用于基准图像的 ImageNet-C 式非对抗性常见损坏下,我们的方法保持了更高的准确性,并在中度和严重损坏级别上表现出降低的退化。我们的代码可在 https://github.com/dhruvashp/latent-denoising-for-lmms 获取。