论文

自字幕多模态交互调整:放大鲁棒视觉语言模型的可利用冗余

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

模型训练合成数据

摘要

当前的视觉语言模型面临着针对模糊或损坏模式的幻觉和鲁棒性问题。我们假设这些问题可以通过利用模式之间的共享信息来补偿受损的模式来解决。为此,我们分析多模态交互——模态提供的冗余(共享)、独特(排他)和协同(紧急)任务相关信息——以确定它们对模型可靠性的影响。具体来说,放大冗余交互将增加可利用的共享信息来解决这些问题;然而,现代教学数据集通常会消除冗余,以优先考虑视觉基础。我们通过一个自动字幕工作流程来弥补这一差距,该工作流程具有 \textsc{多模式交互门}:一种将独特交互转换为冗余交互的机制。我们的研究结果表明,增加冗余可以将视觉引起的错误减少 38.3%,并将一致性提高 16.8%。