论文
超越表面模仿:多模态上下文学习的推理路径对比对齐
Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning
摘要
上下文学习 (ICL) 广泛应用于多模态大语言模型 (MLLM),并在各种多模态任务中取得了出色的性能。然而,现有的多模态 ICL 方法通常依赖于上下文演示的表面水平模仿,这使得 MLLM 很难将其响应与给定多模态输入所需的推理路径保持一致。这种限制在复杂的多模态任务中变得更加明显,从而限制了 MLLM 性能的进一步提高。为了解决这个问题,我们提出了一种新的多模态 ICL 框架,该框架将对比演示模型与 MLLM 的自我改进能力相结合。具体来说,我们的框架通过明确对比相同输入下的次优响应与更好的响应,以及揭示如何改进响应的推理路径,重新制定了每个演示。这种对比表述使通往所需响应的推理路径更加明确,并指导 MLLM 超越肤浅的模仿。此外,由于有效的细化取决于当前的响应,因此我们引入了响应条件检索机制来选择其推理路径与当前响应更相关的演示。此外,我们使用轻量级对齐控制器来预测响应质量并确定是否需要进一步细化。对三种类型的多模态任务的实验表明,所提出的框架持续提高了 MLLM 性能,尤其是在视觉问答 (VQA) 方面的进步尤其显着。