论文
多模态 大语言模型 的注意力引导 微调 改进了思维链推理
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
摘要
多模式 大语言模型 (MLLM) 中思想链 (CoT) 提示的有效性仍不确定:在多个视觉推理基准中,与直接提示相比,CoT 提示通常会降低性能。在本文中,我们对需要逐步视觉证据的数据集上跨模型规模的三个现代 MLLM 系列的 CoT 行为进行了系统分析。我们的分析确定了两种反复出现的故障模式:过早的答案承诺和在基本原理生成过程中有限的直接视觉词元访问。我们进一步发现,标准 CoT 式监督 微调 (CoT-SFT) 只能部分缓解这些问题,同时通常会增加对文本先验的依赖并减少反事实的视觉依赖。受这些发现的启发,我们提出了 Attentive-CoT (Att-CoT),这是一种注意力引导的 微调 目标,鼓励 CoT 轨迹延迟答案承诺,同时保持持续的视觉词元访问。 Att-CoT 可以插入任何 CoT-SFT 训练运行中,无需更改架构。对六个 MLLM 的三个视觉推理基准进行的实验表明,Att-CoT 比标准 微调 增强了 CoT 性能。