论文
先分离后融合:用模态特定思维链缓解视听LLM推理中的跨模态干扰
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
摘要
音频与视觉为视听问答提供互补证据,但当前的视听大语言模型可能遭受跨模态干扰:来自一种模态的信息误导对另一模态的解读,从而诱发幻觉。我们将这一问题归因于中间推理过程中不受控的跨模态交互。为缓解这一问题,我们提出先分离后融合(SFFL),一个旨在减少跨模态干扰的视听推理框架。SFFL强制执行模态特定的思维链推理,生成独立的音频与视觉推理轨迹,并整合证据用于回答。我们通过一条数据流水线在不同模态输入设置下构建模态偏好标签。我们将这些标签作为强化学习中的辅助奖励,以鼓励回答时对模态线索形成依实例而定的偏好。我们进一步引入一种模态特定推理机制,在分离推理阶段保持模态隔离,同时在证据融合阶段允许完全访问跨模态信息。实验表明,准确率与鲁棒性均获得一致提升,在通用AVQA基准上取得平均5.16%的相对增益,在跨模态幻觉基准上取得11.17%的相对增益。
