论文

先分离后融合:用模态特定思维链缓解视听LLM推理中的跨模态干扰

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

模型训练强化学习

摘要

音频与视觉为视听问答提供互补证据,但当前的视听大语言模型可能遭受跨模态干扰:来自一种模态的信息误导对另一模态的解读,从而诱发幻觉。我们将这一问题归因于中间推理过程中不受控的跨模态交互。为缓解这一问题,我们提出先分离后融合(SFFL),一个旨在减少跨模态干扰的视听推理框架。SFFL强制执行模态特定的思维链推理,生成独立的音频与视觉推理轨迹,并整合证据用于回答。我们通过一条数据流水线在不同模态输入设置下构建模态偏好标签。我们将这些标签作为强化学习中的辅助奖励,以鼓励回答时对模态线索形成依实例而定的偏好。我们进一步引入一种模态特定推理机制,在分离推理阶段保持模态隔离,同时在证据融合阶段允许完全访问跨模态信息。实验表明,准确率与鲁棒性均获得一致提升,在通用AVQA基准上取得平均5.16%的相对增益,在跨模态幻觉基准上取得11.17%的相对增益。

先分离后融合:用模态特定思维链缓解视听LLM推理中的跨模态干扰:论文配图
图 1:该图显示了跨模式干扰以及 SFFL 如何减轻它:虽然帧中出现了牧羊犬和绵羊,但音频仅包含吠叫。朴素的联合推理错误地将声音归因于两种动物,而 SFFL 将音频/视觉推理分开,仅在最后融合证据,仅正确识别牧羊犬。