论文

CAER:多模式双前缀专家的冲突感知证据路由 大语言模型

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

摘要

多模态 大语言模型 (MLLM) 在多模态理解和生成方面表现出了卓越的能力。然而,当文本输入与视觉证据发生冲突时,他们仍然会产生幻觉并产生与视觉内容不一致的反应。现有的方法主要依赖于解码策略、额外的训练、验证方法或提示技术,但往往缺乏细粒度的冲突定位和冲突感知生成。在这项工作中,我们提出了 CAER,一种用于视觉语言冲突检测和冲突感知生成的主干不可知框架。 CAER 引入了基于跨度的证据路由器,可将权利要求表示转换为软文本查询,并从冻结的视觉标记中检索相应的证据,从而实现细粒度的冲突估计。此外,我们设计了一种双前缀专家路由机制,该机制可以针对视觉支持和矛盾的输入学习单独的专家,从而通过明确的专家选择来实现冲突感知生成。在公共 MMMC 基准和我们新策划的 AgriConflict 数据集上进行的实验表明,CAER 可以有效检测视觉语言冲突,并提高开源 MLLM 的可靠性,而无需更新其骨干参数。