论文
CAD:以冲突感知解码减少全模态大模型跨模态幻觉
CAD: Conflict-Aware Decoding to Mitigate Cross-Modal Hallucinations in Omnimodal Large Language Models
摘要
全模态 大语言模型 (Omni-LLM) 集成了音频、视频和文本,但仍然容易受到跨模态幻觉的影响,其中一种模态不正确地影响对另一种模态的预测。现有的 无需训练 解码器通过扰动或相关性加权来调节模态影响,但不评估联合视听分支内的预测兼容性。由于联合分支差异可能表明有害干扰或有用互补,因此可靠的干预需要评估差异程度和可操作性。为此,我们提出了冲突感知解码(CAD),这是一个 无需训练 框架,包括潜在冲突程度估计(PCME)和冲突可操作性评估(CAA)。 PCME 使用音频-视频分歧以及联合预测与相关性加权单模态参考的偏差来量化潜在冲突。然后,CAA 将 Dempster-Shafer 可靠性折扣应用于任务空间答案关系,使用查询相关性和答案决定性来确定是否需要干预。当识别出可操作的冲突时,CAD 有选择地将解码权重从联合分支重新分配到单模态分支。 CMM、AVHBench、WorldSense 和 VideoMME 上的实验表明,CAD 在多个视听主干上始终优于基本解码器和竞争性 无需训练 方法。在 Qwen2.5-Omni-7B 上,CAD 在 CMM 和 AVHBench 上的整体精度分别提高了 14.1 和 8.0 个百分点,而无需模型重新训练。