论文

RED:相关证据解码缓解视听幻觉

Relevant Evidence Decoding for Audio-Visual Hallucination Mitigation

模型推理解码与生成控制

摘要

视听大语言模型(AV-LLM)仍易受跨模态幻觉影响——一个模态错误地影响对另一模态的预测。对比式解码虽减少视觉语言模型的幻觉,其向AV-LLM的直接扩展忽视一个关键挑战:不同问题需要不同的感知证据——音频、视频或其交互。值得注意的是,我们观察到联合视听推理会削弱预测,即使模型能从单一有信息量的模态恢复正确答案:例如问听到什么乐器时模型仅凭音频正确预测小提琴,而加入显示吉他的视频后其小提琴置信度可能下降。本文提出相关证据解码(RED),训练自由地识别与问题相关的证据并选择性增强其贡献:RED用逐点互信息量化音频与视频在问题之外提供的预测支持,把联合贡献分解为音频、视频与残余交互分量;一次仅问题推理确定所需证据类型,随后模型用相应PMI贡献增强原始视听预测。跨三个视听幻觉基准与三个AV-LLM,RED较标准解码在CMM最高提升7%、AVHBench 6.3%、SVHalluc 3.8%,平均相对首token时间为标准解码的1.5倍。