论文
问题中继中的魔鬼:源条件中继引导以减轻视听大语言模型中的幻觉
Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
摘要
视听大语言模型(AVLLM)通过视觉、听觉和语言信息之间的交互,在多模态理解和推理方面取得了显着进展。然而,最近的研究表明,AVLLM 面临着一个严峻的挑战:$源混淆grounding幻觉$,其中来自未使用模态的线索会诱发所需模态不支持的响应,从而破坏现实应用中的可靠性。现有的方法在减轻这种失败方面取得了进展,但它是如何从内部跨模式交互中产生的仍然没有得到充分的了解。为了解决这一差距,我们进行了路径干预和表征分析,揭示了 $question-relay$ 机制:问题状态在所需来源证据旁边携带干扰线索,破坏了所需模态证据的基础。切断从干扰模态到问题状态的路径比切断生成位置的路径产生更大的正确答案logit的恢复。受这些发现的启发,我们提出了 $SECRET$ ($S$ourc$E$-$C$onditioned $RE$lay s$T$eering),这是一种无需训练的方法,可以减轻问题中继中的跨模态干扰。使用通过不同模态路径干预引发的对比问题表征,《秘密》将原始问题状态引向所需来源的证据。在三个 AVLLM 中两个广泛采用的基准 CMM 和 AVHBench 上进行的实验表明,SECRET 始终优于先前的免训练方法,大大减轻了源混淆的grounding幻觉(例如,比基本模型高达 +18.0 和 +7.1 个百分点)。特定模态的字幕进一步证明了其对开放式生成的普遍性。