论文

用于减轻大视觉语言模型中的幻觉的动态对准补偿

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

模型推理推理验证与自校正

摘要

大视觉语言模型(LVLM)仍然容易产生幻觉,产生与多模态输入无关或不一致的响应。现有的缓解方法主要依赖于外部监督、输出校准或注意力调节,而自回归生成的内部表示动态尚未得到充分探索。我们确定了一种推理时间故障模式,其中跨模式表示在解码器层之间退化并在生成步骤之间漂移,从而破坏了词元预测的稳定性并增加了幻觉风险。我们提出了 \emph{动态对齐补偿}(DAC),这是一种 无需训练 推理时间方法,可检测表示分歧并有选择地应用轻量级残差补偿。 DAC 将逐层语义补偿与顺序语义校正相结合,以减轻层间退化,以限制时间漂移。对跨多个 LVLM 主干的 9 个以幻觉为中心的通用多模态基准进行的实验表明,DAC 持续减少幻觉,同时保持强大的整体性能。