论文

CHASD:针对 LVLM 中幻觉的语言增量校准对比解码

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

模型推理解码与生成控制

摘要

大型视觉语言模型显示出强大的多模态推理能力,但当语言先验占主导地位的视觉证据不足或错位时,它们仍然容易受到物体幻觉的影响。 无需训练 对比解码方法通过比较原始视觉输入和扰动视觉输入的预测来缓解这个问题,但现有方法要么应用可能改变有用视觉证据的全局扰动,要么在每个解码步骤调用额外的负分支。在本文中,我们观察到幻觉风险是短暂的且特定于词元:视觉注意力在生成的词元之间转移,而一些功能性词元是以高置信度生成的并且不需要对比校准。基于这一观察,我们提出了用于大型视觉语言模型的对比幻觉感知逐步解码(CHASD),这是一种“按需校准”的推理时间框架。 CHASD 使用不确定性驱动的置信门仅在下一个标记的最大概率小于阈值时激活对比分支,并通过注意力引导的当前显着视觉标记的局部扰动构建负分支。这种设计减少了不必要的负分支前向传递,同时保留了高置信度步骤的原始分布。 POPE、AMBER、MME、MMHal-Bench 和 CHAIR 上的实验表明,CHASD 相对于强大的 无需训练 基线,改进了与幻觉相关的指标,并具有竞争性的推理效率。