论文

是什么让 LVLM 产生较少的幻觉?揭示幻觉鲁棒性背后的架构因素

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

模型评测模型行为与机制分析

摘要

幻觉仍然是破坏大视觉语言模型(LVLM)可靠性的关键挑战之一。但是什么让 LVLM 减少幻觉呢?许多现有的努力都集中在改进模型的内部组件上。我们认为,幻觉从根本上源于模型架构的设计方式。为了研究这一点,我们将架构设计分为三个维度:语言基础(LF)、视觉表示(VR)和语义对齐(SA),并将幻觉分类为共现、相似性和先前被忽视的不确定性类型。在此基础上,我们提出了 CoSimUE,这是一个基准,通过受控文本扰动和随机扰动创建细粒度的幻觉场景,从而实现设计选择和幻觉行为之间的映射。 7个设计方面的实验表明:1)广泛强调的模型参数缩放对减少所有三种幻觉的影响有限; 2)更大、训练有素的语言基础可以减少共现幻觉; 3)更强的视觉编码器和更高的分辨率可以减少相似性错误; 4)有效的调整策略减轻不确定性幻觉。 5)此外,跨维度分析表明,联合增强视觉保真度和对齐质量可以产生最全面的改进。这项研究首次将架构级设计与幻觉鲁棒性联系起来进行系统探索,为开发可靠、高效的 LVLM 提供实用指导。