论文

UHP 检测:LVLM 在一致性空间中有其独特的幻觉模式

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

模型评测评测方法与指标

摘要

大视觉语言模型(LVLM)表现出强大的多模态推理能力,但仍然容易产生幻觉,其中模型预测不以视觉证据为基础。现有的黑盒幻觉检测方法通过单个一致性度量来估计不确定性,隐含地假设模型不确定性可以通过单个测量来充分表征。然而,幻觉在不同的行为探针中表现出不同的不确定性表现,使得单一的测量不足以表征其潜在行为。我们提出\emph{独特的幻觉模式(UHP)检测},一个完全黑盒的框架,将幻觉建模为由两个轴定义的结构化不确定性模式:扰动模态(图像与\文本)和逻辑极性(陈述与\其否定)。它们的交集产生四个互补的一致性组,捕获模型不确定性的不同表现,从中提取组内和组间特征来训练轻量级分类器。通过在三个 LVLM 上对 AMBER 和 Phd 进行综合实验,UHP 检测始终优于之前的黑盒和白盒基线,与最强的黑盒方法相比,AUC-ROC 和 AUC-PR 分别提高了 $+1​​8.72\%$ AUC-PR 和 $+20.07\%$ AUC-PR。广泛的消融研究表明,每个一致性组都提供补充信息,并且它们的组合形成了结构化的幻觉模式。此外,跨数据集评估表明,这种学习模式可以跨基准推广,表明幻觉行为反映了特定于模型的一致性模式。 \textbf{代码公开于} https://github.com/amirezzati/uhpdet。