论文
用于减轻多模态大语言模型中的物体幻觉的语义空间一致性验证
Semantic-Spatial Agreement Verification for Mitigating Object Hallucination in Multimodal Large Language Models
摘要
多模态大语言模型根据视觉输入生成自然语言响应,但可能会提及图像中缺少的对象。在药物援助、可理解的感知和环境决策中,这种幻觉可能会造成现实世界的安全风险。我们提出了语义空间一致性验证(SSAV),这是一种用于验证对象声明的免训练方法。基于视觉的声明应该在语义等效的查询中保持稳定,并重复定位到相同的图像区域。 SSAV 聚合多个提示来估计语义支持并降低对查询措辞的敏感性。查询引发的区域验证 (QIRV) 结合了跨查询区域持久性、空间重叠和相对候选优势,以识别孤立的高响应和分散的定位。几何平均值融合了语义和空间证据,当任一分支缺乏支持时会降低验证分数。对三个基础模型和多个评估协议的实验表明,SSAV 可以有效减轻物体幻觉。在 LLaVA-1.5-7B 上,COCO、A-OKVQA 和 GQA 的平均准确率在 POPE Pope 和 Adversarial 下分别提高了 1.81 和 3.17 个百分点,而 CHAIRs 从 49.40% 下降到 32.80%。这些结果表明,跨查询语义稳定性和区域一致性为对象声明提供了可解释的外部视觉证据。