论文
RelCheck:用双重空间证据校正视觉语言模型幻觉
RelCheck: Dual-Evidence Spatial Grounding for VLM Hallucination Correction
摘要
多模态大语言模型(MLLM)经常生成与输入图像不一致的文本。虽然物体和属性层面的幻觉受到了相当多的关注,但现有的事后纠正方法在很大程度上仍未解决关系幻觉(对物体之间的空间或交互关系的错误描述)。我们提出了 RelCheck,一种无需训练的事后校正管道,它通过双重关系证据增强了对象级视觉基础:从 RelTR 中学习的场景图三元组和从边界框几何中学习的确定性空间谓词。它们与啄木鸟式的对象声明层相结合,形成一个三层视觉知识库,语言模型校正器用它来重写幻觉文本。在 LLaVA v1 13B 上进行评估,RelCheck 的 MME 幻觉总分为 630.0,而啄木鸟式基线为 585.0,位置子任务的增益最大(+31.7 分,准确度+从 0.367 提高到 0.600)。四配置消融证实两个关系层独立贡献(McNemar p = 0.025)。这些结果表明,结构化关系证据有意义地改善了当前 MLLM 最缺乏的空间推理子任务的事后幻觉纠正。