论文
回顾:用于检测视觉语言模型中的空间关系幻觉的关系证据校准
RECAP: Relation Evidence Calibration for Detecting Spatial Relation Hallucinations in Vision-Language Models
摘要
即使图像支持不兼容的关系,视觉语言模型也可以自信地回答空间关系问题。我们制定基于关系的选择性预测:通过审核其视觉支持来接受或拒绝已经产生的是/否答案,而不是将不确定性视为证据。 RECAP 是我们的关系证据校准框架,它比较一项主张的图像条件可能性、其语义矛盾和可选的片面支持,然后将这些证人转换为答案条件拒绝风险。当信心明显具有信息性时,仅校准门保留信心作为否决权,否则单独部署关系证据。在 20 个组/图像不相交的分割中,对于 Qwen3-VL-8B、InternVL3.5-8B 和 LLaVA-1.5-7B,RECAP 将 VSR 上的 H-FPR@80 置信度降低了 2.0 到 17.9 个点,并将 What'sUp 上的 Acc@80 提高了 3.0、8.6 和 12.6 个点。它在所有六种设置中的所有四个主要指标上均优于匹配的 VCD 风格视觉对比度。全池 VSR 后备、目标排名的 GSR-Bench 转移、等预算监督控制和两个额外的检查点显示了一致的操作原则:结构化反证据在信心不一致时补充确定性,而门在信心已经有用时保留信心。