论文

DO-Bench:视觉语言模型中诊断物体幻觉的归因基准

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

模型评测基准与评测资源

摘要

物体级幻觉仍然是视觉语言模型(VLM)的主要可靠性挑战,特别是在二进制物体存在验证中。现有的基准强调总体准确性,但很少区分错误是否源于感知限制或上下文文本先验的影响,从而导致潜在的失败机制含糊不清。我们引入 DO-Bench,这是一种受控诊断基准,可通过结构化多模式干预来隔离这些来源。 DO-Bench 不是在不受约束的环境中评估模型,而是探索两个互补的维度:先验覆盖维度逐步增强上下文文本先验,同时保持视觉证据恒定以评估对先前压力的抵抗力,而感知受限维度逐步增强从全场景上下文到局部对象裁剪的视觉证据,以测量感知基础强度。这种配对设计可以将错误归因于先前的抑制、知觉不足或它们的相互作用。我们进一步定义了两个诊断指标,PriorRobust 和 PerceptionAbility,以一致地量化这些行为。对不同开源和闭源 VLM 的评估揭示了先验敏感性和感知可靠性的系统差异,表明物体幻觉反映了超出总体准确性的异构的、机制依赖的故障模式。