论文

GAVEL:图像描述错误验证和定位

GAVEL: Grounded Caption Error Verification and Localization

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 通常会产生幻觉或不一致的输出,其中文本和图像未正确对齐。解决这个问题不仅需要检测错位,还需要解释差异并定位其视觉证据。我们引入了 GAVEL(图像描述错误验证和定位),这是一项联合解决图像文本对的验证、解释和定位问题的任务。为了支持系统评估,我们还提供了相应的数据集和基准。我们进一步在人工注释的训练分割上训练一个有监督的基线,以评估 GAVEL 是否为这些能力提供可学习的监督。实验表明,即使是强大的闭源模型在 GAVEL 上也会遇到困难,而监督基线在视觉证据定位和解释指标方面产生了一致的改进。