论文

当看见还不够:LVLM交互式视觉定位的基准评测

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

模型评测基准与评测资源

摘要

视觉定位(visual grounding)通常被评估为从信息性指称表达到视觉目标的一次性映射。这一表述忽略了真实世界指称的一个核心特性:目标信息往往不完整、模糊,并且是通过交互建立的。我们为大型视觉语言模型(LVLM)的交互式视觉定位引入一个受控评估框架,变化预先提供多少目标信息、以及必须通过对话获取多少。在四个基于人类的视觉情境和四种交互协议下,当前LVLM的表现显著低于任务级人类基线。当后续问题细化或修复初始目标描述时,交互可以有帮助。当没有提供初始描述、目标信息必须通过提问获取时,表现最低,表明主动的、问题驱动的定位仍然困难。LVLM的校准也很差,常常报告超过其实际准确率的置信度。后续研究在不同描述来源(人类对AI)、推理努力、重复交互、描述提供者和视觉情境下证实了这些模式。总体而言,交互式视觉定位仍然是一个重要挑战,需要视觉匹配、信息寻求和综合能力。

当看见还不够:LVLM交互式视觉定位的基准评测:论文配图
图1:传统视觉定位执行一次性匹配,假定输入描述信息充分。交互式视觉定位去除了这一假设,要求匹配者(M)与指挥者(D)交互以获取更多信息。示例改编自Hawkins等人(2020)以作说明。