论文
CapProbe:通过全场景密集问答评估详细图像说明
CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering
摘要
评估视觉语言模型 (VLM) 中的详细图像说明需要超越表面语义相似性。基于参考的指标(例如 CIDEr 和 SPICE)和 LLM-as-scorer 协议很难验证密集的事实主张,而现有的基于 QA 的替代方案通常提供较低的探测密度、较窄的域覆盖范围,或者单个问题和分割图像区域之间没有明确的对齐。我们推出了 CapProbe,这是一个全场景密集 QA 基准测试,可将详细的标题评估转化为区域对齐的事实检查。每个图像被分解为覆盖前景和背景元素的粗略语义区域;对于每个保留区域,我们生成涵盖 10 个语义类别的多项选择题,形成一个包含所探索的视觉事实的密集清单。 CapProbe 以 37 个 L1 域和 219 个 L2 子域的两层分类法为指导,包含 346 个图像、1,868 个区域和 25,650 个问题,平均每个图像有 74 个 QA 对。语言评委仅根据标题给出答案;不确定选项和有效准确度提供了一个依赖于判断的代理,用于区分未答复的探测和错误解决的探测,而基于密度的指标则对冗长但无信息的标题进行惩罚。该协议具有成本效益:通过将无约束的标量评分转换为结构化的 MCQ 阅读,它减少了开放式评分偏差,同时保持判断条件,并在固定读者下产生相对稳定的模型排名。对 13 个 VLM 进行的实验表明,模型之间存在巨大的覆盖范围差距、明显的能力-效率权衡,以及稀疏或基于重叠的评估经常错过的故障模式。基准数据、注释和评估代码即将发布。