论文
在细粒度图像任务上对大型视觉语言模型进行基准测试:从评估到诊断
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis
摘要
大视觉语言模型(LVLM)的最新进展展示了卓越的多模态感知和推理能力。虽然许多基准测试从整体或特定任务的角度评估了 LVLM,但它们在细粒度图像任务(计算机视觉的基础)上的能力仍然没有得到充分的了解。为了弥补这一差距,我们引入了 FG-BMK,这是一个全面的细粒度评估基准,包含 101 万个问题和 28 万张图像,涵盖从常见的以对象为中心的领域到专业领域的各种场景。 FG-BMK通过面向人类和面向机器的范式联合评估对话级细粒度语义识别和特征级视觉辨别力,从而能够诊断分析LVLM失败是否源于视觉表示不足、视觉与语义的对应薄弱或细粒度知识有限。通过对一组不同的代表性 LVLM/VLM 进行广泛的实验,我们发现当前的 LVLM 仍然不足以提供细粒度的识别器,其失败是由于视觉表示、语义基础、模态对齐和类别级知识等方面相互交织的瓶颈造成的。我们进一步分析训练设计因素以提高细粒度能力,并研究视觉和语言扰动如何影响 LVLM 预测。这些发现为当前 LVLM 的局限性提供了诊断见解,并为未来的数据构建和模型设计提供了指导,为细粒度视觉任务开发更可靠的 LVLM。我们的代码是开源的,可在 https://fg-bmk.github.io/ 上获取。