论文

诊断大型视觉语言模型中的密集同类属性错误绑定

Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models

模型评测基准与评测资源

摘要

大型视觉语言模型可以识别拥挤场景中的对象和属性,但将属性分配给错误的同类实例。通用视觉问答准确性将响应标记为错误,而物体幻觉度量可能将物体和属性视为图像支持的;两者均未透露转让事宜。这项研究将这个盲点形式化为密集同类属性错误绑定 (DSCAM),并提出了 InstaBind-Lite,这是一个可直接测量的受控基准。它的 524 个图像包含 529 个由 3-6 个同类实体组成的精选组、1773 个盒装实例、有序邻居、可区分的类似颜色的属性和四个互补的问题级别,产生 9580 个确定性评估的问题。与现有协议不同,源实例注释将不支持的生成和识别失败与从另一个可见实体复制的属性分开。特定于绑定的指标进一步量化传输频率、邻接性、序数距离和干预效果。在五个开源模型和两个商业/API 模型中,开源系统平均错误绑定率为 19.84%,API 系统为 7.55%;这些错误被聚合准确度所隐藏。在可识别的传输中,分别有 80.70% 和 81.51% 来自相邻实例。本地化和实例优先干预措施有助于选定的模型,但不是普遍的补救措施。因此,InstaBind-Lite 将以前未区分的错误答案转变为可识别源的故障类别,并测试传统基准无法确定的可靠性维度:模型是否不仅知道可见内容,还知道哪个实例拥有每个属性。