论文

MinCU:图像对中基于最小变化理解的细粒度基准

MinCU: A Fine-Grained Benchmark for Grounded Minimal-Change Understanding in Image Pairs

应用与实践模型训练模型评测监督微调与指令调优基准与评测资源视觉感知与空间理解

摘要

定位和描述几乎相同的图像之间的细粒度差异是多模态大语言模型 (MLLM) 的一项关键但尚未充分开发的功能。现有的基准主要评估语义比较或孤立的单图像视觉定位,而不需要共同要求忠实的描述和物理定位。为了弥补这一差距,我们引入了 MinCU,这是一种基于最小变化理解的基准,其中每个样本都由一个图像对组成,这些图像对在对象类别、属性、计数或空间位置上存在单个原子变化,并且根据模型描述变化、定位变化区域和识别变化实体的能力来评估模型。我们进一步提出语义引导隐式空间锚点(SG-ISA),这是一种结构化自回归方法,可将预测分解为思考-定位-描述序列。 SG-ISA 首先预测变化概念的语义线索,然后使用离散空间锚点作为隐式定位支架,最后与定位框一起生成变化描述。实验表明,即使是最强大的闭源 MLLM 和最近的 R1 式推理模型在 MinCU 上也会遇到困难,大多数都无法共同生成准确的描述和定位框。与之前的思维链方法相比,SG-ISA 的微调在定位精度和描述质量方面产生了显着的联合改进,同时减少了大约 26% 的推理词元开销。这些结果表明,隐式中间空间接口比仅仅依赖模型尺度来进行双图像理解更有效。