论文

VDiff-Bench:细粒度图像差异识别的挑战性基准

VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在视觉问答等一般视觉理解任务上表现出色,但它们常常难以掌握基本的比较技能:识别两个相似图像之间发生了什么变化。我们介绍 VDiff-Bench,这是一个具有挑战性的多项选择基准,用于细粒度图像差异识别。 VDiff-Bench 包含 1,756 个关于图像对的四向问题,涵盖 10 个变化类别:位置、运动、区域图像颜色、整体图像颜色、出现/消失、噪声/分辨率、纹理、替换/大小、OCR/文本和照明。每个问题对应两个图像输入,有 4 个选择:真正的差异、两个硬否定描述和一个“无差异”干扰项。为了使任务具有挑战性,我们专门策划了 真值 条件否定,要求模型区分实际变化与附近的语义替代。对 11 个最先进的开源和闭源 MLLM 进行的实验表明,细粒度的视觉比较仍然很脆弱:模型在不同源和变化类别上表现出参差不齐的性能,并且在噪声和纹理等细微的低级变化上持续失败。例如,三个 7-8B 规模的开源 MLLM 在语义变化方面得分为 52.5-70.6%,但在噪声和纹理等低级变化方面得分仅为 8.7-33.3%,错误地假设两个图像输入之间没有变化。令人惊讶的是,尽管其他闭源商业模型表现强劲,但 Grok 4.3 在识别图像之间的噪声和纹理差异方面表现出显着的性能下降,明显落后于 Kimi K2.5 和 K3 等大型开源模型。总体而言,VDiff-Bench 提供了一种有针对性的诊断,用于评估 MLLM 中的比较视觉理解,揭示标准单图像视觉语言任务未捕获的故障。