论文
DiffCap-Bench:图像差异字幕的全面、具有挑战性、稳健的基准
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
摘要
图像差异描述 (IDC) 生成自然语言描述,精确识别两个图像之间的差异,作为细粒度变化感知、跨模态推理和图像编辑数据构建的关键基准。然而,现有基准缺乏多样性和组成复杂性,并且标准词汇重叠指标(例如 BLEU、METEOR)无法捕获语义一致性或惩罚幻觉,这些共同阻碍了 IDC 上对多模态 大语言模型 (MLLM) 的全面、稳健的评估。为了解决这些差距,我们引入了 DiffCap-Bench,这是一个全面的 IDC 基准,涵盖十个不同的差异类别,以确保多样性和组成复杂性。此外,我们提出了一种基于人类验证的差异列表的 LLM-as-a-Judge 评估协议,能够对模型捕捉和描述视觉变化的能力进行稳健评估。通过对最先进的 MLLM 进行广泛评估,我们揭示了专有模型和开源模型之间的显着性能差距,强调了推理能力的至关重要性,并确定了模型扩展的明显局限性。我们的框架还表现出与人类专家判断的强烈一致性以及与下游图像编辑数据构建质量的强相关性。这些发现将 DiffCap-Bench 确立为可靠的 IDC 评估框架和下游效用的实用预测工具。基准和代码将公开以支持进一步的研究。