论文
ITIScore:用于 MLLM 图像描述能力的图像到文本到图像评级框架
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
摘要
多模态 大语言模型 (MLLM) 的最新进展极大地提高了图像理解和字幕功能。然而,现有的图像描述基准通常受到字幕长度多样性有限、缺乏最新先进的 MLLM 以及人工注释不足的影响,这可能会引入偏差并限制全面评估现代 MLLM 性能的能力。为了解决这些限制,我们提出了一个新的大规模图像描述基准测试,称为 ICBench,它涵盖 12 个内容类别,由 10 个高级 MLLM 在 2K 图像上生成的短字幕和长字幕组成,总共产生 40K 字幕。我们进行了广泛的人类主观研究,以获得跨细粒度评估维度的平均意见得分(MOS),其中短标题根据流畅性、相关性和简洁性进行评估,而长标题则根据流畅性、相关性和完整性进行评估。此外,我们提出了一种基于图像到文本到图像框架的自动评估指标 \textbf{ITIScore},它通过重建一致性来衡量字幕质量。实验结果表明我们的自动指标和人类判断之间具有很强的一致性,以及在其他公共字幕数据集上强大的零样本泛化能力。数据集和模型都将在发布后发布。