论文

CAPEval:跨理解和生成的解耦图像描述评估

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

模型评测评测方法与指标

摘要

图像描述是多模态理解和文本到图像生成的主要监督信号。然而,以前的评估将图像描述质量视为单个标量目标,它合并了两个不同的属性:(1)图像描述覆盖了多少视觉信息;(2)图像支持其声明的可靠性如何。为此,我们设计了一个解耦的图像描述评估基准 CAPEval(覆盖率和精度评估),其中包含人工编写的 真值 图像描述和人工验证的原子检查表项目。具体来说,CAPEval 将图像描述质量分解为覆盖率和精度。前者量化了图像描述对 真值 事实内容的覆盖程度,而后者反映了图像描述中表达的所有主张的事实正确率。我们选择 10 个图像描述生成器,并进一步对来自四个模型系列的他们进行受控的下游端到端实验,其中图像描述源是唯一的变量。根据经验,我们发现了一致的任务依赖性分离:覆盖率是理解性能的更强相关性,而精度是生成性能的主要预测因子。这种解耦的评估范式不仅可以对图像描述质量进行更细粒度的诊断,还可以为选择和优化针对不同下游任务量身定制的图像描述生成器提供可操作的指导。