论文
超越参考图像描述的基于重建的图像描述评估框架
A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
摘要
图像图像描述是视觉语言研究的一项主要任务,但在不依赖参考图像描述的情况下评估图像描述如何忠实地保留图像语义仍然悬而未决。流行的评估依赖于人工注释的参考文献,其内容反映了注释者的意图和图像描述熟练程度。在本文中,我们研究了基于重建的图像描述评估原理:图像描述的好坏取决于其能够重建原始图像的能力。然而,由于图像描述本质上压缩了视觉信息,因此不可能恢复所有细节,并且重建图像和源图像之间的逐像素比较既不可行也没有意义。通过对图像描述本质的深入分析,图像描述的根本目的是传递图像的语义内容,我们提出了一个修改后的原则:图像描述的能力取决于其能够实现在语义上与原始图像等效的重建的能力。为了评估语义等价性,我们测试重建是否与一系列下游视觉语言任务中的原始图像匹配,从而产生无参考、任务条件化的图像描述得分。我们描述了组件相关的限制,并引入了低成本的图像描述图灵测试数据集(CTTD)替代品。