论文

零样本图像描述的综合监督的实体忠实修复

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

模型训练合成数据

摘要

零样本图像描述旨在生成没有带注释的图像文本对的图像描述。最近的方法利用文本到图像模型来合成纯文本语料库中的训练数据,但大多数方法侧重于提高整体数据质量。相比之下,我们观察到合成的图像文本错位通常是结构化和细粒度的:对可能在包含缺失实体或错误基础属性的同时保持全局合理性,从而降低监督保真度。因此,基于图像重新匹配或再生的全局相似性的方法可能会提高表面的合理性,但不能系统地修复实体级的错位。为了解决这个问题,我们提出了 ReCap,这是一个即插即用的框架,它将合成数据细化从隐式全局匹配转变为显式细粒度重新对齐。具体来说,ReCap 通过使用检测到的图像支持的实体来指导图像描述重写来强制实体级对应,从而产生更忠实的综合监督。此外,我们引入了自适应动态加权学习策略,以在训练期间降低不可靠合成对的权重。作为通用框架,ReCap 可以集成到现有的合成数据管道中。大量实验表明,ReCap 始终如一地提高了图像文本一致性,并在域内和跨域零样本图像图像描述基准测试中实现了最先进的性能。