论文

PANORAMA:通过候选掩码选择生成带像素定位的全景描述

PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

模型架构新型架构

摘要

在世界上运行的智能系统需要全面且基于空间的图像理解。当前的视觉语言模型(VLM)可以生成流畅且详细的图像说明,但将它们与图像像素可靠地关联起来仍然具有挑战性。将密集字幕与像素级基础相结合的现有方法通常会产生不完整的描述或不准确的分割掩模。我们通过全景带区域定位的图像描述来研究这个问题,这项任务需要 VLM 来描述前景对象和背景区域,同时使用像素级掩模来像素级定位每个引用短语。我们做出三项贡献。首先,我们介绍 PanoCaps,这是一个根据全景分割数据集构建的人工注释基准。它提供了密集的字幕,在实体级别上具有近乎完整的像素覆盖和图像文本对齐,支持训练和评估。我们进一步提出了短语掩码匹配协议和通用全景质量(gPQ)指标,共同评估文本和掩码一致性。其次,我们将短语基础制定为从短语条件掩码提议池中进行选择,并引入 PANORAMA,这是一种 VLM,它根据上下文短语表示条件对预训练的分段器进行调节,以获得候选掩码,并学习选择与每个短语相对应的掩码。与字幕生成结合训练该接口使 PANORAMA 能够生成高质量的掩模,同时允许每个短语引用单个区域或多个实例。第三,PANORAMA 在 PanoCaps 上实现了最佳的整体像素级定位,并在多个像素级像素级定位任务中匹配或超过了专门模型。实验表明,我们的方法可以产生精确的实体级分割,同时保持详细的、掩模一致的标题。代码、数据和模型可在 https://www.di.ens.fr/willow/research/panorama/ 获取。