论文
ProCap:空间增强现实的投影感知字幕
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
摘要
空间增强现实(SAR)使用投影仪将数字内容直接投影到物理场景上,无需头戴式显示器即可创造身临其境的体验。然而,为了让 SAR 支持智能交互,例如推理场景或回答用户查询,它必须在语义上区分物理场景和投影内容。标准视觉语言模型 (VLM) 与这种虚拟物理模糊性作斗争,经常混淆这两种上下文。为了解决这个问题,我们引入了 ProCap,这是一种新颖的框架,可以明确地将投影内容与物理场景分离。 ProCap 采用两阶段管道:首先,它通过自动分段在视觉上隔离虚拟层和物理层;然后它使用区域感知检索来避免由于投影失真而导致语义上下文模糊。为了支持这一点,我们提出了 RGBP(RGB + 投影),这是第一个大规模 SAR 语义基准数据集,具有 65 个不同的物理场景和超过 180,000 个具有密集、解耦注释的投影。最后,我们建立了一个双字幕评估协议,使用特定于任务的标记来独立评估物理场景和投影描述。我们的实验表明,ProCap 为未来的 SAR 研究提供了强大的语义基础。源代码、预训练模型和 RGBP 数据集可在项目页面上找到:https://ZimoCao.github.io/ProCap/。