论文

CoVeR:VLM 中多视图 3D 推理的基于覆盖范围的词元修剪

CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs

上下文与知识上下文工程

摘要

将 3D 场景表示为多视图图像,允许 2D VLM 通过重用 预训练 的先验知识来进行 3D 推理,从而避免了带注释的 3D 数据的稀缺性。然而,它会产生数千个冗余的视觉标记,其成本随着每次视图的增加而增加。现有的视觉标记修剪器分为两个系列,每个系列都限制在 3D 多视图设置中。学习的重要性方法通过注意力或编码器特征对标记进行排名;因为这里的冗余基本上是空间上的,所以它们保留了一些突出区域的近乎重复的标记,而使大部分场景没有被代表。体素化方法改善了空间覆盖范围,但无法强制执行精确的 词元预算,并且由于多视图观测在 3D 中重叠而饱和,从而将保留限制在远低于目标的水平。我们证明了空间覆盖与 3D 推理性能相关,并引入了 CoVeR,这是一种确定性的 无需训练 选择器,仅使用词元坐标,没有学习信号。 CoVeR 选择共同覆盖场景每个区域的词元,并解决了这两个系列的局限性:它强制执行精确的每个场景预算,打破体素化饱和平台,并避免学习重要性的近乎重复选择。大量的实验表明,在所有三个 3D 推理基准上,CoVeR 的性能均优于之前的 SOTA,并且可以概括为在四个 VLM 上进行测试的即插即用模块。值得注意的是,它仅使用约 8% 的视觉词元,却保留了 93.5% 的全词元性能,在基准测试中平均超过 SOTA 3.9 个百分点。