论文

SeGPruner:用于 3D 问答的语义几何视觉标记修剪器

SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering

摘要

视觉语言模型 (VLM) 已广泛应用于 3D 问答 (3D QA)。在典型的管道中,从多个视点提取的视觉标记与语言标记连接起来,并由 大语言模型 (LLM) 联合处理以进行推理。然而,聚合多视图观察结果不可避免地会引入严重的标记冗余,导致视觉标记集过大,在 词元预算 约束下显着阻碍推理效率。视觉词元修剪已成为解决此问题的流行策略。然而,大多数现有的剪枝器主要针对 2D 输入进行定制或依赖于间接几何线索,这限制了它们显式保留语义关键对象并保持足够的空间覆盖以进行稳健的 3D 推理的能力。在本文中,我们提出了 SeGPruner,一种语义感知和几何引导的标记缩减框架,用于多视图图像的高效 3D QA。具体来说,SeGPruner 首先通过基于注意力的重要性模块(显着性感知词元选择器)保留语义上显着的词元,确保保留对象关键证据。然后,它通过几何引导选择器(几何感知词元多样化器)用空间多样化的词元来补充这些词元,该选择器联合考虑语义相关性和 3D 几何距离。显着性保留和几何引导多样化之间的合作在积极的词元减少下平衡了对象级证据和全局场景覆盖。在 ScanQA 和 OpenEQA 上进行的大量实验表明,SeGPruner 大幅提高了推理效率,将视觉 词元预算 降低了 91%,推理延迟降低了 86%,同时在 3D 推理任务中保持了有竞争力的性能。