论文
CoverPrune:通过最佳传输对 3D VLM 进行覆盖驱动的词元修剪
CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
摘要
虽然 3D 视觉语言模型 (3D VLM) 已展现出卓越的空间推理能力,但它们面临着大量视觉标记计数的问题,这在推理过程中造成了严重的计算瓶颈。现有的词元修剪方法主要依赖于基于多样性的选择,丢弃相似的词元以最大化分散性。然而,在 3D 环境中,这种方法经常会放弃代表性原型标记而转而支持异常值,从而破坏了空间推理所必需的多视图一致性和几何结构。在本文中,我们提出了 3D VLM 词元修剪的范式转变:从最大化多样性到保留视觉证据覆盖范围。我们引入了 CoverPrune,这是一个 无需训练 框架,它将推理时间词元修剪表述为最佳传输(OT)问题。为了克服该公式中固有的棘手的组合子集选择,我们设计了特征-空间-时间(FST)传输成本和目标容量,以及高效的空间引导贪婪选择(SGS)算法来近似OT目标。此外,我们提出了 CoverPrune-Lite,这是一种利用空间结构化局部匹配来实现最小开销的加速变体。跨多个 3D 视觉空间推理基准的广泛实验表明,我们的方法实现了最先进的词元效率,即使在高度激进的修剪预算下也能保持强大的推理性能。请访问我们的项目网站:https://github.com/Brucess/CoverPrune。