论文
HiSC:用于高效 3D 场景理解的分层空间聚类词元压缩
HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding
摘要
3D 视觉语言模型 (3D VLM) 可在多视图场景上进行空间推理,但由于重复观察和大量无信息区域而遭受大量标记冗余,从而导致计算成本较高。尽管视觉词元压缩在加速 2D VLM 方面显示出希望,但它无法捕获 3D 场景的结构化性质,并导致空间覆盖不完整和细粒度细节的丢失。在本文中,我们提出了 \textbf{HiSC},这是一种用于 3D VLM 中分层空间聚类词元压缩的 无需训练 框架。 HiSC 通过使用联合几何和语义线索将词元组织到具有空间位置依据的簇中,将词元压缩从 词元级 选择提升到集群级处理。具体来说,我们首先引入一种 \textbf{基于空间图的合并(SGraM)策略},该策略将跨视图冗余建模为空间连通性并巩固物理上一致的区域,在 LLM 推理之前有效地合并极其相似的冗余标记。然后,我们在 LLM 推理中提出了一种基于空间聚类的修剪(SCluP)范式,它在集群之间和集群内执行分层压缩,保留对象实例的完整性,同时保留重要区域的细粒度细节。对各种 3D 推理基准的大量实验证明了 HiSC 的有效性,特别是在高视觉标记剪枝率下。此外,HiSC 在性能下降最小的情况下实现了超过 90% 的词元减少。代码可在 https://github.com/elecreak/HiSC 访问。