论文
3DZip:用于 3D 问答的空间感知特征多样性引导词元压缩
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
摘要
最近的 3D 视觉语言模型 (3D VLM) 通过将 2D 视觉特征投影到世界坐标中来构建几何感知标记,从而实现 3D 问答等任务的空间推理。然而,这种设计为每个场景生成数千个词元,导致大量的计算和内存开销。虽然词元压缩已在 2D VLM 中得到广泛研究,但现有方法依赖于语义相关性或基于注意力的选择,而忽略了 3D 词元的结构化空间性质。此外,3D 表示中的冗余不能仅通过空间邻近性来解决,因为即使在空间聚合之后,对象级词元不平衡仍然存在。为了解决这个问题,我们提出了 3DZip,这是一个三阶段词元压缩框架,首先应用粗体素化来消除点级冗余,然后通过行列式点过程根据特征空间多样性选择锚词元,最后在空间约束下合并剩余词元以保持几何一致性。对三个 3D 问答基准的实验表明,3DZip 始终优于现有的压缩方法,仅用 128 个标记就保留了 94.7% 的原始性能,实现了 1.92倍的更快的推理速度。