论文
视频语言模型的几何引导 3D 视觉标记修剪
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
摘要
多模态 大语言模型 在 2D 视觉方面展示了卓越的能力,推动其扩展到 3D 场景理解。最近的研究将 3D 场景表示为由具有深度和相机姿态信息的图像序列组成的 3D 空间视频,使预先训练的视频语言模型能够执行 3D 推理任务。然而,空间视频中的大量视觉标记仍然是高效推理和上下文管理的主要瓶颈。现有的剪枝方法忽视了空间视频的视图一致性和剩余标记的空间多样性,这阻碍了它们有效去除帧间冗余并保持场景完整性。在本文中,我们提出了 Geo3DPruner,一种几何引导的 3D 视觉词元修剪框架。 Geo3DPruner 首先通过几何感知全局注意力对跨框架相关性进行建模,然后执行两阶段修剪过程。体素内阶段选择每个体素内的代表性多视图特征,而体素间阶段通过选择全局分布的体素子集来保留空间多样性。对多个 3D 场景理解基准的大量实验表明,Geo3DPruner 保留了超过 90% 的原始性能,同时修剪了 90% 的视觉标记,显着优于现有的文本引导和视觉引导修剪方法。