论文
Efficient3D:3D MLLM 中自适应和去偏词元减少的统一框架
Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs
摘要
多模态 大语言模型 (MLLM) 的最新进展已将推理能力扩展到 3D 领域,从而实现细粒度的空间理解。然而,3D MLLM 的巨大尺寸和输入特征的高维度引入了相当大的推理开销,这限制了资源受限平台上的实际部署。为了克服这一限制,本文提出了 Efficient3D,这是一种用于视觉标记修剪的统一框架,可以加速 3D MLLM,同时保持有竞争力的准确性。所提出的框架引入了去偏视觉词元重要性估计器(DVTIE)模块,该模块考虑了注意力聚合期间浅层初始层的影响,从而为视觉词元产生更可靠的重要性预测。此外,还开发了自适应词元重新平衡(ATR)策略,以根据场景复杂性动态调整修剪强度,保持语义完整性并保持跨层注意力平衡。它们共同实现了上下文感知的标记减少,以较低的计算量维持基本语义。对五个代表性 3D 视觉和语言基准(包括 ScanRefer、Multi3DRefer、Scan2Cap、ScanQA 和 SQA3D)进行的综合实验表明,与未剪枝的基线相比,Efficient3D 实现了卓越的性能,在 Scan2Cap 数据集上 CIDEr 提高了 2.57%。因此,Efficient3D 为 3D MLLM 中的高效推理提供了可扩展且有效的解决方案。代码发布于:https://github.com/sol924/Efficient3D