论文
看一次就够了?用于 3D 问答的在线几何感知标记修剪
Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
摘要
最近的多模态 大语言模型 (MLLM) 在 2D 问答任务中表现出了卓越的性能。然而,将这些模型扩展到 3D 问答仍然具有挑战性,因为它们通常需要场景的多个视图,这会在推理时产生大量的计算成本。为了缓解这个问题,现有的解决方案依赖于战略帧选择或词元合并算法,这些算法需要提前预处理场景的所有帧,即离线方式。相比之下,我们提出了第一个在线词元修剪方法,可以与当前用于 3D 问答任务的 MLLM 模型无缝集成,无需额外训练且内存使用量较低。我们的主要见解是使用深度信息和相机姿势将每个输入帧投影到共享体素空间中,识别跨帧的空间重叠区域,并在冗余图像词元进入语言模型之前有选择地修剪它们。我们的方法可以实现高效的在线处理,同时减少高达 50% 的词元使用量。我们将此方法应用于 Qwen2.5-VL-7B 和 Qwen3-VL-8B,在 ScanQA、SQA3D 和 OpenEQA-HM3D 基准测试中展示了改进的性能。