论文

DVD:基于 MLLM 的高效感知的动态矢量解码

DVD: Dynamic Vector Decoding for Efficient MLLM-based Perception

模型推理应用与实践推理加速视觉感知与空间理解

摘要

多模态大语言模型在连接视觉和语言、促进人机交互、机器人和自动驾驶所必需的各种感知任务方面取得了显着进展。然而,现有的基于 MLLM 的感知方法主要依赖于基于文本的坐标表示,这会带来过多的token开销,或者固定范围量化会受到范围和精度的限制,特别是对于具有无界空间范围和高定位精度要求的 3D 域。为了解决这些挑战,我们提出了一种名为 DVD 的动态矢量解码方法,它统一了 2D 和 3D 感知任务的表示。具体来说,我们首先将不同的感知表示(即 2D 边界框、2D 掩模和 3D 边界框)转换为 1D 向量序列,然后将其映射到高维空间中的紧凑离散标记。然后,轻量级去标记器通过将输出标记解码回原始 2D 和 3D 感知表示,实现与 MLLM 的无缝集成。广泛的实验 在 RefCOCO 系列、SUN-RGBD、KITTI、Hypersim、nuScenes 等 2D 和 3D 感知基准上的测试表明,DVD 在 2D 和 3D 任务中实现了卓越的性能,并显着降低了token开销和推理延迟。 DVD 提供了一个有效且通用的框架,用于将感知功能集成到 MLLM 中,克服了现有方法的固有局限性。