论文

通过动态词元选择和 微调 进行高效的多视图 3D 对象检测

Efficient Multi-View 3D Object Detection by Dynamic Token Selection and Fine-Tuning

模型训练参数高效训练

摘要

现有的多视图三维(3D)目标检测方法广泛采用基于大规模预训练视觉Transformer(ViT)的基础模型作为主干,计算复杂。为了解决这个问题,当前最先进的(SOTA)\texttt{ToC3D}用于高效的基于ViT的多视图3D对象检测采用基于自我运动的相关标记选择。然而,有两个关键限制:(1)固定的层-个体标记选择比率限制了训练和推理期间的计算效率。 (2) 多视图 3D 目标检测方法需要对 ViT 主干网进行完整的端到端再训练。在这项工作中,我们提出了一种图像词元补偿器与 ViT 主干的词元选择相结合,以加速多视图 3D 对象检测。与 \texttt{ToC3D} 不同,我们的方法可以在 ViT 主干内实现动态分层词元选择。此外,我们引入了参数高效的 微调 策略,该策略仅训练所提出的模块,从而将微调参数的数量从超过3亿 减少到仅160万。在跨三种多视图 3D 对象检测方法的大规模 NuScenes 数据集上进行的实验表明,我们提出的方法将计算复杂度 (GFLOPs) 降低了 $48\%$ ... $55\%$,相比当前先进方法ToC3D,在NVIDIA-GV100 GPU上的推理延迟降低了 $9\%$ ... $25\%$,同时仍将平均精度提高了 $1.0\%$ ... $2.8\%$ 绝对值,并将 NuScenes 检测得分提高了 $0.4\%$ ... $1.2\%$ 绝对值。