论文
视觉地点识别是否需要所有词元?有效推理的词元减少的实证研究
Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference
摘要
最近基于视觉Transformer的视觉位置识别(VPR)方法,特别是基础模型,已经取得了显着的识别性能。然而,这些模型处理整个网络中的所有视觉词元,导致大量的计算开销,这阻碍了它们在实时和资源受限的场景中的部署。因此,一个自然的问题出现了:VPR 是否需要所有视觉标记?为了回答这个问题,我们提出了第一个用于高效视觉位置识别的标记减少的系统基准。我们的基准测试跨多个最先进的 VPR 模型和涵盖城市、郊区和自然环境的不同基准数据集,全面评估了代表性的词元修剪、词元合并和混合修剪合并方法。我们从多个角度进一步研究词元缩减,包括不同缩减配置下的识别性能、计算复杂性、推理速度、定性可视化和边缘设备上的部署效率。通过广泛的实验和深入的分析,我们的基准揭示了 VPR 中词元减少的多个重要特征,并为准确性和推理效率之间的权衡提供了一些实用的见解。例如,词元减少可以将计算成本降低多达 29%,并将吞吐量提高多达 44%,同时识别精度下降不到 1%。总的来说,这项工作为未来词元高效 VPR 和高效视觉检索系统的研究奠定了全面的基础。我们的代码和模型将在 https://github.com/Tong-Jin01/TokenReduction4VPR 提供