论文

DPNeXt:一种轻量级多尺度特征融合框架,用于基于 ViT 的高效多任务密集预测

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

应用与实践视觉感知与空间理解

摘要

机器人感知系统中的多任务学习 (MTL) 通过集成语义分割和深度估计来支持全面的 3D 空间场景理解。虽然视觉基础模型(VFM)越来越多地被采用作为鲁棒的特征编码器,但现有的解码策略存在关键瓶颈。为了解决这个问题,我们提出了 DPNeXt,这是一种简化的多尺度特征融合解码器,也是标准密集预测 Transformer (DPT) 的有效替代品。 DPNeXt 使用双深度可分离反向瓶颈,通过以融合为中心的解码和独立任务模块化来提高冻结 VFM 利用率。为了进一步减轻任务之间的负归纳转移,我们引入了多任务边界指导(MTBG)策略。与之前添加融合模块或门控的边界感知方法不同,MTBG 应用对称的以边界为中心的监督来鼓励几何一致性,而无需额外的注释或推理成本。在 Cityscapes 上的实验表明,DPNeXt-S 优于现有最先进(SOTA)MTL 模型,而 DPNeXt-B 进一步提高了整体性能,并在比较方法中取得了最佳结果。在 NYUv2 上,DPNeXt-B 还在比较方法中实现了最佳的语义分割和深度估计结果,同时比之前的大规模 MTL 模型需要更少的可训练参数。与标准 DPT 相比,DPNeXt-S 将可训练参数减少了 78.6%,并在资源受限的笔记本电脑硬件上实现了对比模型中最快的推理速度。源代码、模型检查点和演示视频将在 https://github.com/kangjehun/DPNeXt 上提供。