论文

VDPP:视频深度后处理以提高速度和可扩展性

VDPP: Video Depth Post-Processing for Speed and Scalability

应用与实践视觉感知与空间理解

摘要

视频深度估计对于在自动驾驶到混合现实等应用中提供 3D 场景结构至关重要。当前的端到端视频深度模型已经建立了最先进的性能。尽管当前的端到端(E2E)模型已经实现了最先进的性能,但它们作为紧密耦合的系统发挥作用,每当发布卓越的单图像深度估计器时,都会遭受显着的适应滞后。为了缓解这个问题,NVDS 等后处理方法提供了一种模块化的即插即用替代方案,可以合并任何不断发展的图像深度模型,而无需重新训练。然而,由于速度、精度和 RGB 依赖有限,现有的后处理方法仍然难以与 E2E 系统的效率和实用性相匹配。在这项工作中,我们通过提出 VDPP(视频深度后处理)来重振后处理的作用,VDPP 是一个提高视频深度估计后处理方法的速度和准确性的框架。通过将范式从计算成本高昂的场景重建转变为有针对性的几何细化,VDPP 纯粹在低分辨率空间中进行几何细化。该设计实现了卓越的速度(在 NVIDIA Jetson Orin Nano 上>43.5 FPS),同时匹配 E2E 系统的时间一致性,并通过密集残差学习驱动几何表示而不是完全重建。此外,我们的 VDPP 的 RGB-free 架构可确保真正的可扩展性,从而能够与任何不断发展的图像深度模型立即集成。我们的结果表明,VDPP 在速度、准确性和内存效率之间实现了卓越的平衡,使其成为实时边缘部署最实用的解决方案。我们的项目页面位于 https://github.com/injun-baek/VDPP