论文

Noctif3R:嵌入式硬件上用于光子有限场景的前馈单目实时 SLAM

Noctif3R: Feed-Forward Monocular Real-Time SLAM for Photon-Limited Scenes on Embedded Hardware

AI 基础设施模型部署

摘要

在黑暗环境中执行任务的机器人需要通过单个 RGB 摄像头在功率有限的车载计算机上实时进行定位,光线如此之低以至于每像素信号接近传感器自身的噪声。这些约束中的每一个都有成熟的管道,但交叉点却没有。离线低光重建现在可以恢复低于 -4 dB 的结构,但速度太慢而无法实时运行,而机器人实际可以携带的实时单目系统(DROID-SLAM、DPV-SLAM 等)在 SNR 变低时会退化或失败。我们测量了它们是如何失败的:在场景的九个最低黑暗级别中,DROID-SLAM 返回一个全长轨迹,其中不包含有关所有九个摄像机运动的信息,VGGT-SLAM 和 CUT3R 在八个上返回,pi^3 在七个上返回,DPV-SLAM 在四个上返回。我们提出了 SYS,一种建立在低光前馈点图前端上的单目管道,具有显式匹配门,它返回三个跟踪轨迹,没有无信息的轨迹,其跟踪方法的误差最低(无信息上限为 24-47%,最强基线为 56-73%),并且覆盖范围最窄。在真实的机器人视频中,86.5% 的交付帧都是全黑的,我们的每个配置在光照开始后都会停止,而 DROID-SLAM 和 DPV-SLAM 各自为所有 1178 帧发出一个姿势。我们的方法贡献是 Jetson AGX Orin 的嵌入式执行路径:以 384 像素运行地图、关键帧和后端,以 256 像素进行跟踪,再加上对每帧姿态求解的两个修复,是一种复制帕累托改进,一个场景上的吞吐量为 0.964 倍误差,吞吐量为 1.28 倍,第二个场景的吞吐量为 0.68 倍,吞吐量为 1.42 倍,峰值 GPU 内存减少 47%,每个场景的能耗减少 29%姿势。我们对经过校准的、位精确的可再生噪声阶梯、重新标记的真实世界黑暗曝光以及从波士顿动力 Spot 机器人记录的新暗室视频阶梯进行评估。