论文

HyVGGT-VO:具有前馈模型的紧耦合混合密集视觉里程计

HyVGGT-VO: Tightly Coupled Hybrid Dense Visual Odometry with Feed-Forward Models

应用与实践视觉感知与空间理解

摘要

密集视觉里程计 (VO) 可提供姿态估计和密集 3D 重建,是从机器人到增强现实等各种应用的基石。最近,前馈模型在密集映射方面表现出了卓越的能力。然而,当这些模型用于密集视觉 SLAM 系统时,其繁重的计算负担限制了它们在关键帧处产生稀疏姿态输出,同时仍然无法实现实时姿态估计。相比之下,传统的稀疏方法提供了高计算效率和高频位姿输出,但缺乏密集重建的能力。为了解决这些限制,我们提出了 HyVGGT-VO,这是一种新颖的框架,它将稀疏 VO 的计算效率与前馈模型的密集重建能力结合起来。据我们所知,这是第一个将传统 VO 框架与最先进的前馈模型 VGGT 紧密结合的工作。具体来说,我们设计了一个自适应混合跟踪前端,可以在传统光流和 VGGT 跟踪头之间动态切换,以确保鲁棒性。此外,我们引入了一个分层优化框架,联合细化 VO 位姿和 VGGT 预测的规模,以确保全局规模的一致性。与现有基于 VGGT 的方法相比,我们的方法实现了约 5 倍的处理速度提升,同时在室内 EuRoC 数据集上将平均轨迹误差降低了 85%,在室外 KITTI 基准上将平均轨迹误差降低了 12%。我们的代码将在接受后公开。项目页面:https://geneta2580.github.io/HyVGGT-VO.io。