论文

具身感知的深度先验学习

Deep Prior Learning for Embodied Perception

应用与实践视觉感知与空间理解

摘要

具身系统需要几何感知,以利用除图像之外的可用观察结果。最近的前馈 3D 模型结合了几何先验,包括相机姿态、内在特征和深度。然而,处理噪声姿势、保留准确的先验以及恢复物理尺度需要的不仅仅是简单地接受这些输入。我们引入了 Vision-Prior Geometry Grounded Transformer (VPGGT),这是一个基于 VGGT 的框架,它扩展了 OmniVGGT 以实现先验感知的具体感知。我们根据训练的真实轨迹制定传感器驱动的姿势损坏,并引入参数-free 先验残差连接(PRC)来减轻 先验稀释,其中预测不如其提供的先验姿势准确。我们的噪声公式以相机姿势为目标;提供的内在函数和深度不会受到额外的损坏。我们进一步引入Metric Global Attention,它在可用的姿态和深度尺度上调节全局尺度token,并预测几何输出的共享度量缩放因子。跨四个数据集的实验表明,当在精确姿势和损坏姿势下为所有视图提供相机先验时,PRC 在匹配的训练基线上提高了平移方向准确性和关节姿势 AUC。这些结果支持细化期间的显式优先访问,作为对特征级调节的有用补充。

具身感知的深度先验学习的原论文方法或结果图
图 2:相机细化过程中的事先稀释。 A0发布OmniVGGT; A1 使用相同的启用 PRC 的检查点,无需额外的训练。所有视图都会收到相机先验信息;没有提供深度。颜色区分方法,标记区分数据集。虚线显示输入先验分数。重置是一种状态干预,而不是学习迭代。