论文

EAGOR:全方位具身推理

EAGOR: Embodied Reasoning in Omni-direction

摘要

全向(360°)摄像头为实体代理提供周围环境的整体视图,使它们适合在导航和物体搜索等任务中进行方向推理。现有的视觉语言模型 (VLM) 将 360° 观察投影到 2D 等距柱状投影 (ERP) 图像,并使用专为透视图像设计的架构对其进行处理。然而,他们忽略了 360° 观察的球形性质,其中每个像素代表相对于代理的观察方向。因此,在代理运动引起的摄像机视图变换下,它们的方向估计通常会变得不一致。这种限制对于无地图导航尤其重要,其中代理必须在其以自我为中心的框架中不断估计目标方向。我们提出 EAGOR,一种 无需训练,用于体现 360° 方向推理的几何感知框架。 EAGOR 不是将目标方向预测为 ERP 图像坐标,而是直接在球体上将方向推理表述为递归贝叶斯估计。它保持对目标方向的连续信念,并在代理运动下等变地传播它,而无需训练骨干 VLM。为了实现这一目标,我们引入了球调和置信场(SH-BF),其球调和表示为球流形上的​​方向估计提供了全局定义的旋转感知基础。该公式消除了 ERP 接缝不连续性、纬度扭曲和插值错误。我们在两个基准数据集和腿式机器人跨方向推理任务的真实实验中评估了 EAGOR。 EAGOR 始终优于现有方法,在 HOS 和 OSR-Bench 上分别实现了 +34.4% 和 +45.6% 的平均相对增益,同时将导航成功率提高了 +14.6%,减少了步数 17.7%,并将平均角度误差降低了 24.5%。