论文

VISTA:通过动作历史调节实现规模感知视觉导航

VISTA: Scale-Aware Visual Navigation via Action History Conditioning

上下文与知识上下文工程

摘要

视觉导航基础模型(VNM)承诺端到端学习导航策略,能够跨不同实施例和环境进行零次部署。为了保持通用性,许多基于视觉的导航模型预测标准化动作。然而,这种标准化引入了一个关键的部署漏洞:对同一标准化轨迹应用不同的缩放因子会改变其物理几何形状,从而降低导航性能并增加碰撞风险。我们通过根据标准化动作历史和图像观察来调节模型来解决这个漏洞,为模型的预测和机器人的实际物理位移之间的关系提供明确的背景。此外,当前的 VNM 经常在缺乏鲜明特征的视觉重复环境中陷入困境。为了解决这个问题,我们集成了 DINOv3 编码器,其更丰富的表示使我们的模型能够捕获观测之间的空间和几何维度。 VISTA 可以稳健地推广到分布外环境,在户外、森林和办公室环境中的零样本实际部署中实现 100% 的目标预测准确性,并且平均跨越 95% 的检查点,从而在未见过的环境中展示了一致的路径跟踪。