论文

超越航点:跨实施例语义导航的双热图基础

Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation

应用与实践视觉感知与空间理解

摘要

将开放式语义指令融入物理上可执行的本地目标是人机交互中的一个基本挑战。虽然现有的导航框架经常回归确定性路径点,但这种严格的公式破坏了空间不确定性,并且经常针对不可穿越的对象中心,导致严重的执行失败。在这项工作中,我们重点关注视场内语义导航的实际设置,其中机器人接收简洁、交错的多模式(文本和图像)提示。为了弥合抽象语义意图和物理可达性之间的差距,我们提出了一个统一的视觉语言框架,该框架放弃单点回归,转而采用双热图表示。我们的框架预测了一个捕获连续可达区域的导航可供性热图,以及用于方向约束的面向热图。这些密集的输出本质上充当可微分的语义势场,与下游本地规划器无缝集成。为了支持这一范式,我们构建了一个完全自动化的、基础模型辅助的合成数据管道,并建立了全面的模拟基准。大量实验表明,我们的框架在可比较的 8B 基线中实现了最先进的性能。至关重要的是,跨不同机器人实施例(Jetbot、H1、Aliengo)的特征融合研究和模拟研究表明,显式热图预测可以极大地提高可供率(AR)。通过将目标可靠地放置在可执行的自由空间中,我们的框架有效地减轻了点回归的脆弱性,为安全的跨实施例语义导航提供了可转移的路径。