论文
在沙箱中规划,在开放世界中导航:学习基于物理的抽象体验以实现具体导航
Plan in Sandbox, Navigate in Open Worlds: Learning Physics-Grounded Abstracted Experience for Embodied Navigation
摘要
视觉语言模型 (VLM) 已展现出卓越的一般推理能力。然而,它们在实体导航方面的性能仍然受到缺乏一致的开放世界视觉和机器人控制数据的阻碍。尽管模拟器为数据收集提供了一种经济高效的替代方案,但对逼真模拟的固有依赖往往限制了学习策略的可转移性。为此,我们提出 \textit{\textbf{S}andbox-\textbf{A}bstracted \textbf{G}rounded \textbf{E}xperience} (\textbf{\textit{SAGE}}),一个框架,使智能体能够在基于物理的语义抽象而不是照片级真实感模拟中学习,模仿人类的心理模拟能力,其中计划在执行之前以简化的物理抽象进行排练。 \textit{SAGE} 系统通过三个协同阶段运行: (1) \textit{Genesis}:构建多样化的、物理约束的语义环境来引导体验; (2)\textit{Evolution}:通过强化学习(RL)提炼经验,利用新颖的非对称自适应裁剪机制来稳定更新; (3) \textit{Navigation}:将抽象策略与开放世界控制联系起来。我们证明 \textit{SAGE} 显着改善了规划器辅助的具体导航,在 A-EQA 上实现了 53.21% LLM 匹配成功率(比基线高出 9.7%),同时显示出令人鼓舞的向物理室内机器人部署的转移。