论文

LookStep:具有语言远见和事件驱动记忆的高效视觉语言导航

LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

智能体系统Agent 架构与控制循环

摘要

视觉语言导航(VLN)需要一个实体代理在看不见的环境中遵循自然语言指令。最近的进展主要是由多式联运 大语言模型 (MLLM) 推动的。现有方法遵循下一步行动预测范式,仅监督专家行动,这需要大量数据进行训练。它们还依赖认知图、累积的历史帧或外部 3D 工具来维护状态,从而导致较高的计算和内存开销。为了实现VLN的资源效率,我们提出了LookStep,一个统一的端到端框架,结合了以语言为中心的未来状态建模和事件驱动的滚动记忆,它使用语言标签为每个候选动作生成粗粒度的导航进度和未来状态,同时自主决定是否将每个观察写入具有语义角色的有界滚动记忆。我们根据经验验证 LookStep。在 VLN-CE 任务上,LookStep 在相同训练设置下优于现有方法,在 R2R-CE Val-Unseen 上实现了 49.7% 的成功率,并且具有更好的内存效率和更少的数据使用。代码和模型可在 https://github.com/kunyang-YU/LookStep 获取。