论文

用于视觉导航的语言条件世界建模

Language-Conditioned World Modeling for Visual Navigation

模型评测基准与评测资源

摘要

目标条件视觉导航一直是实体人工智能的长期测试平台。我们研究了一种自然语言条件变体,即语言条件视觉导航(LCVN),其中实体代理必须遵循自然语言指令,而仅给出初始的自我中心观察。如果无法获得目标图像,智能体必须依靠语言来塑造其感知和持续控制。我们引入了 LCVN 数据集,这是一个包含 39,016 条轨迹和 117,048 条经过人工验证的指令的基准,涵盖不同的环境和指令风格。在此基准的基础上,我们研究了两种互补的范式:(i)潜在想象政策学习,其中基于扩散的世界模型(LCVN-WM)想象未来的观察结果,而策略与价值双模型智能体(LCVN-AC)完全在想象的潜在空间内学习其政策; (ii) 统一自回归预测,其中单个多模式主干 (LCVN-Uni) 在共享词元序列上的一次前向传递中联合预测动作和观察。实验表明,两种范式提供了互补的优势:潜在的想象力产生更多时间上连贯的滚动预测,而统一的预测可以更好地推广到看不见的环境。有针对性的消融进一步隔离了语言指导、调节信号和指令风格的贡献,澄清了语言基础与动态建模何时成为性能瓶颈。总之,这些发现将 LCVN 定位为研究语言、想象力和决策如何在实体主体中相互作用的测试平台。