论文

GPT-6-Astra 点亮嵌入式导航:连续环境中零镜头视觉和语言导航的评估

GPT-6-Astra Lights Up Embodied Navigation: Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous Environments

智能体系统Agent任务评测

摘要

我们研究通用基础模型 GPT-6-Astra 是否可以利用自身的感知、推理和决策能力来应对不熟悉的环境。我们的评估重点是通过 Codex Harness中的最小接口在连续环境 (VLN-CE) 中进行零镜头视觉和语言导航,旨在释放 GPT-6-Astra 的全部导航潜力。 GPT-6-Astra 使用单目 RGB 来决定何时观察、如何移动以及何时停止,无需特定于导航的微调、经过训练的路点预测器或预先构建的场景地图。我们的评估得出四个主要发现。首先,\textbf{\textit{GPT-6-Astra 仅使用单目 RGB 观测即可实现强大的零样本导航性能}}。在常见的零样本 R2R-CE 基准上,超推理实现了 \textbf{\textit{79.0\%}} 的成功率,分别比报告的最强零样本和监督成功率 \textbf{\textit{13.0}} 和 \textbf{\textit{6.9}} 个百分点。其次,\textbf{\textit{GPT-6-Astra 通过奠定空间关系、跟踪任务进度和修改其动作,将多阶段语言指令推进为连贯的自适应导航}}。第三,\textbf{\textit{即使有超强推理,可靠的路线执行和目标验证仍然具有挑战性}}。看似合理的本地地标匹配并不能始终导致正确的任务完成。第四,\textbf{\textit{这些能力促使人们重新思考具身学习的作用}}。未来的 VLN 研究应该建立在基础模型的基础上,以推进可推广和可靠的体现智能。