论文
GPT-6-Astra 能走多远?评估零镜头视觉和语言导航的能力
How Far Can GPT-6-Astra Go? Evaluating Capabilities in Zero-Shot Vision-and-Language Navigation
摘要
我们在连续环境中的零样本视觉和语言导航 (VLN-CE) 系统中研究 GPT-6-Astra,它解释指令、评估周围环境并提出行动建议。该系统使用常见的观察-决策-执行工作流程以及直接模型 API 调用,无需打包的代理工具或特定于导航的微调。在此工作流程中,每个请求都会收到选定的观察结果、执行反馈和保留的进度记录。评估涵盖整个系统,包括上下文管理和动作控制。我们在 Open-Nav 使用的 100 个 R2R-CE val-unseen 片段中的 50 个上评估了系统。它的成功率为 52.0\%,SPL 为 48.9\%,nDTW 为 70.8\%。我们的分析强调了三个发现。首先,记录的响应将地标和早期行动与使用观察和提供的历史的指令联系起来。其次,审查包括要求补充意见和修改不确定的判断。第三,结果表明任务理解和自主完成之间存在差距:在轮换继续的同时,未完成的交叉被识别出来。终止时,36.0% 的事件成功完成工作流接受的停止,而另外 16.0% 的事件满足步数限制的距离标准。这些结果凸显了一个核心挑战:将正确的当地判断转化为持续的进步和适当的停止。