论文

Talk2Escape:视觉和语言导航的对话基础

Talk2Escape: Conversational Grounding for Vision-and-Language Navigation

智能体系统Agent 环境交互

摘要

虽然视觉和语言导航(VLN)已经取得了显着的成功,但流行的单轮范式暴露了一个根本性的漏洞:代理以严格的开环方式运行。在实践中,感知混叠、传感器噪声和里程计漂移等因素可能会导致微小偏差随着时间的推移而累积,通常会导致灾难性的任务失败,而没有内置的错误恢复机制。为了解决这个问题,我们引入了 \textit{Talk2Escape},一个主动且与模型无关的对话干预框架,它将导航重新构建为闭环交互过程。其核心是一个轻量级视觉语言模块,持续监控代理运动学。在检测到局部循环或严重的轨迹分歧时,它将原始的以自我为中心的观察结果转化为简洁、基于当前观测的查询,以从算法预言机或人在循环中征求有针对性的纠正反馈。在高保真模拟器(包括 R2R-CE、RxR-CE 和 VLNVerse)中进行的广泛评估表明,\textit{Talk2Escape} 在不同的基础代理中表现出一致的改进。根据经验,\textit{Talk2Escape} 在 R2R-CE 上实现了 66.0\% 的成功率,优于当前的监督和零样本最先进方法。我们进一步在 Unitree Go2 四足动物上验证了其从模拟到真实的传输,证明主动对话极大地提高了物理环境中的导航鲁棒性。