论文
时间感知辅助导航
Time-Aware Assistive Navigation
摘要
交互式视觉和语言代理不仅可以学习要说什么,还可以学习 \textbf{\textit{when}} 说些什么?当前的语言模型很少计划是否以及何时实现对用户的实时响应。然而,为人类决策提供准确和及时的支持,例如在引导视障人士穿过城市环境时,需要仔细的实时响应——不及时的响应可能会分散用户的注意力或增加不必要的认知负担。作为基于多模态 大语言模型 (MLLM) 代理的机器智能挑战,我们引入了一个大规模多模态基准,用于在复杂的户外环境中执行以自我为中心的辅助导航任务。通过这个基准测试,我们发现了现成的 MLLM 在提供安全和时间敏感的导航指令方面的基本限制,即使模型 微调 处理大量数据也是如此。然后,我们证明了对模型的简单而有效的修改,包括直接监督来预测每条指令的根本原因,可以在开环、闭环和模拟到真实的泛化设置中产生显着的性能提升。然而,我们的分析强调了时间推理、安全关键对象感知以及关系和距离理解方面持续存在的挑战。为了推进可扩展辅助代理的开发,我们将发布我们的模拟、基准测试和代码(可在项目网站上获取:https://timeli-icra.github.io/)。