论文

RAO-Nav:用全模态语言模型进行零样本视听导航

RAO-Nav: Probing Omni-Language Models for Zero-shot Semantic Audio-Visual Navigation

模型推理测试时计算扩展

摘要

我们探索全语言模型(OLM)是否可以直接应用于零样本语义视听导航(SAVN)。最近的工作表明,即使是最先进的专业模型仍然难以实现通用的多模式导航,尽管进行了广泛的特定任务训练。在本文中,我们介绍了 RAO-Nav,即 Reasoning All-in-One OLM 的缩写,它是一种零样本 SAVN 的部署管道。通过利用 OLM 中编码的丰富隐式视听知识,实体Agent能够在环境中“听到”、“看到”、“推理”和“行动”。为了进一步激发 OLM 的内置思维能力,我们提出了一种可无缝集成到解码空间中的测试时潜在导航推理(LNR)模块。 LNR 鼓励模型检索更多与目标相关的观测结果并做出有效的导航决策。通过全面的实验,我们表明我们的框架在不使用任何训练数据的情况下超越了公共 SAVN 基准的现有最先进基线。此外,我们引入了新的全局导航指令设置,以进一步评估 OLM 作为具体导航Agent的能力。代码:https://github.com/rikeilong/OmniAV\_Nav.

RAO-Nav:探索零样本语义视听导航的全语言模型:图 1:我们提出建立在单个 OLM 上的 RAO-Nav 管道,以实现零样本视听导航。它可以部署在现实世界和虚拟环境中,并分三个步骤迭代执行导航:AudioGoal Prediction、Global Reasoning 和 Real-time Action。
图 1:我们提出建立在单个 OLM 上的 RAO-Nav 管道,以实现零样本视听导航。它可以部署在现实世界和虚拟环境中,并分三个步骤迭代执行导航:AudioGoal Prediction、Global Reasoning 和 Real-time Action。