论文

LH-AVLN:长视野视听语言导航的基准

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

智能体系统Agent任务评测

摘要

实体导航正在向长视距任务发展,但现有的长视距基准在很大程度上是无声的,并且视听导航任务通常专注于单一目标。我们推出 LH-AVLN,这是长视野视听语言导航的基准,它结合了多目标任务执行、异构目标规范和持久的空间声学线索。在 LH-AVLN 中,代理接收由类别、语言描述或参考图像指定的两到四个目标的全局任务,并在室内 3D 环境中使用 RGB-D 观察、姿势和双耳音频进行导航。该基准支持有序和无序任务,其中交替的目标相关声音可以指导非视线搜索,但也可能随着任务进度的变化而分散注意力。我们进一步开发 PAG-Nav,这是一种 无需训练 参考代理,它维护时间统一语义图并执行渐进的目标状态规划,使用声音进行搜索,同时保留视觉语义验证的完成。实验表明,现有的视觉语言、基于记忆和视听的代理很难完成完整的 LH-AVLN 任务,而 PAG-Nav 提供了更强大的诊断基线,同时为未来的进步留下了巨大的空间。