论文
超越策略的交互基准测试:协作实例对象导航的可重复基准
Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation
摘要
我们提出了问答导航(QAsk-Nav),这是协作实例对象导航(CoIN)的第一个可重复基准,它可以对具身导航和协作提问进行明确、单独的评估。 CoIN 要求实体代理在部分可观察性下达到以自由形式自然语言指定的目标,仅使用以自我为中心的视觉观察和与人类的交互式自然语言对话,其中对话可以帮助解决视觉上相似的对象实例之间的歧义。现有的 CoIN 基准主要关注导航成功,不支持对协作交互的一致评估。为了解决这一限制,QAsk-Nav 提供了 (i) 独立于导航评分的轻量级提问协议,(ii) 具有真实、多样化、高质量目标描述的增强型导航协议,以及 (iii) 开源数据集,其中包括 28,000 个经过质量检查的推理和提问轨迹,用于训练和分析 CoIN 模型的交互能力。使用提出的 QAsk-Nav 基准,我们开发了 Light-CoNav,这是一种用于协作导航的轻量级统一模型,其体积比现有的模块化方法小 3 倍,速度快 70 倍,同时在对不可见物体和环境的泛化方面优于最先进的 CoIN 方法。项目页面:https://benchmarking-interaction.github.io/