论文
询问何时支付:用于实例目标导航的成本感知开放式交互
Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation
摘要
实例目标导航(IGN)需要一个具体代理从未指定的自然语言描述中找到干扰项中的特定对象实例。这种歧义通常无法仅通过感知和语言来解决,因此与神谕的交互成为消除歧义的自然机制。先前的交互方法允许预言机查询,但同样对待轻量级澄清和路线级指导,让代理通过重复的高信息问题来提高成功率,而不是通过有效地解决潜在的模糊性。我们将交互式 IGN 重新定义为一个成本敏感的不确定性减少问题,其中代理应该提出一个问题,其答案可以最大程度地减少相对于其惩罚的导航不确定性。为此,我们对现有导航语料库进行信息增益分析,以确定哪些线索可以减少导航不确定性,从而产生一组紧凑的问题类型和数据派生权重。然而,现有的交互式导航基准没有对不同问题类型的成本进行建模,也没有评估代理使用交互的效率,这使得它们不适合研究成本敏感的交互。基于这种分类法,我们构建了一个用于诊断交互行为和效率的基准,以及一个加权成功率指标,该指标根据每个查询的派生成本来对其进行惩罚。我们进一步提出了一种零样本 MLLM 导航器,仅当预期的不确定性降低证明交互成本合理时,它才在每个决策步骤选择性地进行查询。