论文
IMPRINT:长尾对象目标导航的图像条件查询丰富
IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation
摘要
嵌入式人工智能越来越依赖于根据预先训练的视觉语言模型构建的可查询语义图,以实现零样本目标目标导航(ObjectNav)。然而,现有的方法通常依赖于纯文本查询,随着语义特异性向细粒度对象类别的增加,这种查询变得不太可靠。我们引入了 IMPRINT,这是一个零样本即插即用框架,它通过网络来源的图像丰富文本对象查询,以改善可查询地图的基础。检索到的图像使用视觉语言模型进行编码,与语义图进行匹配以生成相似性图,并聚合以产生上下文感知本地化。值得注意的是,这不需要对底层导航策略进行训练或修改。为了明确评估长尾行为,我们提出了 HSSD-rare,这是一个基于 Habitat Synthetic Scenes 构建的新 ObjectNav 基准测试,并具有特定语义的子类别。在 OVON 和 HSSD 中,图像条件查询持续改善对象基础并产生端到端导航增益。进一步的分析表明,将定位增益转化为导航性能关键取决于下游检测质量,凸显了长尾实体导航的关键系统瓶颈。