论文

IntentionNav:来自隐式人类指令的意图驱动对象导航的基准

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

模型评测基准与评测资源

摘要

现有的对象导航基准通常告诉实体代理要查找哪个对象类别,例如微波炉或椅子。面向人类的具体人工智能经常被问到一些不太直接的问题:“我需要一些东西来加热这些食物”或“房间感觉闷热”。代理必须推断能够满足需求的对象,找到基于场景的实例,并决定是否达到目标。我们将这种设置作为意图驱动的对象导航进行研究,并引入 IntentionNav,这是一种根据隐式人类指令进行活动对象搜索的诊断基准。每个情节都提供自由文本意图、RGB-D 观察结果和姿势,但保留目标对象名称。 IntentionNav 包含 176 个 Isaac Sim 场景和 64 个目标类别的 500 个意图。每个意图都以四种受控指令风格重写,并用四种意图模式之一进行注释,将表面短语与匹配几何形状下的语义提示类型分开。这种配对设计支持对目标推理、语言鲁棒性、邻域可达性和终端成功的分析,而不仅仅是总体成功的分析。我们使用固定的主动导航代理评估了三个 VLM。模型在 48.3% 的事件中识别出预期目标,并在 68.7% 的事件中进入其 2 m 邻域,但仅在 24.9% 的情况下成功终止,在 5.5% 的情况下实现 1 m 的落地成功。事件脚本意图的成功率最高(28.7%),物理状态和可供性意图的成功率较低(19.2%和18.5%),这表明间接人类意图仍然是主动体现搜索中目标选择、视觉验证和终端定位的瓶颈。