论文

超越隔离:通用导航的统一基准

Beyond Isolation: A Unified Benchmark for General-Purpose Navigation

模型评测基准与评测资源

摘要

对通用具体代理的追求受到支离破碎的评估协议的阻碍,这些协议隔离了导航技能并专注于特定的机器人形态,无法反映代理必须在不同实施例中协调不同行为的现实场景。为了弥补这一差距,我们引入了 OmniNavBench,这是跨技能协调和跨实施例泛化的基准。 OmniNavBench 引入了三个范式转变:(1) 组合复杂性。我们提出了将 6 个类别(PointNav、VLN、ObjectNav、SocialNav、Human Follow 和 EQA)的子任务交错的复合指令,迫使智能体在单个情节中在探索、交互和社会顺从之间进行转换。 (2)形态通用性和传感器灵活性。我们提出了一个模拟平台,打破了对单一形态评估的依赖,实现了人形机器人、四足机器人和轮式机器人的泛化测试,具有模块化传感器接口和 170 个将合成资产与现实世界扫描相结合的环境。 (3) 示范质量。超越最短路径算法,我们通过人工远程操作策划 1779 条专家轨迹,捕捉行为的细微差别,例如探索性目光和预期回避。广泛的评估表明,当前的方法尽管声称具有统一的设计,但仍难以应对通用导航的复杂性、交错性。这暴露了现有功能与实际部署需求之间的严重差异,凸显了 OmniNavBench 作为下一代通用导航器的测试平台。数据集、代码和排行榜可在 http://omninavbench.cloud-ip.cc 上获取。