论文
JRDB-AVR:现实世界环境中实体Agent的主动视觉推理基准
JRDB-AVR: An Active Visual Reasoning Benchmark for Embodied Agents in Real-World Environments
摘要
在复杂的具体视觉推理场景中,智能体通常只有有限的视野,而回答问题所需的证据可能分布在时间、观点和交互对象上。因此,模型可能会给出一个看似合理的答案,而无需观察支持它的相关对象、时间或视图。当前的视觉推理基准主要评估被动观察和最终答案,忽略了需要主动推理和证据获取的设置。我们引入了 JRDB-AVR,这是一个通过结构化问题生成引擎从现有现实世界 JRDB 机器人数据中衍生出来的基准,将这种差距转化为明确的评估:具体的 agentic 系统接收视觉推理问题,请求通过时间戳和视角进行有界观察,并根据最终答案和支持它的基础视觉证据进行评估。该基准包含针对多个现实世界环境的各种问题,涉及时间搜索、观点选择和以人为本的组合推理。我们还介绍了 JRDB-AVR-Agent,这是一种参考主动推理 agentic 方法,它维护一个基于显式观察的基于图的世界模型,并通过求解来给出答案。实验揭示了当前基线中答案准确性和证据准确性之间的巨大差距,表明当前的 VLM 可以产生不受支持的正确答案,并且主动的证据感知评估对于具体视觉推理是必要的。代码和基准可在 https://github.com/ControlNet/JRDB-AVR. 获取