论文

AsgardBench——在最小反馈下评估视觉依据对齐的交互式规划

AsgardBench - Evaluating Visually Grounded Interactive Planning Under Minimal Feedback

智能体系统Agent任务评测

摘要

我们旨在通过AsgardBench评估视觉接地的高层动作序列生成与交互式规划,特别聚焦于执行过程中基于视觉观察进行计划调整的能力,而非导航或低层操作。在具身AI基准的版图中,AsgardBench瞄准交互式规划这一能力类别:它比离线高层规划更复杂,因为要求智能体根据环境反馈修改计划,但又与低层执行相区别。与先前那些将推理与导航混为一谈、或提供可替代感知的丰富纠正反馈的具身AI基准不同,AsgardBench将智能体输入限制为图像、动作历史和轻量的成功/失败信号,在没有低层控制噪声的受控模拟器中隔离出交互式规划。该基准包含跨越12种任务类型的108个任务实例,每个实例都通过物体状态、摆放位置和场景配置进行系统性变化。这些受控变化创造了条件分支:同一条指令可能因智能体观察到的内容不同而需要不同的动作序列,从而强调执行过程中的条件分支与计划修复。我们对领先视觉语言模型的评估显示,没有视觉输入时性能急剧下降,暴露出视觉接地与状态追踪方面的弱点,并最终损害交互式规划。我们的基准聚焦于一个更窄的问题:当事情没有按预期发展时,模型能否真正利用它看到的内容来调整计划?

AsgardBench——在最小反馈下评估视觉接地的交互式规划:论文配图
图 1:AsgardBench 中的代理观察结果和相应的行动计划。每幅图像下方是根据观察结果生成的行动计划。这说明了 AsgardBench 如何要求代理根据新的视觉证据更新或更改其计划,而不是遵循固定的操作顺序。