论文
AsgardBench——在最小反馈下评估视觉依据对齐的交互式规划
AsgardBench - Evaluating Visually Grounded Interactive Planning Under Minimal Feedback
摘要
我们旨在通过AsgardBench评估视觉接地的高层动作序列生成与交互式规划,特别聚焦于执行过程中基于视觉观察进行计划调整的能力,而非导航或低层操作。在具身AI基准的版图中,AsgardBench瞄准交互式规划这一能力类别:它比离线高层规划更复杂,因为要求智能体根据环境反馈修改计划,但又与低层执行相区别。与先前那些将推理与导航混为一谈、或提供可替代感知的丰富纠正反馈的具身AI基准不同,AsgardBench将智能体输入限制为图像、动作历史和轻量的成功/失败信号,在没有低层控制噪声的受控模拟器中隔离出交互式规划。该基准包含跨越12种任务类型的108个任务实例,每个实例都通过物体状态、摆放位置和场景配置进行系统性变化。这些受控变化创造了条件分支:同一条指令可能因智能体观察到的内容不同而需要不同的动作序列,从而强调执行过程中的条件分支与计划修复。我们对领先视觉语言模型的评估显示,没有视觉输入时性能急剧下降,暴露出视觉接地与状态追踪方面的弱点,并最终损害交互式规划。我们的基准聚焦于一个更窄的问题:当事情没有按预期发展时,模型能否真正利用它看到的内容来调整计划?
