论文
RescueBench:实体Agent能在野外拯救生命吗?
RescueBench: Can Embodied Agents Save Lives in the Wild ?
摘要
搜索和救援(SAR)要求实体主体在多模态不确定性下探索陌生环境,执行多阶段交互,并检索长范围内的空间记忆。现有的基准测试通常单独评估这些功能,从而不清楚当故障必须在现实的工作流程中组合时,故障是如何复合的。我们推出 RescueBench,这是一种逼真的诊断基准,它将 SAR 实例化为四阶段管道:多模式探索、目标救援、记忆引导返回和最终切换。通过将顺序任务组合与阶段级评估相结合,RescueBench 能够分析探索和记忆故障如何通过具体救援工作流程传播。它包含五个渐进的难度级别,其环境复杂性、线索模糊性和空间层次结构各不相同,以及用于可扩展评估和训练的自动情节生成和注释管道。我们评估了七个基线、一个预言机参考和人类玩家,结果表明没有基线能够以最大的难度完成完整的任务。阶段级诊断将自主探索确定为主要故障模式,将空间记忆确定为第二个独立瓶颈,这表明当前的拓扑视觉语言导航或基于地图的方法无法解决这些限制。代码可在 https://github.com/wukui-muc/RescueBench 获取