论文
编译和基准测试具体代理的任务状态范围
Compiling and Benchmarking Task-State Horizons for Embodied Agents
摘要
前沿代理模型越来越多地被部署为长期具体任务的高级规划器。现有的机器人基准具有先进的长视野评估,但主要通过动作序列长度和子任务复杂性来表征难度,忽略了一个独特的挑战:代理必须跟踪由其探索和环境动态引起的不断变化的与任务相关的世界状态。我们将代理必须跟踪的任务相关状态转换的范围定义为任务状态范围(TSH)。为了评估代理性能如何随 TSH 变化,我们引入了 RoboGraph,这是一种机器人任务编译器,可将状态转换依赖关系转换为可执行符号图。具体来说,RoboGraph 根据空间和时间因果依赖性构建任务状态范围,包括任务执行过程中意外故障和干预引起的情况。在 RoboGraph 的基础上,我们发布了一个基准,其中包含 84 个场景的 588 个片段,具有不同的 TSH。在语义和视觉闭环环境中评估 15 个高级代理模型的实验表明,大多数模型都在与要求苛刻的 TSH 作斗争,揭示了在长期维护、探索和更新任务相关状态方面的巨大差距。