论文

PRISM::在模拟的具体环境中进行有意图的规划和推理

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

智能体系统Agent任务评测

摘要

当基于 LLM 的实体代理在完成家务任务时失败时,罪魁祸首可能是错误识别的物体、忘记的子目标或糟糕的行动顺序——但现有的基准测试仅报告单一的成功率,因此无法判断哪个认知模块负责。我们提出了 PRISM,一个重新定义这个问题的诊断基准:PRISM 不是只询问 \textit{代理成功了吗?},而是询问 \textit{哪种能力最有可能导致失败?} PRISM 建立在五个逼真的多房间公寓(每个房间 4--8 个房间)上,将 300 个人工验证的任务分为三个能力层 - \textit{基本能力}、\textit{推理能力} 和\textit{长视野能力}——分别隔离感知到行动的基础、隐含的意图解析和持续的多步骤协调。 PRISM 公开了一个与代理无关的可执行操作 API,允许任意代理:LLM 代理、VLM 代理、符号规划器、强化学习策略和混合系统,在相同的基准协议下进行端到端评估。为了支持更深入的诊断,可以采用、替换或完全绕过用于感知、记忆和规划的可选探针,从而在需要时实现受控的组件级分析。对七个当代 LLM 的实验建立了清晰的层次结构:显式空间基础不是预言感知下的主要失败源,隐式意图解析是所有模型系列的一个重要瓶颈,而长期协调暴露了一个明显的能力悬崖——轻量级模型崩溃到低至 20.0% 的成功率,同时比前沿模型消耗更多的词元,这是补偿性过度推理而不是真正的规划能力的标志。项目页面:\href{https://sj-li.com/PROJ/PRISM}{link}。