论文
CubeBench:诊断部分观测下的交互式长程空间推理
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
摘要
大语言模型(LLM)智能体虽然在数字领域颇为熟练,但由于难以形成并维持稳健的空间心智模型,在物理世界部署上面临显著差距。我们识别出阻碍这一转变的三项核心认知挑战:空间推理、通过心理模拟进行的长程状态跟踪,以及部分观测下的主动探索。为分离并评估这些能力,我们提出CubeBench,一个以魔方为中心的新型生成式基准。CubeBench采用三层诊断框架渐进式评估智能体能力,从拥有完整符号信息的基础状态跟踪,到仅有部分视觉数据下的主动探索。我们在主流LLM上的实验揭示了关键局限,包括在全部长程任务上均为0.00%的统一通过率,暴露了长期规划上的根本性失败。我们还提出一个诊断框架,通过提供外部求解工具来分离这些认知瓶颈。通过分析失败模式,我们为开发更具物理基础的智能体提供了关键洞见。
