论文

AstroReason-Bench:跨异构空间规划问题评估统一的 Agentic 规划

AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems

智能体系统Agent任务评测长程任务评测

摘要

Agentic 大语言模型(LLM)的最新进展使其成为能够跨多样任务推理与行动的通才规划者。然而,现有智能体基准大多聚焦符号性或弱接地的环境,其在物理约束的真实领域中的表现尚未得到充分探索。我们提出 AstroReason-Bench,一个用于评估空间规划问题(SPP)中 Agentic 规划的综合基准。SPP 是一类具有异构目标、严格物理约束与长程决策的高风险问题。AstroReason-Bench 整合多种调度机制,包括地面站通信与敏捷对地观测,并提供统一的面向智能体的交互协议。我们对一系列最先进的开源与闭源 Agentic LLM 系统进行评估,发现当前智能体显著逊色于专用求解器,凸显了通才规划在现实约束下的关键局限。AstroReason-Bench 为未来的 Agentic 研究提供了具有挑战性且具诊断价值的试验台。

AstroReason-Bench:跨异构空间规划问题评估统一的 Agentic 规划
图1:从各自不同的算法到统一智能体框架的转变:(a) 展示传统方法,其中任务相互隔离并使用各自不同的算法进行优化;(b) 呈现我们统一的智能体系统,其中中央智能体利用工具包,以一体化方式管理各类不同的调度任务。