论文
LLM 能做火箭科学吗?以 GTOC 12 探索复杂推理的极限
Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12
摘要
大语言模型(LLM)已在代码生成与一般推理上展现出卓越能力,但它们在高维、受物理约束环境中进行自主多阶段规划的能力仍是一个开放研究问题。本研究通过让当前 AI 智能体应对第 12 届全球轨迹优化竞赛(GTOC 12)来考察其极限,这是一项复杂的天体动力学挑战,需要设计大规模的小行星采矿任务方案。我们把 MLE-Bench 框架适配到轨道力学领域,并部署基于 AIDE 的智能体架构来自主生成并改进任务方案。为在二元有效性之外评估表现,我们采用“LLM-as-a-Judge”方法,利用领域专家制定的评分细则,从五个结构性类别评估战略可行性。对从 GPT-4-Turbo 到 Gemini 2.5 Pro、o3 等推理增强架构的多模型比较分析揭示出一个显著趋势:平均战略可行性得分在过去两年几乎翻倍(从满分 26 中的 9.3 升至 17.2)。然而,我们识别出战略与执行之间的关键能力缺口。先进模型虽展现出细致的概念理解,能正确设定目标函数与任务架构,但在实现层面持续失败,原因包括物理单位不一致、边界条件错误以及低效的调试循环。我们的结论是:尽管当前 LLM 往往展现出足以应对空间科学任务的知识与智能,它们仍受制于实现障碍,扮演的是强大的领域辅助者而非完全自主的工程师。
