论文
AstroMind:基于大语言模型的航天器行为推理高保真基准
AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models
摘要
随着地球轨道变得拥挤和有争议,理解航天器为什么会机动——而不仅仅是它这样做——对于太空领域意识来说是一个日益重要的问题。当前的分析管道是为检测而构建的:它们擅长发现发生的事情,而不擅长推理它的含义。 AstroMind 是一个基于物理的基准测试,旨在缩小这一差距。它利用高保真天体动力学模拟和真实观测约束,将其转换为跨三种任务类型的可验证推理问题:意图推断、机动参数估计和威胁评估。每个场景都包括不同可靠性级别的真实传感噪声和多源文本智能。评估指标捕获物理约束下的语义正确性和定量一致性。对一套开放权重模型进行基准测试表明,没有一个模型在每个轴上都占主导地位:Qwen3 (32B) 在意图推理准确性方面领先; QwQ (32B) 在威胁评估方面处于领先地位,并在解析项目上实现了最低的中值相对误差; GPT-OSS (20B) 产生最强的判断推理质量,并提取最多的标量值进行参数估计(241 个解析项中的 136 个)。训练数据组成和推理风格与模型大小一样重要。结构化推理提示有助于在经过测试的 8B 模型中保持一致,对于那些已经可以跟踪物理约束的模型来说,可以获得更大的收益。 AstroMind 为该领域提供了一个共同的测试,以解决一个问题,即正确地理解物理原理和正确地解读战术形势都是必需的,而这两者本身都是不够的。