论文

NeutronGym:面向LLM智能体的物理分级中子仪器设计

NeutronGym: Physics-Graded Neutron Instrument Design for LLM Agents

应用与实践科学研究

摘要

设计科学仪器检验的是语言模型智能体能做物理而非回忆物理——前提是评分无法被争辩。我们提出NeutronGym——据我们所知首个中子仪器设计可执行环境:智能体通过验证工具构建仪器,McStas对所建之物做射线追踪,分级阶梯对语法、运行时、结构与科学评分而不使用LLM裁判。程序化族提供固定布局的无限实例(智能体必须设定其设计参数),含留出参数区间;精选切片McStasBench增加来自已发表仪器的16个任务,置于记忆探针与沙箱之后。七个模型至多复现16个中的7个,无一检索到参照,无一达到改进目标。该环境还能训练:在其奖励上的强化学习把Qwen3-8B从11%提升到77%(隐藏设计目标的族的留出实例;第二种子69%),超过未训练的Qwen3-32B,且配方在另三个门控族各一种子上成立。分析说明该增益是什么:没有阶梯的部分信用它会崩掉60分;仅凭奖励,受训模型只有在拿到闭式物理时才达到经典优化器在智能体仿真预算下达到的水平(77%对81%,该规模下差距不分离),而前沿模型仍解98-99%。获得可信结果意味着让四个无模型基线能解的任务设计失败——我们发布发现它们的探针。