论文

PHITSBench:面向AI辅助PHITS辐射输运输入生成的执行评分基准

PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

模型评测基准与评测资源

摘要

我们提出PHITSBench:面向蒙特卡洛粒子与重离子输运代码系统(PHITS)的执行评分基准。含282个可输运评分任务,横跨三类常见工作流:参数编辑(Edit)、语法修复(Repair)与从自然语言描述完整生成仿真(Reproduce)。每任务以综合度量分评估:组合执行成功与生成/参考输运观测量的一致性。用PHITSBench评估五个基于GPT-5.4的配置(从零样本提示到知识增强与智能体工作流):没有领域知识时,模型在编辑与修复任务上表现良好(成功率95%与70%),但无法从零生成正确仿真(Reproduce赛道成功率0%);随用户手册一并提供的结构化机器可读PHITS知识目录把单发Reproduce成功率提升到57%;智能体执行进一步改善至66–73%,但计算成本上升。失败分析显示:剩余错误主要由物理观测量选择与配置不当造成,而非语法生成。结果表明:AI辅助辐射输运建模的未来进展,将同等程度地取决于机器可读知识库、精选的领域训练数据集与执行落地的评估环境,以及基础模型自身的进步。

PHITSBench:面向AI辅助PHITS辐射输运输入生成的执行评分基准:论文配图
图 1:PHITS 概览。 (a) PHITS 输入文件由一系列命名关键字部分组成,定义模拟参数、粒子源、材料、几何形状和计数请求。 (b) 在执行期间,粒子从指定源发射,通过几何体传输,并根据用户定义的 [T-*] 计数定义进行评分。在所示示例中,中子源发射中子,中子在几何结构中传播并与材料区域 M1(橙色)相互作用,在相互作用点(橙色点)处产生次级粒子;模拟返回由 [T-Track] 计数计分的中子径迹长度通量。 (c) 相同的辐射传输框架支撑着不同的应用领域;这些面板显示了本研究中的三个代表性 PHITS 模拟——医学物理(水中的质子束)、屏蔽和设施设计(铅中的光子束)以及辐射探测和光谱(Cs-137 源和 NaI(Tl) 探测器)。