论文
PHITSBench:面向AI辅助PHITS辐射输运输入生成的执行评分基准
PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
摘要
我们提出PHITSBench:面向蒙特卡洛粒子与重离子输运代码系统(PHITS)的执行评分基准。含282个可输运评分任务,横跨三类常见工作流:参数编辑(Edit)、语法修复(Repair)与从自然语言描述完整生成仿真(Reproduce)。每任务以综合度量分评估:组合执行成功与生成/参考输运观测量的一致性。用PHITSBench评估五个基于GPT-5.4的配置(从零样本提示到知识增强与智能体工作流):没有领域知识时,模型在编辑与修复任务上表现良好(成功率95%与70%),但无法从零生成正确仿真(Reproduce赛道成功率0%);随用户手册一并提供的结构化机器可读PHITS知识目录把单发Reproduce成功率提升到57%;智能体执行进一步改善至66–73%,但计算成本上升。失败分析显示:剩余错误主要由物理观测量选择与配置不当造成,而非语法生成。结果表明:AI辅助辐射输运建模的未来进展,将同等程度地取决于机器可读知识库、精选的领域训练数据集与执行落地的评估环境,以及基础模型自身的进步。
