论文

用紧凑语言模型与物理验证探索反应堆控制

Agentic Physical AI toward a Domain-Specific Foundation Model for Nuclear Reactor Control

应用与实践行业应用

摘要

物理系统AI的主流路线是扩展通用基础模型以实现通用多模态推理,但在控制接口上面临根本障碍。近期基准表明,前沿视觉语言模型在基础定量物理任务上仅有50%—53%的准确率,可能维持语义合理性却违反物理约束。作者认为,这种输入不忠实不是单纯的规模不足,而是结构限制:以感知为中心的架构优化参数空间中的模仿,安全关键控制则要求对实际执行动作的结果作出保证。本文探索面向领域的基础模型路线,以紧凑语言模型作为Agentic Physical AI,并让策略优化由基于物理的验证而非感知推断驱动。作者在合成反应堆控制场景中训练3.6亿参数模型,将数据从10³条扩展至10⁵条,观察到通用模型中未出现的明显阶段变化:小规模系统表现为高方差模仿与严重尾部风险,较大规模模型则出现超过500倍的方差降低,执行行为趋于稳定。尽管训练对四类执行方式给予均衡样本,模型自主拒绝约70%的训练分布,并将95%的运行时执行集中在单组控制策略。学习到的表示可跨不同物理条件及连续输入模态迁移,无需修改架构。

用紧凑语言模型与物理验证探索反应堆控制 配图
图1:核反应堆控制的Agentic Physical AI整合框架。左:3.6亿参数模型的运行策略偏离均衡训练分布,随规模增加KL散度由0.18增至0.31,76%的动作集中于训练频率仅30%的single_b2策略,多组协同策略使用率为3.75%。中:以KOMODO模拟器中闭环执行能否在±1%—10%容差内达到目标功率定义成功,各规模进行2,000次独立验证。右:数据从1K扩至100K后,1%以内精度的成功率从26.2%增至92%,方差降低500倍、策略熵由1.38降至0.89,并以超过94%的成功率迁移至PyRK点堆动力学。课程先以继续预训练学习语法,再以LoRA进行任务条件化,数据扩展通过结果验证稳定策略。