论文
用紧凑语言模型与物理验证探索反应堆控制
Agentic Physical AI toward a Domain-Specific Foundation Model for Nuclear Reactor Control
摘要
物理系统AI的主流路线是扩展通用基础模型以实现通用多模态推理,但在控制接口上面临根本障碍。近期基准表明,前沿视觉语言模型在基础定量物理任务上仅有50%—53%的准确率,可能维持语义合理性却违反物理约束。作者认为,这种输入不忠实不是单纯的规模不足,而是结构限制:以感知为中心的架构优化参数空间中的模仿,安全关键控制则要求对实际执行动作的结果作出保证。本文探索面向领域的基础模型路线,以紧凑语言模型作为Agentic Physical AI,并让策略优化由基于物理的验证而非感知推断驱动。作者在合成反应堆控制场景中训练3.6亿参数模型,将数据从10³条扩展至10⁵条,观察到通用模型中未出现的明显阶段变化:小规模系统表现为高方差模仿与严重尾部风险,较大规模模型则出现超过500倍的方差降低,执行行为趋于稳定。尽管训练对四类执行方式给予均衡样本,模型自主拒绝约70%的训练分布,并将95%的运行时执行集中在单组控制策略。学习到的表示可跨不同物理条件及连续输入模态迁移,无需修改架构。
