论文

微调 量子场论小型推理模型

Fine-Tuning Small Reasoning Models for Quantum Field Theory

模型训练合成数据

摘要

尽管 大语言模型 (LLM) 在理论物理中的应用越来越多,但学术界很少探索在训练这些模型时如何发展特定领域的物理推理能力。为了研究这一点,我们对专门用于理论物理的小型(7B 参数)推理模型进行了第一个学术 微调 研究。由于训练此类功能所需的开源可验证训练数据很稀缺,因此我们开发了一个强大的数据生成管道,它既可以创建综合问题,又可以使现有的人类编写的问题适合 模型训练。我们选择量子场论 (QFT) 作为我们的主要领域,生成了 2,500 多个综合问题,以及来自 arXiv 和标准教学资源的精选人类适应问题。我们进行强化学习 (RL) 和监督 微调 (SFT) 实验,对性能增益进行基准测试并推广到其他物理领域。我们对 微调 之前和之后的模型链进行了广泛的分析,以了解推理错误在 RL 和 SFT 期间如何演变。最后,我们公开发布我们的数据管道、可验证的 QFT 训练数据以及 $\sim$2 亿的 QFT 推理轨迹词元。