论文
通过物理模拟器上的强化学习解决物理奥林匹克竞赛
Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
摘要
随着 DeepSeek-R1 的出现,我们见证了 LLM 推理能力的显着进步。然而,这一进步在很大程度上是由大量的互联网问答(QA)对推动的,这是未来的一个主要瓶颈,因为此类数据规模有限,并且主要集中在数学等领域。相比之下,物理学等其他科学缺乏大规模的 QA 数据集来有效训练具有推理能力的模型。在这项工作中,我们证明物理模拟器可以作为 LLM 物理推理训练的强大替代监督来源。我们在物理引擎中生成随机场景,从模拟交互中创建合成问答对,并使用强化学习对此合成数据进行训练 LLM。我们的模型展示了从零样本模拟到现实世界物理基准的迁移:例如,仅对合成模拟数据进行训练就可以将不同模型大小的 IPhO(国际物理奥林匹克)问题的性能提高 5-10 个百分点。这些结果表明,物理模拟器可以充当可扩展的数据生成器,使 LLM 能够超越互联网规模 QA 数据的限制,获得深入的物理推理技能。代码位于:https://sim2reason.github.io/。