论文
具有可验证物理的强化学习:后训练 LLM 具有持续奖励
Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards
摘要
偏微分方程 (PDE) 是科学和工程建模的基础,但构建可靠的数值求解器仍然是劳动密集型的,需要离散化方案、稳定性条件和边界处理方面的专业知识。最近的工作已经开始将偏微分方程求解构建为 大语言模型 (LLM) 的代码生成任务,但现有方法主要在推理时运行:依赖提示、调试、自我细化和测试时间扩展,而不是调整模型本身。与此同时,具有可验证奖励的强化学习已成为代码和数学推理的 后训练 范式,但其验证器通常是二进制的:编译器运行或测试通过。此类信号抛弃了科学正确性的分级结构,其中两个求解器可能都执行,但解算精度却存在数量级的差异。在这项工作中,我们介绍了 RLVP:具有可验证物理的强化学习,这是一个用于多 PDE 求解器代码生成的 RL 后训练 框架。 RLVP 通过混合验证器解决了这一可验证性差距:硬程序有效性检查确保了可执行性,而连续物理奖励则对函数空间准确性和偏微分方程残差一致性进行了评分。单一策略经过跨双曲、抛物线、椭圆和不可压缩流系统的不同偏微分方程系列的后训练。 RLVP 改进了 PDE 基准上的预训练和仅受监督的基线,并显示出零样本改进转移到保留的 PDE。我们证明,使用 RLVP 进行后训练的较小 LLM 可以优于提示分布内 PDE 求解器生成的前沿模型。经过训练的策略显示了数字主题中组合性的证据:它将从训练中使用的偏微分方程中学到的模板、时间步长方案和边界处理原语重新组合到生成的求解器中,以解决未见过的偏微分方程问题。