论文

BeamPERL:可验证奖励的参数高效 RL 让紧凑 LLM 专业化于结构化梁力学推理

BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning

模型评测模型训练强化学习鲁棒性、公平性与可信度评测RLVR

摘要

带严格可验证奖励的强化学习能教会紧凑语言模型进行物理推理,还是主要学会模式匹配到正确答案?我们以梁静力学这一经典工程问题训练 1.5B 参数推理模型来研究该问题,使用符号求解器给出二元正确性奖励的参数高效 RLVR,不用教师生成的推理轨迹。最佳 BeamPERL 检查点较基座模型 Pass@1 提升 66.7%。然而习得的能力是各向异性的:模型能组合泛化(更多载荷),却在需要相同平衡方程的拓扑变化(支座移动)下失败。中间检查点产生最强推理,而持续优化在维持奖励的同时降低稳健性。这些发现揭示结果级对齐的关键局限:用精确物理奖励做强化学习诱导出程序化解题模板,而非对控制方程的内化。奖励信号的精确性——即便解析上精确——本身并不能保证可迁移的物理推理。我们的结果表明,可验证奖励可能需要与结构化推理脚手架配合,才能超越模板匹配走向稳健的科学推理。

BeamPERL:可验证奖励的参数高效 RL 让紧凑 LLM 专业化于结构化梁力学推理
图1:定义在一维区域 x ∈ [ 0 , L ] x\in[0,L] 上的简支梁示意图,其中 x x 表示沿梁的轴向坐标, L L 为梁长。梁由位于 x pin ∈ [ 0 , L ] x_{\text{pin}}\in[0,L] 处的固定铰支座与位于 x roller ∈ [ 0 , L ] x_{\text{roller}}\in[0,L] 处的滚动支座支撑,且 x pin ≠ x roller x_{\text{pin}}\neq x_{\text{roller}} 。梁承受 N N 个横向集中荷载 P i P_{i} ,作用位置为 x i ∈ [ 0 , L ] x_{i}\in[0,L] ,满足 x i ≠ x j ∀ i ≠ j x_{i}\neq x_{j}\;\forall\;i\neq j ,其中 i = 1 , … , N i=1,\dots,N ;在本示意图中 N = 2 N=2 。