论文
BeamPERL:可验证奖励的参数高效 RL 让紧凑 LLM 专业化于结构化梁力学推理
BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning
摘要
带严格可验证奖励的强化学习能教会紧凑语言模型进行物理推理,还是主要学会模式匹配到正确答案?我们以梁静力学这一经典工程问题训练 1.5B 参数推理模型来研究该问题,使用符号求解器给出二元正确性奖励的参数高效 RLVR,不用教师生成的推理轨迹。最佳 BeamPERL 检查点较基座模型 Pass@1 提升 66.7%。然而习得的能力是各向异性的:模型能组合泛化(更多载荷),却在需要相同平衡方程的拓扑变化(支座移动)下失败。中间检查点产生最强推理,而持续优化在维持奖励的同时降低稳健性。这些发现揭示结果级对齐的关键局限:用精确物理奖励做强化学习诱导出程序化解题模板,而非对控制方程的内化。奖励信号的精确性——即便解析上精确——本身并不能保证可迁移的物理推理。我们的结果表明,可验证奖励可能需要与结构化推理脚手架配合,才能超越模板匹配走向稳健的科学推理。
