论文

推理、奖励、改进:小语言模型中物理推理的结构化反馈的阶梯级错误纠正

Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models

模型训练奖励建模与过程监督

摘要

在小语言模型中,物理推理在结构上会失败:任何步骤的错误都会向前传播,破坏随后的每一个推理。有限的领域知识、多步推导下的幻觉以及分布敏感性加剧了这种失败。我们提出了一个阶梯级奖励框架,该框架可以识别第一个推理错误,生成有针对性的结构化反馈,并训练模型通过具有 KL 正则化的策略梯度修改其解决方案,而不将其暴露于 真值 解决方案作为生成目标。与依赖于注释的步骤级方法不同,不需要构建偏好数据,并且外部验证器仅在训练时运行。在五个物理基准中,我们的框架比 CoT 提示的准确度提高了 17-20%,比最强基线提高了 10-16%,将计算错误从 56.9% 减少到 23.5%,在最佳观察情况下将误解错误从 22.3% 减少到 12.0%。概念错误从 89.7% 减少到 68.7%,但在所有情况下仍然是最难的故障模式。