论文

ReCrit:用于科学批评推理的转换感知强化学习

ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

模型训练强化学习

摘要

大语言模型 在批评者互动中可能会失败,不仅因为回答错误,而且还因为在用户批评后放弃了最初正确的科学解决方案。这在科学推理中尤其危险,因为用户批评可能会将有效答案变成错误答案。我们将评论家交互视为轮间正确性转换问题,而不是最终答案的准确性问题,并确定了三个挑战:转换意识、将有用的纠正与有害的阿谀奉承脱钩以及可扩展的采样轨迹。我们提出了 ReCrit,一个转换感知的强化学习框架,它将初始到批评的行为分解为四个象限:纠正、谄媚、稳健和边界。 ReCrit 奖励纠正和鲁棒性,惩罚阿谀奉承,并将持续错误视为弱边界信号。为了使交互训练变得实用,ReCrit 进一步使用动态异步转出和尾部自适应完成来减少转出等待。在三个科学推理基准(ChemBench、TRQA 和 EarthSE)上,ReCrit 将 Qwen3.5-4B 上的平均 Critic 准确率从 38.15 提高到 51.49,将 Qwen3.5-9B 上的平均 Critic 准确率从 45.40 提高到 55.59。消融表明,最终答案奖励几乎没有提供交互级别的增益,而转换感知奖励和象限权重则产生更明显的训练信号和更大的净批评阶段改进。该代码可在 https://github.com/black-yt/ReCrit 获取。