论文

ICRL:用强化学习学会内化自我批评

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

模型训练强化学习RLVR

摘要

基于大语言模型的智能体会犯错,而批评(critique)往往能引导同一模型走向正确行为。然而,一旦移除批评,模型可能在同一查询上再次失败,这表明它并未将批评的指导内化为自身的基础能力。与此同时,冻结的批评者无法随时间提升其反馈质量,限制了迭代式自我改进的潜力。为解决这一问题,我们提出基于强化学习的自我批评内化学习(ICRL),一个从共享骨干联合训练求解器与批评者的新框架,旨在将批评引发的成功转化为求解器的独立能力。批评者依据求解器随后的性能增益获得奖励,从而激励其给出可操作的反馈。为解决有批评条件与无批评行为之间的分布偏移,ICRL引入分布校准重加权比率,选择性地转移与求解器自身提示分布相容的批评引导改进。此外,按角色的组优势估计稳定了两个角色间的联合优化。这些机制共同确保求解器学会在没有外部批评的情况下自我改进,而不是依赖有批评条件下的行为。我们以Qwen3-4B与Qwen3-8B为骨干,在覆盖智能体任务与数学推理的多样基准上评估ICRL。结果显示一致的改进:在智能体任务上平均比GRPO高6.4分,在数学推理上高7.0分。值得注意的是,学到的8B批评者与32B批评者相当,而使用的token少得多。代码可在 https://github.com/brick-pid/ICRL 获取。

ICRL:用强化学习学会内化自我批评:论文配图
图 1:批评可以将失败的轨迹转变为成功的修订,而训练应将这种修订行为内化到无批评的求解器中。