论文
元认知作为奖励:通过知识和调节信号强化 LLM 推理
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
摘要
最近的强化学习方法极大地提高了 LLM 的推理能力。现有的奖励设计主要遵循两种范式:(1)可验证奖励的强化学习(RLVR)从可执行检查或真值答案中得出结果信号,但为中间推理行为提供有限的指导。 (2) 奖励规则 (RaR) 超越了最终答案检查,使用自然语言规则来评估推理质量和任务合规性,但通常需要特定于实例的规则和大量的设计工作。为了解决这些问题,我们引入了元认知作为奖励(MaR),这是一个受元认知启发的强化学习框架,它通过两个一般过程维度指导 LLM 推理:i)元认知知识,它识别任务相关信息,无需手工制作特定于实例的规则;ii)元认知调节,它规划和调整推理过程,以提供超出最终答案结果的奖励指导。 MaR 将模型推广到显式元认知组件中,并通过对任务知识覆盖范围、监管保真度和最终答案正确性的轨迹级奖励来优化它们。通过这种方式,MaR 将奖励反馈扩展到推理轨迹,同时将奖励信号扎根于一般元认知维度。 22 个基准测试的实验表明,MaR 持续改进了模型性能,比基本模型提高了 7.7%,比普通 DAPO 提高了 11.0%。值得注意的是,Qwen3.5-9B + MaR 缩小了与前沿模型的差距,在总体平均水平上超过了 GPT-OSS-120B,并在多个单独的基准测试中优于更强的模型。过程级分析进一步显示推理过程质量的显着提高。 MaR 还推广到域外数据集,其中 MaR 训练的模型平均优于相应的基础模型。