论文
通过认知成对训练增强 LLM 元认知
Enhancing LLM Metacognition via Cognitive Pairwise Training
摘要
具有可验证奖励的强化学习(RLVR)已成为 LLM 推理的核心,但其结果级别的奖励可以使模型在证据或推理不可靠时更愿意给出自信的答案。现有的SFT或RL方法主要教导LLM在响应级别拒绝或表达不确定性,这可能会过度拟合放弃行为而不是提高推理可靠性。为了解决这个限制,我们提出了认知成对训练(CPT),这是一种认知中期训练对齐阶段,它将推理轨迹上的成对比较转化为可重复使用的对齐信号。通过学习区分可信推理和有缺陷的推理,CPT 鼓励模型内化推理质量区分边界,而不是记住表面的拒绝模式。在五个模型尺度和三个模型系列中,CPT 改进了推理与元认知的权衡。在 14B 时,CPT+RL 的性能比标准 SFT+RL 管道高出 +2.2 数学平均分和 +5.6 弃权 F1 分。进一步的分析表明,CPT 提高了跟踪质量,并在评估和训练设置中表现出强大的稳健性和可扩展性。代码和模型发布于https://github.com/Tsinghua-dhy/CPT。