论文

从元思到执行:面向可泛化且可靠LLM推理的认知对齐后训练

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

模型训练强化学习

摘要

当前的大语言模型后培训方法通过监督微调(SFT)和基于结果的强化学习(RL)来优化完整的推理轨迹。虽然有效,但更仔细的检查揭示了一个根本性的差距:这种方法与人类实际解决问题的方式并不相符。人类认知自然地将问题解决分解为两个不同的阶段:首先获取概括问题的抽象策略(即元知识),然后使它们适应特定的实例。相比之下,通过将完整的轨迹视为基本单位,当前的方法本质上是以问题为中心的,将抽象策略与特定问题的执行纠缠在一起。为了解决这种不一致问题,我们提出了一个认知启发的框架,该框架明确反映了两阶段的人类认知过程。具体来说,元思想链(CoMT)将监督学习重点放在抽象推理模式上,无需具体执行,从而能够获取可推广的策略。然后,置信度校准强化学习 (CCRL) 通过对中间步骤的置信感知奖励来优化任务适应,防止过度自信的错误级联并提高执行可靠性。四个模型和八个基准的实验表明,与标准方法相比,分布内和分布外分别提高了 2.19% 和 4.63%,同时减少了 65-70% 的训练时间和 50% 的token消耗,这表明将训练后与人类认知原理相结合不仅可以产生优异的泛化能力,还可以提高训练效率。

从元思到执行:面向可泛化且可靠LLM推理的认知对齐后训练
图1:我们的两阶段后训练框架概览,附一个来自 GSM8K 的具体示例。Stage 1(Meta-Knowledge Acquisition):教师 LLM 生成排除数值计算的抽象元思维(meta-thoughts),用于 CoMT 监督微调。Stage 2(Task Adaptation):经 CoMT 调优的模型进行 RL,奖励结合答案正确性与中间置信度分数(示例中高亮:对 9 的置信度与对 18 的正确性)。