论文

CoRA:可靠的思想链推理的置信度与基本原理的一致性

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

模型训练强化学习

摘要

思想链 (CoT) 推理可以提高 LLM 的性能,但当伴随的 CoT 基本原理看似合理但不完整或缺乏支持时,高答案置信度可能会产生误导。我们研究信心-基本原理对齐:模型对其承诺答案的信心是否由其生成的基本原理证明是合理的。我们引入了一个基于 GRPO 的强化学习框架,该框架联合奖励答案正确性、承诺答案概率和基于评分标准的理由支持,其中评分标准评估基础、连贯性、任务匹配以及与所选答案的联系,而不向法官透露标准答案。在使用三个开放权重 LLM 的 MedQA、MathQA 和 OpenBookQA 中,与未调整的检查点、SFT 和仅正确性 GRPO 相比,我们的方法将置信度-基本原理对齐误差降低了 26.51%,同时保持有竞争力的准确性并经常改进校准。这些结果表明,可靠的 CoT 推理不仅需要自信的答案,还需要实质性支持它们的基本原理。