论文
理解并缓解过早自信以改进LLM推理
Understanding and Mitigating Premature Confidence for Better LLM Reasoning
摘要
当前语言模型的长思维链(CoT)常包含逻辑断层和缺乏依据的跳跃,限制了额外测试时计算带来的收益。直接改进推理质量需要过程奖励模型,但训练它们所需的步骤级标注昂贵且稀缺。我们在模型推理过程中置信度的演化方式中找到了这样一种信号:过早自信,即倾向于早早敲定答案并用剩余Token为其辩解,能在不同任务和模型规模上强烈预测有缺陷的推理。我们将其用于渐进置信度塑形,这是一种强化学习目标,训练模型在推理过程中更新置信度而非过早敲定——奖励置信度的逐步增长、惩罚过早承诺,且无需外部标签或奖励模型。该方法在1.5B到8B参数规模上提升了算术(Countdown)、数学(DAPO、AIME)和科学(ScienceQA)任务的准确率与推理质量:在Countdown上准确率提升3.2倍(+42.0个百分点),有缺陷推理下降48个百分点;在AIME上Pass@64提升6.6个百分点。与该机制一致,该方法还改善了忠实度:在一个安全基准上,我们的模型会在推理轨迹中更透明地呈现误导性内容,而非将其隐藏。受控实验表明,问题与其补救措施同步扩展:过早自信随模型规模和任务难度增长,而应对它所带来的收益也随之增长。