论文
ConSteer-RL:通过置信度感知强化学习在 大语言模型 中引导推理功能
ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning
摘要
可验证奖励的强化学习(RLVR)最近已成为提高 大语言模型 (LLM)推理能力的关键范例,但它仍然受到稀疏二元奖励及其对模型内部不确定性的无知的限制。在本文中,我们提出了 ConSteer-RL,这是一个简单而有效的框架,它将从模型对数概率导出的 词元级 置信信号集成到 RLVR 训练中。具体来说,在组相对策略优化(GRPO)框架的基础上,我们通过将每个词元的概率聚合为标量置信度分数并将其纳入基于意识的奖励塑造机制来构建信心感知奖励,该机制惩罚过度自信的错误,同时加强正确和自信的推理。实验结果表明,ConSteer-RL 始终优于强大的 GRPO 基线,在不同模型规模上实现了 2.3%-4.0% 的平均改进。