论文
PAEC:面向RLVR中LLM推理的位置感知熵校准
PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
摘要
具有可验证奖励的强化学习(RLVR)改进了大型语言模型推理,但经常遭受快速的策略熵崩溃,即策略过早地集中在狭窄的高概率推理路径上。虽然全局熵正则化可以鼓励探索,但在所有令牌位置上统一增加熵对于长推理轨迹来说是低效的,其中许多令牌与决策无关。我们提出了位置感知熵校准(PAEC),这是一种令牌级熵管理框架,它根据本地前 p 熵和前两个候选竞争构建软掩模,并应用基于锚的下界惩罚来防止选定位置熵崩溃。对五个数学推理基准的实验表明,与强大的 RLVR 基线相比,PAEC 提高了宏观平均多数投票性能,并且在 AIME 类型的任务上有明显的收益。我们的结果表明,推理强化学习中的熵管理应该制定为对决策敏感位置的选择性探索分配,而不是统一的随机注入。
