论文

超越惩罚错误:经自适应仅正确奖励稳定大推理模型的效率训练

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

模型训练强化学习RLVR

摘要

训练大语言模型高效推理是关键挑战。虽然把长度惩罚奖励整合进组相对策略优化(GRPO)旨在减少冗长——但它频繁触发奖励坍缩——严重退化推理能力。经对多种奖励配置的系统评估——我们识别根本机制:GRPO的组归一化在错误答案收到持续长度惩罚时产生发散优势。因此——惩罚错误答案长度的方法在持续优化下结构性易坍缩。此外——把惩罚仅限于正确答案避免了这一主要失败——但使模型易受响应过度压缩驱动的随机坍缩影响。为稳健防止两种失败模式——我们提出ACOER(自适应仅正确效率奖励)。ACOER通过把简洁奖励隔离到正确补全来消除结构性惩罚回路——并经动态预算归一化与控制回路惩罚调整防止随机压缩。跨多样数学推理基准评估——ACOER较基座模型提升整体准确率——同时token生成减少超60%——确立了效率感知优化的根本稳定方法。

超越惩罚错误:经自适应仅正确奖励稳定大推理模型的效率训练:论文配图
图 1:Acoer 框架概述。针对已识别的崩溃路径的三种机制:(1)仅正确信号(β=0\beta{=}0)消除了 β\beta 环(路径 1); (2) 自适应预算标准化跟踪正确答案长度的指数移动平均值 (EMA),防止反馈失控; (3) 控制环 α\alpha 自适应在精度下降时缓解效率压力,从而防止路径 2(正确答案压缩)。