论文
超越惩罚错误:经自适应仅正确奖励稳定大推理模型的效率训练
Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards
摘要
训练大语言模型高效推理是关键挑战。虽然把长度惩罚奖励整合进组相对策略优化(GRPO)旨在减少冗长——但它频繁触发奖励坍缩——严重退化推理能力。经对多种奖励配置的系统评估——我们识别根本机制:GRPO的组归一化在错误答案收到持续长度惩罚时产生发散优势。因此——惩罚错误答案长度的方法在持续优化下结构性易坍缩。此外——把惩罚仅限于正确答案避免了这一主要失败——但使模型易受响应过度压缩驱动的随机坍缩影响。为稳健防止两种失败模式——我们提出ACOER(自适应仅正确效率奖励)。ACOER通过把简洁奖励隔离到正确补全来消除结构性惩罚回路——并经动态预算归一化与控制回路惩罚调整防止随机压缩。跨多样数学推理基准评估——ACOER较基座模型提升整体准确率——同时token生成减少超60%——确立了效率感知优化的根本稳定方法。
