论文
Anti-Length Shift:训练高效推理模型的动态异常截断
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
摘要
借助可验证奖励强化学习增强的大型推理模型通过延长思维链取得了显著的性能提升。然而,这一范式带来可观的部署成本,因为模型常在简单问题上表现出过度冗长。依赖显式长度惩罚的现有高效推理方法往往引入优化冲突,且对驱动过度思考的生成机制基本未加考察。本文识别出一种称为长度漂移(length shift)的现象:训练过程中模型对琐碎输入越来越多地生成不必要的推理。为此,我们提出动态异常截断(DOT),一种在训练期选择性抑制冗余token的干预手段。该方法只针对完全正确rollout组内响应长度的极端尾部,同时为复杂问题保留长程推理能力。为补充这一干预并确保稳定收敛,我们进一步引入辅助KL正则化和预测性动态采样。跨多个模型规模的实验结果表明,我们的方法显著将效率—性能Pareto前沿向外推移。值得注意的是,在AIME-24上,与初始策略相比,我们的方法在将推理token用量降低78%的同时提高准确率,并超越最先进的高效推理方法。
