论文
隐式压缩正则化:RL后训练中经由内部更短分布的简洁推理
Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training
摘要
具有可验证奖励的强化学习可以改善 LLM 推理,但常常会导致过度思考,导致模型生成不必要的长推理轨迹。现有方法主要依靠长度惩罚或提前退出策略;然而,前者可能会降低准确性并导致思考不足,而后者则假设推理痕迹的大部分可以被安全地截断。为了获得没有这些限制的压缩信号,我们重新审视现有压缩方法的训练动态。我们观察到,长度与准确性的相关性最初是负的,但在压缩过程中不断增加,这表明较短的响应最初更有可能是正确的,但随着政策走向思考不足,逐渐失去这种属性。基于这一观察,我们将过度思考形式化:负相关表明过度思考,而正相关则表明思考不足。当过度思考时,最短的正确响应比预期的组平均响应长度短,这使得它们成为策略部署中已经存在的自然压缩目标。因此,我们提出\emph{隐式压缩正则化}(ICR),一种策略正则化方法,其压缩信号来自由推出组中最短正确响应引起的虚拟较短分布,引导策略走向简洁而正确的轨迹。训练动态表明,ICR 在压缩过程中保持了更好的长度与准确度相关性,这表明短响应与正确性保持更好的一致性,而不是倾向于思考不足。对三个推理主干和多个数学和知识密集型基准的实验表明,ICR 在保持或提高准确性的同时不断缩短响应,实现更强的准确性-长度帕累托前沿。
