论文

ExpThink:用于自适应思想链压缩的经验引导强化学习

ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

模型训练强化学习

摘要

大型推理模型 (LRM) 通过扩展的思想链 (CoT) 推理实现了强大的性能,但面临过度的词元消耗和高推理延迟的问题。现有的 CoT 压缩强化学习 (RL) 方法依赖于统一的静态长度惩罚,忽略了模型能力动态和问题级别难度变化。我们提出 \textbf{ExpThink}\xspace,这是一个通过两种互补机制解决两个维度问题的强化学习框架。首先,\emph{经验引导的奖励塑造}跟踪迄今为止为每个问题找到的最短正确解决方案,并应用三层奖励:对于简洁的正确答案给予满分,对于详细的正确答案给予折扣分数,对于不正确的答案为零。随着模型的改进,门槛自动收紧,形成自我进化的课程,无需人工调度。其次,\emph{难度自适应优势}用正确计数归一化取代标准差归一化,产生单调难度缩放的梯度,增强对困难问题的学习以保持准确性,同时抑制简单问题的梯度以鼓励简洁。这些机制共同强制执行准确性第一、压缩第二的训练目标。对多个数学推理基准的实验表明,\textbf{ExpThink}\xspace 将平均响应长度减少了 77%,同时提高了准确性,与普通基线相比,准确率-效率比(准确度除以平均标记数)提高了 3,并且在两个指标上都优于现有的基于 RL 的压缩方法。