论文

HMPO:思想链压缩的混合中位长度策略优化

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

模型训练强化学习

摘要

大语言模型 通过扩展的思想链 (CoT) 推理实现了卓越的性能,但这个漫长的过程会产生大量的推理开销。现有的 CoT 压缩方法面临着不灵活的手动长度预算、计算成本昂贵的多阶段训练管道以及仅限于小模型的脆弱的可扩展性。我们提出 HMPO(混合中值长度策略优化),一种经济高效的单阶段强化学习框架。 HMPO 通过三个协同组件有效地压缩 CoT:基于成功执行轨迹的自适应中值预算,以消除手动调整,用于平滑长度惩罚的余弦衰减词元奖励,以及通过严格优先考虑答案正确性来显着减轻琐碎 奖励作弊 的乘法奖励公式。 HMPO 专门接受数学数据训练,可无缝概括数学、代码、科学和指令跟踪任务。在密集和专家混合 (MoE) 架构中从 9B 参数扩展到 122B 参数的广泛实验表明,HMPO 实现了 19%--46% 的词元压缩,并且精度下降可以忽略不计,同时与现有的多阶段基线相比,大大降低了训练成本。