论文

CLORE:面向推理效率的内容级优化

CLORE: Content-Level Optimization for Reasoning Efficiency

模型训练偏好优化强化学习RLVR

摘要

强化学习后训练提升了大语言模型的推理能力,但常常产生不必要地冗长、重复或语义晦涩的推理轨迹。现有高效推理方法主要通过显式预算或长度感知奖励来调控回复长度,使中间推理内容处于弱监督状态。我们提出CLORE,一个内容级优化框架,通过编辑正确的on-policy rollout来提升推理效率。CLORE使用一个外部增强模型删除重复片段、难以辨认或与任务无关的内容,以及在解已确立之后的多余推理,同时保留最终答案。所得的增强-原始配对在标准策略梯度训练之外,还以辅助的无参考DPO目标进行优化。通过把增强限定在正确轨迹上并执行局部删除,CLORE使编辑后的rollout保持接近策略分布,缓解off-policy失配。在DeepSeek-R1-Distill-Qwen-7B和Qwen2.5-Math-7B上、跨五个数学推理基准的实验表明,CLORE改善了准确率-效率权衡,并与GRPO、DAPO、Training Efficient和ThinkPrune保持兼容。内容级分析进一步显示,CLORE减少了重复推理、晦涩内容与答案后的多余探索,支持内容级监督作为长度级控制的互补方向。

CLORE:面向推理效率的内容级优化:论文配图
图 1:CLORE 概述。现有的基于长度的高效推理方法可以调节响应长度,但无法去除低质量的推理内容。 CLORE 通过增强正确的轨迹来删除重复、难以辨认和无信息的推理片段,同时保持与现有高效 RL 训练方法的兼容性,从而提高推理效率。