论文
CLORE:面向推理效率的内容级优化
CLORE: Content-Level Optimization for Reasoning Efficiency
摘要
强化学习后训练提升了大语言模型的推理能力,但常常产生不必要地冗长、重复或语义晦涩的推理轨迹。现有高效推理方法主要通过显式预算或长度感知奖励来调控回复长度,使中间推理内容处于弱监督状态。我们提出CLORE,一个内容级优化框架,通过编辑正确的on-policy rollout来提升推理效率。CLORE使用一个外部增强模型删除重复片段、难以辨认或与任务无关的内容,以及在解已确立之后的多余推理,同时保留最终答案。所得的增强-原始配对在标准策略梯度训练之外,还以辅助的无参考DPO目标进行优化。通过把增强限定在正确轨迹上并执行局部删除,CLORE使编辑后的rollout保持接近策略分布,缓解off-policy失配。在DeepSeek-R1-Distill-Qwen-7B和Qwen2.5-Math-7B上、跨五个数学推理基准的实验表明,CLORE改善了准确率-效率权衡,并与GRPO、DAPO、Training Efficient和ThinkPrune保持兼容。内容级分析进一步显示,CLORE减少了重复推理、晦涩内容与答案后的多余探索,支持内容级监督作为长度级控制的互补方向。
