论文

QLPO:面向长度感知策略优化的象限加权采样

QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

模型训练强化学习RLVR

摘要

近年来,大型推理模型在强化学习(RL)过程中往往会生成长思维链响应,导致高推理延迟与高部署成本。现有的响应长度控制方法通常依赖显式长度惩罚或额外控制模块,需要精细调参,且可能损害推理质量。我们提出 QLPO(Quadrant-weighted Sampling for Length-aware Policy Optimization),一种基于重采样的简单 GRPO 变体,在不修改奖励函数的情况下引入隐式长度控制。QLPO 首先过量生成候选响应,然后在保持经验性正确/错误比例的同时偏向短的正确响应和长的错误响应,对训练组进行重采样。这重塑了训练分布,并隐式地鼓励模型生成更短的输出。在从 1.5B 到 32B 参数的一系列模型上,包括基座模型和强推理模型,QLPO 一致地改进了准确率-长度权衡。它在保持推理性能的同时,将响应长度减少 30% 至 70%。这些结果表明,结构化重采样为实现高效推理提供了一种有效且稳健的方法。

QLPO:面向长度感知策略优化的象限加权采样:论文配图
图 1:准确度-长度领域中不同方法的优化路径的概念图。