论文

通过在线蒸馏减轻长度缩放税

Mitigating the Length-Scaling Tax with Online Distillation

摘要

强化学习 (RL) 训练后的长度缩放通常被视为推理能力提高的标志,尤其是在困难问题上,但也可能使对已解决问题的响应变得不必要的冗长。我们将这种副作用量化为长度缩放税(LST):已解决的查询的响应长度过多,而没有相应的准确性增益。为了减轻 LST,我们提出了长度自蒸馏(LSD),它将已解决的提示路由到策略上的蒸馏,并保留未解决的提示的原始 RL 目标。 LSD 使用在线策略的指数移动平均线作为其老师,不需要外部模型。我们发现 LSD 在多个变体中实现了与 RL 相当或更好的性能,同时大大抑制了简单查询的响应长度增长。 LSD 在单轮推理上将 LST 从 19.0% 降低到 -3.7%,在多轮 Agentic 任务上将 LST 从 31.4% 降低到 13.7%,这表明 LSD 有效地保留了简单查询上的简洁响应模式,同时支持 RL 训练后对困难查询的高效探索。