论文
CurveRL:LLM 推理的原则性分布感知上下文重新加权
CurveRL: Principled Distribution-Aware Context Reweighting for LLM Reasoning
摘要
上下文或提示级重新加权已成为带有验证奖励的强化学习(RLVR)中的核心算法杠杆,用于提高 大语言模型 的推理能力,但确定最佳加权的原理仍然知之甚少。我们通过将即时重新加权制定为通过率函数空间中定义的效用函数的函数导数来解决这一差距,从而产生一个适应现有方案(包括 REINFORCE 和 GRPO)的统一最优性框架。在此最优性框架的基础上,我们提出了一种基于分位数坐标变换的分布感知提示重新加权方法,称为 CurveRL,其中分配给每个提示的权重不取决于通过率的绝对值,而是取决于其排名和密度,以反映学习动态中通过率的分布结构。跨多个基准的广泛实验表明,我们提出的 CurveRL 始终优于 GRPO 和其他 RLVR 基线。我们的研究将上下文分布控制确定为分析和设计即时重加权 RLVR 算法的原则轴。代码发布于 https://github.com/zhyzmath/CurveRL。