论文
Off-Context GRPO:学习使用特权信息推理难题
Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
摘要
具有可验证奖励的强化学习 (RLVR) 改进了 大语言模型 中的推理。然而,典型的 RLVR 方法无法解决难题:当模型无法生成任何正确的解决方案时,它会接收 \textit{zero} 学习信号。在训练期间提供特权指导(例如解决方案前缀)可以通过引导模型转向{具有非零奖励的正确解决方案}来帮助克服这种学习悬崖。 {我们将这些生成轨迹称为 \textit{off-context}:它们是从包含特权指导的训练提示中生成的,而目标目标是由没有该指导的原始提示定义的。} {我们引入} Off-Context GRPO (OC-GRPO),这是 GRPO 的最小修改变体,它使用引导生成轨迹,但应用重要性校正的目标来引导更新回到原始的非引导目标,避免导致不稳定的未校正引导训练的不匹配。根据经验,我们的算法在标准数学推理基准上平均比普通 GRPO 实现了 3.8% 的绝对改进(13.7% 相对增益),而额外成本可以忽略不计。