论文
LongRLVR:为长上下文推理增加可验证的证据奖励
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
摘要
可验证奖励强化学习通过任务结果改善大语言模型推理,但只奖励最终答案时,模型在长上下文任务中难以学会寻找并使用外部信息。本文指出,结果奖励对证据选择的指导过于稀疏,并从理论上分析这种学习困难。 LongRLVR在答案奖励之外增加稠密且可核验的上下文奖励,直接鼓励模型选中正确的证据段落。研究在Qwen与Llama模型以及RULER-QA、LongBench v2上检验该方法,发现其持续优于标准RLVR。例如,14B模型的RULER-QA成绩从73.17提高到88.90,LongBench v2从39.8提高到46.5。论文认为,明确奖励证据选择可以改善长上下文推理训练,并公开代码。
