论文

通过文档重建构造长上下文RLVR训练任务

Document Reconstruction Unlocks Scalable Long-Context RLVR

模型训练上下文与知识强化学习合成数据上下文工程RLVR

摘要

这项方法从已有长文自动构造重建任务:抽走部分段落,在原位置放入占位符,再把抽出的段落作为打乱顺序的候选项。模型需要选择段落并恢复正确顺序,奖励可以依据原文中的段落身份与排列计算。 研究以Qwen和Llama模型检验该训练方式,在RULER与LongBench v2上观察到提升,并比较奖励设计、数据整理与训练配置。训练数据不需要额外手工编写长文问答,但具体训练收益仍由任务和配置决定。

图2:从原文构造缺失段落及正确顺序,形成可自动核验的重建任务。
Figure 2: Overview of the document reconstruction framework. Given a long document, we corrupt it by selecting some paragraphs and shuffle them as options. We train LLMs via RLVR to reconstruct the document by generating the option sequence by order.