论文
通过文档重建构造长上下文RLVR训练任务
Document Reconstruction Unlocks Scalable Long-Context RLVR
摘要
这项方法从已有长文自动构造重建任务:抽走部分段落,在原位置放入占位符,再把抽出的段落作为打乱顺序的候选项。模型需要选择段落并恢复正确顺序,奖励可以依据原文中的段落身份与排列计算。 研究以Qwen和Llama模型检验该训练方式,在RULER与LongBench v2上观察到提升,并比较奖励设计、数据整理与训练配置。训练数据不需要额外手工编写长文问答,但具体训练收益仍由任务和配置决定。
