论文

PolicyLong:按当前模型能力迭代构建长上下文训练数据

PolicyLong: Towards On-Policy Context Extension

模型训练合成数据

摘要

大模型上下文窗口的扩展受限于高质量长上下文数据不足。近期方法通过信息论验证合成具有真实长程依赖的数据,筛选能降低基础模型预测熵的上下文。然而,固定模型只做一次离线构建会造成离策略差距:静态筛选标准无法适应模型能力的变化,导致训练分布偏离当前模型。本文提出PolicyLong,将数据构建改为动态同策略过程。系统使用当前模型,反复执行熵计算、检索与验证等数据筛选步骤,使训练分布随能力变化,形成自适应课程。正例与困难负例都来自当前模型的熵分布,随模型共同变化,分别引导其利用有效信息、抵抗误导信息。在Qwen2.5-3B上,RULER、HELMET与LongBench-v2的实验显示,PolicyLong持续优于EntropyLong与NExtLong,较长上下文时收益更大,例如RULER的128K设置提高2.54分。这验证了同策略数据迭代的价值。