论文

长上下文监督实际上走向何方?有效情境暴露平衡

Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing

模型训练预训练

摘要

长上下文适应通常被视为窗口缩放,但这忽略了 词元级 监督不匹配:在使用文档屏蔽的打包训练中,每个目标标记的有效上下文仍然很短。我们引入了 EXACT,这是一种监督分配目标,它通过长尾内的逆频率为长有效上下文目标分配额外的权重。在 7 个 Qwen/LLaMA CPT 配置中,EXACT 改进了所有 28 个经过训练/推断的 NoLiMa 和 RULER 比较。在 Qwen2.5-0.5B 上,NoLiMa 提高了 +10.09(经过训练)和 +5.34(推断);标尺+10.69 和+5.55。在 LLaMA-3.2-3B 上,RULER 提高了 +17.91 和 +16.11。保留标准 QA/推理(六个基准的宏观变化+0.24)。距离分辨探测表明,当证据距离数千个词元远时,就会产生增益,而短案例保持不变。结果支持以监督为中心的论点:长上下文适应取决于训练监督长上下文预测的强度。