论文
揭示长语境持续 预训练 的学习动态
Revealing the Learning Dynamics of Long-Context Continual Pre-training
摘要
现有的长上下文连续预训练(LCCP)研究主要集中在小规模模型和有限的数据体系(数百亿词元)上。我们认为,直接将这些小规模环境迁移到工业级模型可能会导致适应不足和过早终止训练。此外,当前的评估方法严重依赖下游基准(例如大海捞针),这往往无法反映内在的收敛状态,并可能导致“欺骗性饱和”。在本文中,我们首次使用工业级 Hunyuan-A13B(总参数 80B)对 LCCP 学习动态进行系统研究,跟踪其在 200B 词元训练轨迹上的演变。具体来说,我们提出了一个分层框架来分析跨行为(监督 微调 探测)、概率(困惑度)和机制(注意力模式)级别的 LCCP 动态。我们的研究结果表明:(1)海量数据扩展的必要性:数百亿个词元的训练机制不足以满足工业级 LLM' LCCP 的要求(例如,Hunyuan-A13B 在训练超过 150B 个词元后达到饱和)。 (2) 欺骗性饱和与内在饱和:传统的 NIAH 分数早期报告“假饱和”,而我们基于 PPL 的分析揭示了持续的内在改进,并与下游性能更紧密地相关。 (3) 训练稳定性的机械监控:检索头充当高效、低资源的训练监控器,因为它们不断变化的注意力分数可靠地跟踪 LCCP 进展并表现出与 SFT 结果的高度相关性。这项工作为工业级LLM的LCCP提供了全面的监测框架、评估系统和机理解释。