论文
AdaMTP:多标记预测的自适应训练范式
AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction
摘要
多词元预测 (MTP) 已成为一种有效的范式,它通过辅助头增强共享 大语言模型 主干,训练模型并行预测多个未来词元,以丰富其监督信号并加速推理。然而,现有的训练框架采用严格的、固定长度的预测范围,忽视了自然语言和代码的高度不均匀的信息密度。迫使辅助头跨高熵语义边界进行预测会注入嘈杂、冲突的训练信号;由于这些头共享主干的潜在表示,因此产生的梯度会反向传播并干扰模型的核心功能。我们提出了 AdaMTP,这是一种自适应训练范例,可以动态地将预测范围与序列的内在可预测性对齐。其核心是,基于熵的分割算法利用基本模型来检测不确定性的突然激增作为语义边界,将序列划分为可变长度的组。每个词元都分配有一个自适应预测深度,动态屏蔽的 MTP 目标可以抑制跨越这些边界的预测损失,从而减弱导致骨干网络性能下降的噪声梯度。在数学推理、代码生成和三个主干网(Llama-3.1-8B、Qwen-2.5-7B、Gemma-3-12B)上的一般基准测试中,AdaMTP 在任务性能和推理加速方面始终优于标准 MTP。