论文
CLP:零损失自适应多词元推理的搭配长度预测
CLP: Collocation-Length Prediction for Zero-Loss Adaptive Multi-Token Inference
摘要
大语言模型 推理受到自回归解码的瓶颈,其中每个词元都需要完整的前向传递。多词元预测 (MTP) 提供了一条有希望的加速路径,但现有方法存在一个基本的架构缺陷:第一个词元的 MTP 头与主干网自己的语言模型 (LM) 头竞争,导致接受预测时质量严重下降。我们认为这种头骨竞争是先前基于 MTP 的加速方法中重复且不连贯的输出的根本原因。为了解决这个问题,我们提出了 Backbone-as-Architect,这是一种设计原则,其中主干 LM 头始终生成第一个词元,而 MTP 头仅负责后续词元。在此原则的基础上,我们引入了 CLP(搭配长度预测器),这是一个轻量级的跨度决策层,可预测每个解码步骤可以安全接受多少个附加词元。 CLP 仅使用单个线性层(4.6K--7.7K 参数),取代了先前工作中使用的过度设计的 1M 参数门网络。在 Qwen2.5 模型(0.5B、1.5B、7B)上的实验表明,CLP 在 1.5B 上实现了 1.20x--1.29x 加速,在 7B 上实现了 1.14x--1.20x 加速,并且质量退化为零(重复率 < 0.02),而基于门的方法无法加速(1.07x)或产生严重退化的输出(重复率 > 0.5%)。我们进一步证明,较短的预测范围 (k=2) 在大型模型上恢复了 24% 的 MTP 头部精度,建立了缩放感知设计原则。我们将 MTP 头部预测精度确定为对加速的约束约束,并为未来的改进建立了清晰的路线图。