论文

K-Forcing:通过前推语言模型联合 Next-K-Token 解码

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

模型推理推理加速

摘要

自回归 (AR) 语言建模是文本生成的主导范式,但其逐个词元的顺序解码导致推理内存受限且效率低下。现有的加速方法,例如 推测解码 和扩散语言模型,可以在某些条件下产生加速,但不能直接解决高负载批量服务——这是工业规模部署最关键的场景。我们引入了 K-Forcing,一种用于联合 next-k-token 解码的前推语言建模范例。 K-Forcing 将现有的 AR 模型提炼为条件前推映射,即在一次前向传递中将独立的均匀噪声变量转换为多个未来标记的联合样本。该设计保留了固定长度的输出,重用了 AR 教师主干网,并与标准 AR 服务基础设施保持兼容。我们通过渐进式自强迫 蒸馏 来训练这种映射,它逐渐扩大预测窗口,同时使学生能够紧密匹配 AR 老师的序列分布。我们使用标准因果 Transformer 主干来评估 LM1B 和 OpenWebText 上的 K-Forcing。当积极配置为每次前向传递生成 k = 4 个词元时,K-Forcing 在不同批量大小下提供大约 2.4-3.5 倍的加速,同时相对于 AR 老师,会产生适度的质量下降。随着推理越来越主导现代 LLM 的生命周期计算成本,K-Forcing 提供了一条在现实世界高负载部署下加速 AR 生成的有前途的途径。