论文
MARS:启用自回归模型多词元生成
MARS: Enabling Autoregressive Models Multi-Token Generation
摘要
自回归 (AR) 语言模型每次生成一个标记的文本,即使在给定较早上下文的情况下连续标记是高度可预测的也是如此。我们引入了 MARS(Mask AutoRegreSsion),这是一种轻量级的 微调 方法,它教导指令调整的 AR 模型来预测每个前向传递的多个标记。 MARS 没有添加架构修改,没有额外的参数,并生成一个仍然可以像原始 AR 模型一样调用的单一模型,而不会降低性能。与 推测解码(在目标旁边维护单独的草稿模型)或多头方法(例如附加额外预测头的 Medusa)不同,MARS 只需要对现有指令数据进行持续训练。当每次前向传递生成一个词元时,MARS 在六个标准基准上匹配或超过 AR 基线。当允许每步接受多个词元时,它可以保持基线水平的准确性,同时实现 1.5-1.7 倍的吞吐量。我们进一步开发了用于批量推理的块级 KV 缓存策略,在 Qwen2.5-7B 上使用 KV 缓存实现了比 AR 高达 1.71 倍的挂钟加速。最后,MARS 支持通过置信度阈值进行实时速度调整:在高请求负载下,服务系统可以动态增加吞吐量,而无需交换模型或重新启动,为部署提供实用的延迟质量旋钮。