论文

通过连续深度批处理的循环语言模型的深度自适应推理

Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

模型推理批处理与并行

摘要

循环语言模型的主要承诺是深度自适应推理。通过循环共享层块可变次数,模型可以对“简单”标记使用更少的计算,而对“困难”标记使用更多计算。然而,具有不同循环次数的词元不能共享统一的前向传递,因此不能由标准批处理系统(例如 vLLM)处理。因此,深度自适应推理的实用价值取决于批处理能否高效。我们通过连续深度批处理 (CDB) 引入了第一种有效的深度自适应循环 LM 方法,该方法在循环步骤之间形成新批次。我们的方法动态调度架构的循环和非循环部分,管理循环 KV 缓存,并提前预测哪些词元将退出循环,以便它可以异步准备批次。 Ouro 1.4B 和 Huginn 3.5B 上的实验表明,完全循环架构最适合深度自适应推理,因为循环核心外部的大型非循环层(例如词元嵌入、LM 头和非共享 Transformer 块)会减慢并使调度复杂化。总体而言,CDB 实现了高达 99% 的估计最大可用加速,进一步的增益主要取决于模型架构和退出行为。