论文
Decode-Branch Transformer:将主Prefill路径与额外解码计算解耦
Decode-Branch Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation
摘要
随着大语言模型服务的请求日益增多,累积推理成本相对一次性的训练成本不断上升。在典型的服务中,提示词prefill并行执行且受计算限制,而自回归解码串行执行且受内存流量限制。常规的宽度或深度扩展会同时抬高两类成本,因为每一层新增参数都会在两个阶段被计算,并增大每个解码步需要读取的权重。我们转而追问:能否在保留覆盖整个提示词的主计算与单一KV缓存的前提下,把额外的可学习计算分配给续写预测。我们用Decode-Branch Transformer实现这一点。其主路径单独处理提示词并写入KV缓存;解码分支在prefill阶段被省略,仅从最后一个提示词位置起激活,在不写入状态、不影响主路径的情况下增加续写计算。两条路径共享注意力、MLP与输出矩阵,仅使用经轻量耦合的独立token嵌入。分组解码在两条路径间复用已加载的权重分块与主KV缓存,因此新增的算术量不会按比例增加占主导的内存流量或解码时延。在token数对齐的比较中,Decode-Branch在各架构与数据设置下均取得更低的验证损失。在MoE模型中,主路径与分支的专家扇出成为相互独立的旋钮,用于在提示词成本、解码成本与预测质量之间权衡。我们研究了两种专家分配方案——分别固定prefill计算或解码计算——并揭示了按阶段分配专家所带来的prefill—解码—质量三方权衡。