论文
长上下文的训练-推理一致分段执行 LLM
Training-Inference Consistent Segmented Execution for Long-Context LLMs
摘要
由于全上下文注意力的计算和内存成本,基于 Transformer 的 大语言模型 在长上下文生成中面临着严峻的可扩展性挑战。在实际计算和内存限制下,许多推理高效的长上下文方法通过仅在推理过程中采用有界上下文或段级执行来提高效率,同时在全上下文注意力下继续训练模型,导致训练和推理执行以及状态转换语义之间的不匹配。基于这一见解,我们提出了一种训练-推理一致的段级生成框架,其中训练和推理遵循相同的段级前向执行语义。在训练期间,通过将梯度传播限制为从前一个片段继承的 KV 状态,同时允许在前向传播过程中特定于头的访问过去的 KV 状态,而不涉及梯度传播,从而强制执行与推理的一致性。在长上下文基准测试中,我们的方法实现了与全上下文注意力相当的性能,同时实现了与强大的推理高效基线相比的竞争性延迟内存权衡,并显着提高了超长上下文长度下的可扩展性(例如,与使用 FlashAttention 的全上下文注意力相比,128K 时的峰值预填充内存大约降低了 6 倍)。