论文
自组织语言模型:利用语义依赖实现高效推理
Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference
摘要
大型语言模型(LLMs)展现出出色能力,但其部署面临显著的效率挑战。自回归解码导致推理延迟高且在小批量场景下硬件加速器利用率低。离散扩散模型可并行生成,但缺乏足够扩散去噪步骤时难以匹配自回归模型的质量。长上下文推理产生内存瓶颈,甚至使最先进的加速器也力不从心。我的观点是,语言模型可以通过标注语义依赖——即哪些token依赖于其他token——来自主决定其推理执行策略。我将此类模型称为自组织语言模型。针对每个系统,我设计了运行时机制,基于这些语义依赖信息实现自回归解码的并行化、中间上下文的驱逐,或生成去噪顺序,从而实现质量与效率之间的帕累托最优权衡。我通过三个自组织系统验证该方法:首先,PASTA利用语义依赖实现自回归解码的并行化,通过训练模型标注哪些输出块可独立生成;其次,TIP利用语义依赖从KV缓存中驱逐中间推理步骤,降低内存消耗同时保持准确率;第三,Planned Diffusion利用语义依赖为离散扩散模型推导去噪顺序,通过自回归生成一个计划,指定哪些块并行去噪。
