论文
BUDDY:用于自适应 大语言模型 推理的预算驱动动态深度路由
BUDDY: BUdget-Driven DYnamic Depth Routing for Adaptive Large Language Model Inference
摘要
大语言模型 (LLM) 由于其深度和参数规模而导致较高的推理成本。深度修剪可以通过跳过冗余的 Transformer 块来减少延迟,但现有方法 (i) 在特定于用户的计算预算下提供有限的控制,并且 (ii) 通常修复路由路径,无法适应解码期间上下文的增长。我们提出了 Buddy,一个预算驱动的动态深度路由框架。 Buddy 使用轻量级决策模块根据输入对中间层进行评分,并确定性地执行前 k 层以满足给定的预算。为了支持解码时间自适应,Buddy 重用第一层 KV 缓存作为低开销的全局上下文源,并在每次路由决策之前将其与最新的词元表示合并在一起。当未提供明确的预算时,可选的预算预测器会估计依赖于输入的计算级别以平衡质量和效率。 Llama-family 和 Qwen 模型上的实验表明,Buddy 具有强大的静态剪枝基线的竞争力,并且通常可以改善准确性与计算的权衡,同时独特地支持严格的预算控制、解码时间重新路由以及单个训练模型中的多个预算。