论文
AgentSpec:推测解码 用于 LLM 代理的批量推理
AgentSpec: Speculative Decoding for Batch Inference of LLM Agents
摘要
基于 大语言模型 (LLM) 的代理应用程序通常会导致较长的响应时间。 推测解码 是一种很有前景的解决方案,可在不影响生成质量的情况下提高 LLM 代理的推理效率。然而,最先进的 推测解码 算法在大批量大小下表现出显着的速度下降,限制了它们在实际代理应用程序中部署的有效性。在这项工作中,我们首先对 LLM 代理的 推测解码 进行系统分析,并确定加速退化的两个主要因素:投机词元的高拒绝率和动态 词元预算 的利用不足。基于这些观察,我们提出了 AgentSpec,一种 推测解码 算法,它解决了 LLM 代理现有方法的局限性。 AgentSpec 结合了结构隔离的起草,将推测限制在代理工作流程中语义连贯的部分,减少了不相关语义路径的草稿,并实现了极低的拒绝率。此外,AgentSpec 采用冗余感知预算分配,利用代理级信息,在代理推理过程中更好地利用动态释放的 词元预算。我们在 vLLM 中四个不同 LLM 系列的五种不同工作负载和四种不同模型上实施和评估 AgentSpec。我们的结果证明了 AgentSpec 相对于最先进技术的优越性。