论文
AsymSpec:面向Agentic LLM的上下文非对称投机解码
AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
摘要
随着上下文在检索、工具使用和多轮交互中不断累积,Agentic LLM管线面临不断攀升的推理成本。为控制延迟,部署中通常会压缩输入,但这会损害任务准确率。投机解码(SD)能无损地加速生成,但它假定草稿模型与验证模型共享完全相同的上下文,这使SD无法化解准确率与开销之间的权衡。我们提出AsymSpec,一个打破这种对称性的非对称投机解码框架:轻量草稿模型读取完整输入,而大型验证模型在压缩视图上运行。草稿模型通过logits的对比性δ融合引导验证模型,并由一个分歧感知接受门控进行调制,以保持验证稳定性和较高的草稿接受率。在四项agentic能力和两个端到端智能体基准上的评估显示,AsymSpec平均达到全上下文准确率的约90%,在孤立的文本能力上以0.2–0.3倍的计算成本带来1.3–1.7倍的吞吐提升。这些结果表明,恰恰在压缩丢弃关键推理信号的情形下,非对称上下文访问能带来可观收益。
