论文

AsymSpec:面向Agentic LLM的上下文非对称投机解码

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

模型推理上下文与知识投机采样上下文工程

摘要

随着上下文在检索、工具使用和多轮交互中不断累积,Agentic LLM管线面临不断攀升的推理成本。为控制延迟,部署中通常会压缩输入,但这会损害任务准确率。投机解码(SD)能无损地加速生成,但它假定草稿模型与验证模型共享完全相同的上下文,这使SD无法化解准确率与开销之间的权衡。我们提出AsymSpec,一个打破这种对称性的非对称投机解码框架:轻量草稿模型读取完整输入,而大型验证模型在压缩视图上运行。草稿模型通过logits的对比性δ融合引导验证模型,并由一个分歧感知接受门控进行调制,以保持验证稳定性和较高的草稿接受率。在四项agentic能力和两个端到端智能体基准上的评估显示,AsymSpec平均达到全上下文准确率的约90%,在孤立的文本能力上以0.2–0.3倍的计算成本带来1.3–1.7倍的吞吐提升。这些结果表明,恰恰在压缩丢弃关键推理信号的情形下,非对称上下文访问能带来可观收益。

AsymSpec:面向Agentic LLM的上下文非对称投机解码:论文配图
图1:AsymSpec 投机步骤。(a) 起草与验证:起草器 SS 读取 xfullx_{\text{full}}(logits aa,草稿 d1:Kd_{1:K})和 xcompx_{\text{comp}}(logits bb);验证器 LL 读取 xcompx_{\text{comp}}(logits tt)。(b) CDA 门控与 δ\delta 融合:随着全量与压缩表征分歧的增大,γeff​(i)\gamma_{\text{eff}}(i) 放宽;被接受的草稿被提交,否则输出 δ\delta 融合的 arg⁡max\arg\max。只有 SS 消费 xfullx_{\text{full}}。