论文
SchemaFill:通过参数槽并行推测解码加速 LLM 工具调用
SchemaFill: Efficient LLM Tool Calling via Slot-Parallel Speculative Decoding
摘要
LLM 智能体通过生成结构化的 工具调用 与外部系统交互。给定用户请求、对话上下文和工具模式目录,工具调用模型必须选择工具并生成它们的参数,从而可能在单个响应中产生多个调用。标准自回归解码生成这些调用 token 到 token,从而导致涉及多个调用或许多参数字段的请求产生大量延迟。显式的参数结构提供了并行生成的机会,但稍后的参数值 可能依赖于前面的字段和调用,因此独立生成的值可能与目标模型的输出不同。我们提出了 SchemaFill,这是一个通过槽位并行推测解码进行高效 LLM 工具调用的框架。 SchemaFill 同时生成未来槽值作为候选值,无需预先了解实际调用序列或参数值。跨越多个字段和调用的候选者由实际输出前缀下的目标模型串联起来,形成验证。仅提交经过验证的 token,当候选人不同意时,目标会提供更正。这适用于目标验证,同时利用跨槽和调用的并行性。在 Glaive 和 BFCL 上,SchemaFill 的端到端吞吐量比自回归解码提高了 4.05$\times$。代码可在 https://github.com/Czzzk/SchemaFill. 获取
