论文

HyFunc:通过混合模型级联与动态模板化加速面向Agentic AI的LLM函数调用

HyFunc: Accelerating LLM-based Function Calls for Agentic AI through Hybrid-Model Cascade and Dynamic Templating

模型推理推理加速

摘要

尽管agentic AI系统依赖LLM将用户意图转换为结构化函数调用,这一过程充满计算冗余,导致高推理延迟,阻碍实时应用。本文识别并解决三类关键冗余:(1) 每次请求都冗余地处理庞大的函数描述库;(2) 冗余地使用大型慢速模型生成往往可预测的完整token序列;(3) 冗余地生成固定的样板参数语法。我们提出HyFunc,一个系统性消除这些低效的新框架。HyFunc采用混合模型级联:大模型将用户意图提炼为单个“软token”(soft token)。该token引导轻量检索器选择相关函数,并指示一个规模更小、经前缀微调的模型生成最终调用,从而避免大模型冗余的上下文处理与完整序列生成。为消除语法冗余,我们的“动态模板化”技术在扩展的vLLM引擎内即时注入样板参数语法。为规避潜在的泛化局限,我们在未见过的基准数据集BFCL上评估HyFunc。实验结果表明,HyFunc在效率与性能之间取得了出色平衡:其推理延迟为0.828秒,优于所有基线模型;性能达80.1%,超过所有参数规模相当的模型。这些结果表明,HyFunc为agentic AI提供了一种更高效的范式。我们的代码公开发布于 https://github.com/MrBlankness/HyFunc。

HyFunc:通过混合模型级联与动态模板化加速面向Agentic AI的LLM函数调用
图1:现有函数调用范式与我们提出的冗余削减(redundancy-reduced)范式之间关键差异的示意图。