论文
Koa-action:利用生成式大语言模型进行快速一致的结构化决策
Koa-action: Fast and Consistent Structured Decision Making with Generative LLMs
摘要
行业应用程序通常需要低延迟分类,但当前的大语言模型 (LLM) 方法仍然不太适合延迟关键型应用程序。现有的提示和约束解码会产生冗长的多词元输出,需要昂贵的逐个词元生成,而基于编码器的模型可以实现更快的推理,但会牺牲任务灵活性。我们提出了 Koa-action,一个低延迟原子操作的框架——快速、单步决策,例如分类、语义端点、布尔检查和评分——制定为具有单词元输出的约束生成。通过引入原子标签标记并应用监督微调,我们的方法将分类简化为确定性的一步解码问题。在标准基准测试中,Koa-action 提供具有竞争力的准确性以及始终如一的低且稳定的延迟。在生产意图路由基准上,Koa-action 的准确率达到 85.5%,可与最强的前沿模型(Claude-4.8-Opus、Gemini-Pro-3.1)竞争,并领先于 GPT-5 和 Gemini-2.5-Pro,同时响应时间约为半秒,在相同的服务条件下比每个前沿模型快几倍(中位数可达约 7.5 倍)。与专用的单词元系统 Jev/TypeSafe 相比,Koa-action 在准确性方面具有竞争力,并且速度更快,同时还可以处理单标签文本系统无法处理的多模态输入和多标签输出。