论文

SOMA:通过小语言模型进行高效多轮 LLM 服务

SOMA: Efficient Multi-turn LLM Serving via Small Language Model

AI 基础设施推理服务

摘要

大语言模型 (LLM) 越来越多地部署在多轮对话环境中,在这些环境中,跨轮保存对话上下文至关重要。标准的服务实践会在每个回合连接完整的对话历史记录,这可靠地保持了一致性,但会在延迟、内存和 API 支出方面产生大量成本,特别是当查询路由到大型专有模型时。现有方法常常难以平衡响应质量和效率之间的权衡。我们提出了一个框架,利用会话的早期轮次来估计局部响应流形,然后在对话的其余部分中针对该局部区域调整较小的代理模型。具体来说,我们学习软提示,最大化大语言模型和代理小语言模型对表面最不对齐局部方向的响应之间的语义分歧,通过抗退化控制稳定训练,并将挖掘的案例提炼为本地化 LoRA 微调,以便代理在推理时无需提示即可运行。一个简单的门可以实现一次性切换并在漂移时回滚。我们进一步对 SOMA 中的关键组件进行了理论分析。大量实验证明了 SOMA 的有效性。源代码位于:https://github.com/LabRAI/SOMA。