论文
大型语言模型推理网络的最优模型激活策略
Optimal Model Activation Policies for Inference Networks of Large Language Models
摘要
大型语言模型(LLM)的最新进展使得它们成为自然语言处理(NLP)任务所必需的,并且它们的高推理成本激发了对成本性能权衡的研究。在实践中,多个专家大语言模型以集成模式或串联方式协同进行推理,但没有关于如何最好地使用可用模型的原则性方法。自适应方法可以将简单的查询路由到更便宜的大语言模型,将复杂的查询路由到功能更强大、成本更高的模型。然而,人们对如何最好地利用可用的专家模型缺乏清晰的理解。我们引入推理网络,这是一种基于图的框架,其中节点表示不同的 LLM,链接表示条件模型激活。推理网络设计问题是确定最佳拓扑,即使用最能解决成本性能权衡的模型的最佳方式。我们从一系列 LLM 专家的基本拓扑开始,每个专家都有不同的成本和不同的专业水平,这是通过模型置信度捕获的。我们制定了这些模型的最佳激活问题,以便在目标性能约束下最小化预期推理成本。对于这种特殊类型的推理网络,我们证明最佳激活策略具有阈值结构:首先查询成本最低的 LLM,仅当置信度低于定义的阈值时才调用成本更高的 LLM。对于判别任务,最优策略由一组阈值组成,每个类别一个阈值,而对于生成任务,最优策略由单个阈值组成。我们提供了一种结构化方法来计算阈值,以及两种任务类型的实用置信度估计机制。开源大语言模型的实验表明,在满足指定的性能预算的同时,成本大幅降低。