论文

从混合模型的角度重新思考 LLM 集成

Rethinking LLM Ensembling from the Perspective of Mixture Models

模型推理推理加速

摘要

模型集成是一种完善的技术,用于提高机器学习模型的性能。传统上,这涉及对多个模型的输出分布进行平均并选择最可能的标签。这个想法自然地扩展到了 大语言模型 (LLM),提高了性能,但产生了大量的计算成本。这种低效率源于直接将传统的集成实现应用于 LLM,这需要每个模型单独的前向传递来显式计算集成分布。在本文中,我们提出了类混合模型集成(ME)。通过将集成重新解释为混合模型,ME 在每一步随机选择一个模型来生成下一个标记,从而避免了显式计算完整集成分布的需要。 ME 在数学上相当于从集成分布中采样,但只需要调用一个模型,使其比传统集成快 1.78 倍至 2.68 倍。此外,这个视角将 LLM 集成和 词元级 路由方法联系起来,表明 LLM 集成是路由方法的特例。我们的研究结果为高效 LLM 集成开辟了新途径,并激励进一步探索 LLM 的 词元级 路由策略。我们的代码可在 https://github.com/Kamichanw/Mixture-model-like-Ensemble 获取。