论文

重新思考模型效率:大型模型的多智能体推理

Rethinking Model Efficiency: Multi-Agent Inference with Large Models

模型推理推理加速

摘要

大多数视觉语言模型 (VLM) 应用 大语言模型 (LLM) 作为解码器,其中响应标记是通过自回归顺序生成的。因此,输出词元的数量可能是端到端延迟的瓶颈。然而,不同的模型可能需要截然不同数量的输出词元才能实现可比较的性能。在这项工作中,我们对模拟数据上 VLM 不同组件的延迟进行了全面分析。实验表明,具有较少输出标记的大模型比具有长输出序列的小模型更有效。对各种现实世界基准的实证研究证实了这样的观察结果:大型模型可以与具有更少输出标记的小型模型相比获得更好或相当的性能。为了利用大型模型的效率,我们提出了一种多智能体推理框架,该框架使大型模型保持较短的响应,但在必要时从小型模型转移关键推理标记。基准任务的比较表明,通过重用小模型的推理标记,它可以帮助用自己的推理来接近大模型的性能,这证实了我们建议的有效性。