论文

面向视觉语言模型选择的有效路由器

An Effective Router for Vision-Language Model Selection

AI 基础设施模型网关

摘要

具有不同性能和资源需求的视觉语言模型 (VLM) 被广泛部署,使得用户很难从众多 VLM 候选者中选择最合适的一个。现有的工作揭示了语言模型中的性能悖论现象,并重点关注解决该问题的路由方法。然而,开发用于VLM选择的路由器仍然是一个关键且具有挑战性的问题,主要面临:1)缺乏专业数据,2)无效的特征表示,以及3)严格的模型空间和昂贵的适应。在本文中,我们构建了一个用于 VLM 选择的多模态数据集,其中包含 7 个主流 VLM 在 32,626 个独特图像文本查询上的输出。然后我们提出了 ARMS,一个用于 VLM 选择的路由器。 ARMS 通过 VLM 配置文件增强输入信号,采用简单但有效的架构来改进查询的表示和 VLM 功能。为了提高ARMS对新VLM的适应能力,我们提出了两种扩展训练策略:增量训练和独立训练。分布内和分布外测试集的实验结果证明了ARMS的有效性。特别是,使用我们的训练策略,ARM(大小仅为 800M)可以适应更广泛的 VLM 空间,并击败像 GPT-4o 这样规模大数百倍的商业模型。我们的代码、模型和数据集可在匿名存储库中找到。

面向视觉语言模型选择的有效路由器:论文配图
图 1. 在 VHELM Lee 等人 2024 年基准测试中,行模型回答错误但列模型回答正确的样本比例(%),显示了 VLM 之间的性能悖论。我们的动机