论文

ModelLens:从无数模型中找到最适合您任务的模型

ModelLens: Finding the Best for Your Task from Myriads of Models

模型评测评测方法与指标

摘要

开源模型生态系统现在包含数十万个预训练模型,但为新数据集选择最佳模型越来越不可行:新模型和未基准数据集不断出现,使得从业者双方都没有先前的记录。现有方法仅处理这种野外环境的片段:AutoML 和可转移性估计从小型预定义池中选择模型,或者需要对目标数据集进行昂贵的每个模型前向传递,而模型路由则预设给定的候选池。我们介绍 ModelLens,一个用于野外模型推荐的统一框架。我们的主要见解是,公共排行榜交互虽然分散且嘈杂,但共同追踪出跨异构评估设置的隐式模型功能图集,这是一个足够丰富的信号,可以直接学习。通过学习模型-数据集-度量元组上的性能感知潜在空间,ModelLens 对未见过的数据集上未见过的模型进行排名,而无需在目标数据集上运行候选模型。在涵盖 47K 模型和 96K 数据集的 162 万条评估记录的新基准上,ModelLens 超越了单独依赖元数据或需要在目标数据集上运行每个候选数据的基准。其推荐的 Top-K 池在不同的 QA 基准测试中进一步将多种代表性路由方法改进高达 81%。对最近发布的基准的案例研究进一步证实了对文本和视觉语言任务的泛化。