论文

ModelLakeFishing:百万级模型库的高效检索

ModelLakeFishing: Efficient Retrieval over Million-Scale Model Lakes

AI 基础设施AI 开发与运维平台

摘要

开放模型湖可能包含数百万个可重用模型,这使得为新数据集识别合适的模型成本高昂。我们提出了 ModelLakeFishing,一个模型检索框架,用于指定目标数据集、预测任务和评估指标的查询。它将元数据和历史评估整合到模型-数据集-任务证据图中,使用关系感知图编码器学习模型和查询嵌入,并使用分层可导航小世界 (HNSW) 搜索对模型嵌入进行索引。在查询时,HNSW 会检索 1,000 个候选模型,而无需对每个模型进行评分,之后训练侧任务先验对所请求指标的候选模型进行重新排名并返回前 10 个。我们使用三个根感知分割对 3,016,439 个模型和 247,803 个观察到的模型-数据集性能对进行评估,这些分割将测试性能边排除在表示学习和检索之外。 ModelLakeFishing 的平均合格查询 gold@10 为 0.2968,在29.68%的合格查询中,将已观测到的最佳模型检索进前10名,并使用相同的评分和重新排名程序保留了详尽基线的 gold@10 的 93.47%。给定预先计算的查询嵌入,检索和重新排名中位数需要 0.747 毫秒,第 95 个百分位数需要 1.102 毫秒。这些结果表明,可以从稀疏的相关证据中有效检索数百万个模型库。

ModelLakeFishing:百万级模型库的高效检索的原论文方法或结果图
图1:ModelLakeFishing总览。虚线以上内容离线计算一次,虚线以下针对每次查询运行。离线流程将异构模型平台元数据和稀疏性能证据转化为共享的模型—数据集—任务嵌入空间及HNSW索引。