论文

HugSelect:用于基础模型选择的可解释的多标准决策支持框架

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

AI 基础设施AI 开发与运维平台

摘要

基础模型越来越多地被重用为软件组件,这使得模型选择成为关键的软件工程决策。当前的模型中心主要通过流行度指标来支持发现,通常忽略功能能力、操作限制和社区感知的质量。我们认为,基础模型选择应该被视为明确的、可审计的软件组件选择任务,而不是关键字搜索、流行度排名或不透明的对话建议。本文提出了 HugSelect,一种用于基础模型选择的可解释决策支持框架。 HugSelect 通过将存储库元数据、提取的功能能力以及从社区讨论中得出的感知质量属性组合到统一的管道中,构建了包含 71,274 个模型的知识库。它使用公开标准级别分数分解的加权加性模型对候选模型进行排名。我们通过管道验证、针对四个基于 LLM 的商业推荐系统(44 个场景)的比较案例研究、细粒度消融和探索性用户研究 (n = 10) 来评估 HugSelect。提取管道的功能特征 F1 得分为 0.801,质量属性映射的准确度为 0.84。 HugSelect 的模型级 Coverage@10 为 0.61,家庭级 Coverage@10 为 0.91,推荐质量与评估的商业系统相当,总体排名质量没有显着差异,同时提供稳定、可追溯、可检查的推理。 Ablation 证实功能特征是检索准确性的主要驱动力,初步的用户反馈表明该框架有用且直观。