使用语义指纹对预训练语言模型元数据进行插补
Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting
摘要
托管在 Hugging Face 等平台上的预训练语言模型 (PTLM) 形成类似于软件依赖图的复杂谱系结构。然而,与传统的软件生态系统不同,PTLM 存储库通常由于缺少元数据(例如许可证、重用方法、管道标签、模型类型和训练库)而缺乏可靠的来源。为了解决这一差距,我们引入了语义指纹(SemFin),这是一种轻量级方法,它将 Hugging Face(HF)配置文件与模型存储库标签相结合,自动估算缺失的模型元数据字段并重建模型谱系链。我们在包含 317,133 个 PTLM 的大型数据集上评估 SemFin。我们的结果表明,配置文件通常对实例化和重用模型所需的技术要求进行编码,使它们能够作为模型重用的结构蓝图,特别是对于基于 Transformer 的架构。通过将这些配置文件与模型存储库标签相结合,SemFin 的性能显着优于现有的基于传播的插补方法,与 Graph Avg 和 Hub Avg 基线相比,预测精度分别提高了 31.4% 和 26.6%。重要的是,SemFin 还对 16.6% 的基于传播的方法失败的孤立模型进行元数据估算。应用 SemFin 对 167,089 个未标记模型缺失的重用方法和许可证元数据进行估算,结果表明,可追踪的重用方法链扩展了 75.9%,许可证谱系链扩展了 53.6%,揭示了 86 个以前不可见的重用方法模式,而不兼容的许可证模式的比例仅从 34.8% 增加到 36.8%。这些发现展示了自动生成的结构信号如何支持人工智能物料清单 (AIBOM) 的自动构建,帮助将元数据从容易出错的手动声明转换为直接从模型工件推断的信息。