论文
我们的模型是基于哪些模型构建的?审计现代 LLM 中的隐形依赖关系
Which Models Are Our Models Built On? Auditing Invisible Dependencies in Modern LLMs
摘要
现代 LLM 训练管道越来越依赖其他模型来生成数据、过滤语料库、判断输出和指导开发决策。这些依赖关系是递归的:模型可能依赖于上游工件,其自身的依赖关系仅记录在单独的版本和工件中。结果,完整的依赖结构分散在异构的公共工件中,其复杂性和递归深度远远超出了人类的追踪能力。我们引入了 ModSleuth,这是一个代理系统,它可以从具有源证据的公共工件中递归地重建 LLM 依赖图。我们发现主要的挑战不再是信息提取,而是定义依赖关系的构成以及协调不一致文档中的工件引用。我们通过区分直接和间接依赖关系的形式化来应对这些挑战,通过以操作为中心的关系来表示异构管道角色,并解决跨名称、版本和存储库的工件身份。将 ModSleuth 应用于四个公共工件丰富的 LLM 版本,我们恢复了 1,060 个经过源验证的依赖项,并构建了现代 LLM 开发的大规模依赖关系图。这些图表揭示了多跳许可义务、训练评估耦合、发布和训练时间工件之间的差异,以及难以发现的文档不一致。我们发布了 ModSleuth 和由此产生的依赖图,以支持对现代 LLM 背后日益复杂的生态系统的透明分析。