论文

LLMSurgeon:大语言模型 的诊断数据混合

LLMSurgeon: Diagnosing Data Mixture of Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型(LLM)的预训练数据混合物构成了它们的“数字DNA”,塑造了模型行为、能力和故障模式。然而,这种组成很少被披露,这使得对数据组合或来源的事后审计变得困难。在这项工作中,我们形式化了$\textbf{数据混合手术(DMS)}$:仅给出从目标 LLM 生成的文本,估计其预训练语料库在预定义分类下的域级分布。我们提出了 $\textbf{LLMSurgeon}$,一个强大的框架,将 DMS 视为标签移位假设下的逆问题。 LLMSurgeon 不是直接聚合分类器输出,而是估计校准的 $\textit{soft}$ 混淆矩阵并解决约束逆问题以纠正系统域混淆并恢复潜在混合先验。为了进行评估,我们引入了 $\textbf{LLMScan}$,这是一个可验证配方的评估套件,由开源 LLM 构建,具有透明的预训练混合物。在 LLMScan 中,LLMSurgeon 在固定协议下以高保真度恢复域混合物。我们的工作提出了一种实用的事后方法,用于在不访问训练数据的情况下审核基础模型的数字 DNA。