论文
WARP:用于恢复训练数据组合的权重空间分析
WARP: Weight-Space Analysis for Recovering Training Data Portfolios
摘要
基金会模型通常会向公众发布,但用于训练它们的数据配方(例如确定如何对不同源进行采样的域混合权重)却很少披露。这造成了访问不对称:研究人员研究生成的模型,但缺乏对生成模型的训练分布的可见性。先前用于推断训练数据的工作(例如成员推断)是在单个样本级别进行检测,因此无法表征训练语料库的全局组成。我们引入了 WARP,一个可以直接从发布的权重中恢复微调模型的训练混合物的框架。 WARP 使用模型合并在基础模型和微调模型之间进行插值,生成近似缺失训练轨迹的伪检查点,并暴露训练数据在权重空间中的几何足迹。从这些模拟足迹中,WARP 提取几何特征,并使用无参数 softmax 读数或在合成混合物上训练的 MLP 投影仪将它们映射到域比例。在 BERT 和 GPT-2 的对照实验中,WARP 恢复平均 MAE 分别低至 0.046 和 0.104 的域混合,优于隶属推理和能够访问真实训练轨迹的变体。