论文

训练留下痕迹:用于语言模型谱系验证的中心残留签名

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

模型评测评测方法与指标

摘要

开放权重语言模型经过微调、量化、修剪和合并,但其来源通常没有记录。我们研究无数据的白盒谱系验证:仅凭权重可以揭示两个兼容的模型检查点是否共享祖先吗?剩余训练会在分支产品中产生共享的、与身份一致的组件,因此仅靠这种结构无法建立祖先。我们将其删除并比较残留块之间的检查点特定结构,产生针对独立检查点校准的对称谱系分数。在残差 MLP 和 GPT-2 基准上,该分数将微调、LoRA 合并、修剪和量化的后代与独立和蒸馏模型 (AUROC=1.0) 区分开来,区分参数继承关系和行为相似性。在功能保留检查点清洗实验中,权重空间基线失去余量或失败;我们的分数保持不变,并且比 GPT-2 上最接近的稳健基线快 76 倍。投影配对信号出现在六个语言模型家族及其他语言模型家族中,并且案例研究正确识别了 3 个相关和 7 个不相关的 LLaMA-2 公共检查点。总的来说,这些结果为兼容的开放权重语言模型检查点建立了一个被动的、无数据的来源信号