论文
Witness Overlap:用第三个检查点识别开放权重模型的继承方向
Witeness Overlap: Directional Provenance Inside Open-Weight Model Families
摘要
开放权重模型经常经历发布、微调、对齐、合并和再次发布,因此溯源审计不仅要判断检查点是否相关,还要判断哪个检查点在先。许多现有溯源方法针对已知底座的审计:给定受害或来源模型,测试疑似模型是否与其相关。虽然这类审计表述为从来源到疑似模型的测试,其证据往往是对称的,包括表示相似性、权重相似性、行为指纹和相关统计。对称的两两比较能够检测关联,却不能单独确定检查点A与B的关系方向。因此,我们引入局部几何比较:不直接比较两个检查点,而是加入同家族的第三个检查点作为见证,比较各候选端点周围的几何结构,以哪个候选更像分支父节点来推断方向。基于这一思路,以及以父节点或子节点为锚点的见证重叠分布在实验中的不对称性,我们提出Witness Overlap,一种无需提示、无需训练的方向性溯源白盒测试。在16个家族的176个LLM检查点上,单见证测试使用Frobenius余弦正确确定95.3%的父子关系方向。我们还评估根节点识别、兄弟节点区分、向VLM和扩散模型家族的泛化以及链式排序。该信号对权重噪声和稀疏剪枝具有鲁棒性;提出的SVD权重降维变体比Frobenius余弦更稳健。