论文

TokenPrint:用于语言模型溯源的校准token空间指纹

TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

模型评测评测方法与指标

摘要

确立语言模型的溯源信息——包括其基础检查点及可能的训练分布重叠——是仅靠元数据无法解决的治理难题。我们提出一种免训练指纹:用250个固定知识探针引出后期隐藏状态的top-k词表投影,再对解码后的token字符串计算Jaccard重叠进行比较。我们在来自九个家族、具有已记录关系的32个开放权重模型(0.6B–32B)上评估该方法。(1)相似度阶梯大体符合模型亲缘关系:在相同数据上独立训练的模型原始得分为0.48(词表校正后0.35),其次是共享基座的微调模型(0.39/0.33)、同一开发者的近亲模型(0.38/0.28),以及没有已记录关系的模型(0.22/0.17)。这一相同数据信号在三家机构、两种分词器家族和两类架构间持续存在,并在训练最初1%内、可测任务能力出现之前就已产生,表明共享训练数据的贡献超越了能力趋同。(2)作为最近邻式的谱系检索方法,该指纹对全部五个R1蒸馏模型都将已记录的精确基座排进前两位候选(平均排名1.8,MRR 0.60),其中包括一个从粗粒度元数据无法识别的数学特化基座。(3)深度消融显示谱系组判别力随靠近输出分布而增强,AUC从四分之一深度的0.72升至输出处的0.90;仅用前5个输出token仍保持AUC 0.87。(4)指纹在量化下保持稳定:int8下Jaccard相似度为0.92,int4下为0.82–0.85,而校准池中的最大跨模型相似度为0.81。我们发布探针、代码和指纹。

TokenPrint:用于语言模型溯源的校准token空间指纹:论文配图
图1:概览:每个模型回答250个固定的知识探针;在匹配深度处通过Jaccard重叠比较top-k token集合;成对得分依据有记录的模型关系进行校准。