论文

谁构建了这个模型?基于权重空间谱指纹的大语言模型谱系追踪

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

模型评测模型行为与机制分析

摘要

开源权重大语言模型(LLM)越来越多地通过复杂的多阶段流程开发,形成反映模型来源、所有权与演化的复杂谱系关系。理解这些关系对模型溯源、治理与供应链完整性十分重要。在本工作中,我们研究大语言模型“生物识别”(类比人类生物识别)的概念,探究大语言模型是否仅在权重空间中、无需访问输入数据,就表现出可揭示其来源与谱系的内在指纹。我们将其形式化为谱系判别问题,区分独立来源、同系列与共享底座模型。为刻画这些关系,我们提出一个统一的几何指纹框架,从两个互补视角分析权重矩阵:(i)谱能量,由奇异值分布捕获,编码全局幅度模式;(ii)子空间对齐,通过子空间偏离量化,捕捉方向几何。我们的分析揭示了权重空间中清晰的结构相似性层级:谱能量能可靠区分独立训练的模型与不同模型家族,而子空间对齐可在密切相关的模型之间实现细粒度判别,包括数据集规模与后训练流程的差异。在110多个多样化的开源权重LLM对上的大量实验表明,权重空间几何为模型谱系提供了稳健且可解释的信号,支持粗粒度区域划分与共享底座模型内部的细粒度判别。

谁构建了这个模型?基于权重空间谱指纹的大语言模型谱系追踪:论文配图
图1:所提出的面向LLM谱系分析的几何指纹框架概览。给定模型权重矩阵,我们应用SVD将其分解为两种互补表示:(i) 谱能量(Σ),捕捉全局幅度模式并支持跨模型家族和规模的粗粒度判别;(ii) 子空间对齐(U),通过子空间对齐建模方向关系,并支持密切相关模型之间的细粒度区分。这些互补信号被统一为单一指纹,揭示层次化的模型关系,并支持权重空间中稳健的谱系追踪。