论文

用Crosscoder进行跨架构模型差异分析:无监督发现LLM之间的差异

Cross-Architecture Model Diffing with Crosscoders: Unsupervised Discovery of Differences Between LLMs

模型评测模型行为与机制分析

摘要

模型差异分析(model diffing)即比较模型内部表示以识别其差异的过程,是发现新模型中安全关键行为的一种有前景的方法。然而,其应用迄今主要集中于比较基座模型与其微调版本。由于新发布的LLM往往采用全新架构,跨架构方法对于使模型差异分析广泛适用至关重要。Crosscoder是一种能够进行跨架构模型差异分析的方案,但此前仅被应用于基座与微调模型的比较。我们首次将crosscoder应用于跨架构模型差异分析,并引入Dedicated Feature Crosscoders(DFCs),一种旨在更好地隔离某一模型独有特征的架构修改。利用该技术,我们以无监督方式发现了若干特征,包括Qwen3-8B和Deepseek-R1-0528-Qwen3-8B中的中共对齐、Llama3.1-8B-Instruct中的美国例外主义,以及GPT-OSS-20B中的版权拒绝机制。总体而言,我们的结果有助于将跨架构crosscoder模型差异分析确立为识别AI模型间有意义行为差异的有效方法。

用Crosscoder进行跨架构模型差异分析:无监督发现LLM之间的差异
图2:标准 crosscoder 与 Dedicated Feature Crosscoder(DFC)的架构比较。在 DFC 中,特征字典在设计上被划分为三个互不相交的集合:Model A 独有的特征、Model B 独有的特征以及共享特征。每个模型的激活只能编码到其专属特征和共享集合,也只能从其专属特征和共享集合解码,从而在设计上强制实现架构层面的排他性。