论文
用Crosscoder进行跨架构模型差异分析:无监督发现LLM之间的差异
Cross-Architecture Model Diffing with Crosscoders: Unsupervised Discovery of Differences Between LLMs
摘要
模型差异分析(model diffing)即比较模型内部表示以识别其差异的过程,是发现新模型中安全关键行为的一种有前景的方法。然而,其应用迄今主要集中于比较基座模型与其微调版本。由于新发布的LLM往往采用全新架构,跨架构方法对于使模型差异分析广泛适用至关重要。Crosscoder是一种能够进行跨架构模型差异分析的方案,但此前仅被应用于基座与微调模型的比较。我们首次将crosscoder应用于跨架构模型差异分析,并引入Dedicated Feature Crosscoders(DFCs),一种旨在更好地隔离某一模型独有特征的架构修改。利用该技术,我们以无监督方式发现了若干特征,包括Qwen3-8B和Deepseek-R1-0528-Qwen3-8B中的中共对齐、Llama3.1-8B-Instruct中的美国例外主义,以及GPT-OSS-20B中的版权拒绝机制。总体而言,我们的结果有助于将跨架构crosscoder模型差异分析确立为识别AI模型间有意义行为差异的有效方法。
