论文
对比差异 CKA 揭示了跨语言模型架构的特定于概念的结构对齐
Contrastive-Difference CKA Reveals Concept-Specific Structural Alignment Across Language Model Architectures
摘要
不同的 LLM 架构是否以结构兼容的方式编码高级概念?我们系统地描述了几何功能普遍性分离:跨越多个概念领域和架构家族,适度的几何收敛与近乎完美的功能转移共存。使用对比差异 CKA (CKA_Delta)(一种计算每个样本对比差异的内核对齐的 无需训练 诊断),我们将概念特定的收敛与通用相似性隔离开来,从而实现标准 CKA 无法实现的显着区分。这种分离在我们测试的所有六个概念域中都重复出现(其中五个概念域的几何辨别力和安全性为聚合功能趋势,p <= 0.017,p = 0.08),其中包括两个在没有系统提示的情况下验证的非指令概念(代码与NL、推理与回忆);单个 70B--70B 对提供了一个观察性说明,即普遍性可能会随着规模的扩大而增强,需要使用其他 >=70B 模型进行复制。我们将 CKA_Delta 定位为实用的体系分类器和架构异常值检测器(Gemma:d = 1.08,AUC = 0.79),而不是绝对传输精度预测器,为跨架构概念监控提供 无需训练 诊断。