论文
语言模型中的跨架构引导迁移:系统实证研究
Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study
摘要
尽管架构存在差异,但独立训练的 大语言模型 可能会开发语义概念的共享内部表示,但这种几何相似性是否对跨模型行为控制具有功能性影响尚未经过测试。我们提出了跨模型转向传输的第一个系统评估,并表明共享的 LLM 几何结构在功能上是可利用的,有条件的:当存在足够的表示能力时,来自一个模型的概念方向可以转向不同的独立训练的模型。我们研究了跨越三个参数尺度 (0.8B--8B) 和两个架构谱系的五个开放权重模型,跨 15 个语义域为每个模型训练一个稀疏自动编码器,并测试所有 20 个有向模型对的对齐情况。我们观察到 1.7B 参数附近存在暗示性不连续性:在 >= 1.7B 尺度上,47--49% 的跨模型特征对得到验证(Pearson r >= 0.60,Procrustes 余弦 0.895--0.956),而对齐在 0.8B 以下急剧下降。跨模型引导向量 (B3-TI) 在 15 个监督概念中实现了 71.0% 的获胜率,而同模型原生向量的获胜率为 68.0%;在没有任何每个模型监督的情况下,单个通用向量在 5 个模型中的 4 个中达到了 67.3%。对于低于 1.7B 的模型和具有生成不稳定的模型,传输会降级,这证实了功能可利用性需要足够的表示能力。我们的研究结果强调了规模阈值在机械可解释性中的重要性:在 7B 规模验证的工具可能无法在不重新验证的情况下转移到更小的模型。我们为柏拉图表示假设提供了第一个功能补充——在确定的规模条件下,独立训练的 LLM 的几何收敛支持跨模型行为控制,无需 微调。