论文

大语言模型 上激活状态的架构相关因果转移

Architecture-Dependent Causal Transfer of Activation States Across Large Language Models

模型评测模型行为与机制分析

摘要

人工智能系统之间的直接通信依赖于自然语言作为中间层,会产生编码/解码开销、词元成本和延迟。我们询问内部激活状态是否可以通过学习投影在不同的 大语言模型 (LLM) 架构之间进行因果转移,并在三个级别上进行评估:表示相似性、从投影状态检索跨模型以及在生成期间通过激活注入进行端到端因果转移。使用四种架构上不同的开放权重模型(Qwen2-0.5B、Phi-3-mini、Mistral-7B、FLAN-T5-base),我们发现训练模型中的表示对齐超出了随机初始化零基线,并且最好通过基于排名的度量(相互 k 最近邻对齐)来捕获,比中心核对齐(CKA)或 Procrustes 分析对激活幅度异常值更稳健。学习的投影网络从保留的集合中检索正确的目标模型表示,该表示远高于三个因果解码器模型对的机会(45-50% top-1 准确率与 5% 的机会),但对于基于编码器的 FLAN-T5 而言,其机会水平较高。在生成过程中将预测激活注入到目标模型中,仅对三个仅解码器对之一的基于检索的输出相似性产生统计上显着的、预先注册的因果效应(Qwen2-0.5B 到 Phi-3-mini:阴性对照下为 23.3% 与 0.0%,p=0.047,FDR 校正);尽管隐藏状态水平上的表征对齐相当,但针对 Mistral-7B 的两对没有显示出这样的效果。我们将这些结果解释为表征载体因果转移的证据,而不是意义的证据,并得出结论,当前实现的 LLM 之间的端到端激活状态转移是依赖于架构的,而不是通用的。