论文

Pythia多跳设定中跨模型激活传递的否定结果

A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting

模型评测模型行为与机制分析

摘要

最近的研究表明,语言模型可以通过训练期间生成的数据中的隐藏信号来传递行为特征。我们询问不同的激活介导通道是否可行:一种语言模型能否在推理时通过事后线性激活桥而不是通过文本或结构化令牌中继将有用的中间推理状态传达给另一种语言模型?我们在受控的 Pythia-160M 到 Pythia-410M 多跳推理设置中测试这个问题。线性翻译层学习发送者和接收者隐藏状态之间的强归一化空间映射,种子之间的归一化余弦相似度接近 0.97。然而,当翻译后的激活在推理时注入接收器时,它们不会改善下游应答。低强度添加剂注入仍接近无注入基线,置信区间跨越零。替换式注入始终具有破坏性,并且将翻译后的向量重新调整为接收器隐藏状态规范并不能挽救性能。因此,结果是一个范围内的负面结果:在这种情况下,离线表征对齐不足以在接收器内部进行有用的因果通信。