论文
MATCHA:以多对多层映射对齐不同模型的激活
Learning Cross-Model Activation Alignments with Explicit Many-to-Many Layer Maps
摘要
LLM的发布速度很快,自然而然地提出了一个问题:两个独立训练的模型如何关联,包括哪些层对应以及特征如何在它们之间转换?我们通过学习激活对齐(从源模型的分层激活到目标的分层激活的映射)来研究这一点。我们的方法 MATCHA 将此图分解为层图,其输出是可以提取和检查的显式逐源目标矩阵,以及隐藏空间之间的层共享特征图。大多数先前的工作提前修复了层对应关系,以大致相同的相对深度对层进行配对;相反,我们从提示中共同学习这两个因素。在跨越三个不同系列的 42 对 7 个模型中,MATCHA 更忠实地重建了目标的激活,并显着改进了基于检索的指标。以前的方法。恢复的地图在深度上大致是单调的,但与大多数以前的方法相比,它始终是多对多的:每个目标层都绘制一系列源层。我们的对齐还可以实现激活空间干预的转移,从而允许为一种模型开发的转向向量和探针转移到另一种模型。
