论文

SAE 如水晶球:可解释特征无需训练即可预测 LLM 的跨域可迁移性

SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training

模型评测评测方法与指标

摘要

近年来,预训练大语言模型在多样任务上取得显著成功。除自监督预训练的关键作用外,其在下游应用中的效果还关键取决于后训练过程,即让模型适配任务专属数据与目标。然而这一过程不可避免地引入会影响不同领域表现的模型偏移,此类偏移如何迁移仍知之甚少。为打开黑箱,我们提出基于 SAE 的可迁移性分数(STS),利用稀疏自编码器(SAE)预测后训练可迁移性。以监督微调为例,STS 识别 SAE 表示中的偏移维度并计算其与下游领域的相关性,从而在微调前可靠估计可迁移性。跨多模型与领域的广泛实验表明,STS 能准确预测监督微调的可迁移性,与实际性能变化的皮尔逊相关系数超过 0.7。除此之外,我们向把 STS 扩展到强化学习迈出初步一步。我们相信 STS 可作为指导 LLM 后训练策略的可解释工具。代码见 https://github.com/PKU-ML/STS。