论文

Gradient Atoms:通过训练梯度稀疏分解实现模型行为的无监督发现、归因与引导

Gradient Atoms: Unsupervised Discovery, Attribution and Steering of Model Behaviors via Sparse Decomposition of Training Gradients

模型评测模型行为与机制分析

摘要

训练数据归因 (TDA) 方法询问哪些训练文档对模型行为负责。我们认为,这种按文档构建的框架从根本上与微调的实际工作方式不匹配:模型通常会学习许多示例中共享的广泛概念。现有的 TDA 方法是受监督的——它们需要查询行为,然后根据它对每个训练文档进行评分——这使得它们既昂贵又无法呈现用户没有想到询问的行为。我们提出了梯度原子,这是一种无监督方法,通过预处理特征空间中的字典学习将每个文档的训练梯度分解为稀疏分量(“原子”)。在发现的 500 个原子中,一致性最高的原子可以恢复可解释的任务类型行为——拒绝、算术、是/否分类、问答问答——没有任何行为标签。这些原子兼作有效的转向向量:将它们应用为权重空间扰动会产生模型行为的大的、可控的变化(例如,项目符号列表生成 33% 到 94%;系统拒绝 50% 到 0%)。该方法不需要查询-文档评分阶段,并且独立于感兴趣的查询行为的数量进行扩展。代码在这里:https://github.com/jrosseruk/gradient_atoms

Gradient Atoms:通过训练梯度稀疏分解实现模型行为的无监督发现、归因与引导:论文配图
图1:对5000条训练文档梯度做稀疏字典学习得到的梯度原子,每点代表一个原子,高相干原子对应边界清晰的任务类型。