论文
符号机制数据归因:追踪训练对学习行为策略的影响
Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies
摘要
虽然现有的数据归因方法可以识别哪些训练示例构建了特定的机制电路,但它们无法解释训练数据如何塑造模型学习做出的高级行为决策。为了弥补这一差距,我们引入了符号机械数据归因(SMDA),这是一个将训练对归因于管理模型行为的可解释符号策略的框架。 SMDA 在稀疏自动编码器 (SAE) 特征上拟合封闭式岭回归来建模目标行为,然后分析分解每个监督 微调 示例如何通过特征激活 Delta_X 和输出概率 Delta_Y 路径改变该策略。我们在 Llama-3.2-3B-Instruct 中提炼出拒绝行为的象征性策略,并分析了 200 个 SFT 训练对。我们的分析表明:(1)象征性政策的系数暴露了基本模型在宗教刻板印象等类别的安全行为中的系统性差距; (2)每个特征的Delta_X/Delta_Y分解可以机械地解释为什么有害和无害的对对某些特征产生质的不同影响; (3) 各个训练对通常会表现出交叉特征干扰,从而使 SMDA 能够识别其主要影响落在非预期特征上的训练对。这些结果表明,将机械解释性与数据归因相结合产生了一种诊断工具,该工具比黑盒影响函数更细粒度,并且比手动电路分析更具可扩展性。