论文

数据归因能过滤隐性学习吗?效果并不稳定

Can Data Attribution Filter Out Subliminal Learning? Not Reliably

模型评测安全与风险评测

摘要

隐性学习使语言模型通过与行为特征没有明显语义关系的训练数据传递这些特征,削弱将基于内容的数据过滤作为安全干预的效果。训练数据归因提供另一条路径:它独立于语义内容,识别造成某种模型行为的训练样本,因此可能适用于语义检查失效的情况。我们在三个模型上评估GradCos、其对比变体及EK-FAC三种基于梯度的归因方法,并与差异Token基线比较。该强基线此前被证明可定位隐性学习,但需要访问反事实教师模型。进行Token级过滤时,EK-FAC缓解了相当部分影响,其他方法收益很少,且总体上多数不及差异Token。过滤整个样本对每种方法都更低效,但在此设置下,EK-FAC通常比差异Token给出更强信号。成功效果在不同方法和设置间不一致:某些模型—偏好组合表现良好的变体,在其他组合上会失败,我们未发现对这些差异的一致解释。结果说明梯度归因在某些设置中能够识别导致隐性学习的数据,但不同近似方法的可靠程度有差异。