论文

使用文本优化来表达潜意识学习效果

Verbalizing Subliminal Learning Effects Using Text Optimization

模型评测模型行为与机制分析

摘要

潜意识学习是一种现象,其中蒸馏数据集传输来自教师模型的特征,而这些特征在数据集本身中没有清晰地编码。这给模型开发带来了新的挑战,并带来了新的数据中毒风险。在这项工作中,我们使用文本优化来检测潜意识学习效果并将其描述为清晰的提示。来自有提示的老师的潜意识学习激发了我们的方法。我们观察到这是上下文蒸馏的一个特例,并利用这一观察结果表明,理论上,提示的潜意识学习数据集可以识别教师的提示。我们将此提示还原为文本优化问题,并提出了一种近似解决它的方法。我们的方法 SALVE(搜索辅助潜在语言化)优化了软提示,查询相同的模型以将其语言化为文本,并使用束搜索来使语言化可靠。在标准的潜意识学习设置中,SALVE 能够可靠地恢复清晰的提示,指出教师的特质,而常见的文本优化方法则无法做到这一点。此外,我们发现在某些设置中,即使潜意识学习失败,SALVE 也可以从数据集中恢复教师的特征,但修改学生训练以改善情境蒸馏可以产生潜意识学习效果。最后,我们表明 SALVE 在三种附加设置中检测潜意识学习效果:(1)潜意识学习数据和不相关数据的混合,(2)教师通过激活控制产生偏见时生成的数据,以及(3)通过 Logit-Linear Selection 选择的真实偏好数据的子集。总的来说,我们的结果加深​​了我们对潜意识学习的理解,并将 SALVE 作为一种主动检测潜意识学习效果的方法。