论文

为什么潜意识学习需要如此多的数据:通过引导向量恢复的嘈杂逆视图

Why Subliminal Learning Needs So Much Data: A Noisy Inverse View through Steering Vector Recovery

模型评测模型行为与机制分析

摘要

潜意识学习让学生模型从语义上不相关的数据继承教师模型的行为特征,但已发布的演示通常需要数万个载体示例。我们询问这个数据要求从何而来。我们的测试平台是潜意识转向:教师模型特征是已知的残差流向量 $Δ_T$,因此传输可以直接测量为参数恢复。在相同的运营商前缀上,我们将token级(硬)NLL 监督与全分布(软)KL 监督进行比较。在初始化时,两个目标几乎共线梯度,并且都与 $Δ_T$ 对齐不佳。然而,在迭代优化下,它们出现了分歧:软监督几乎完全从几百个运营商中恢复 $Δ_T$,而硬监督即使有数万个运营商,也仍远低于它。我们通过将转向矢量蒸馏视为噪声线性逆问题来解释这一差距。在本地,载体任务通过其 Fisher 矩阵 $F$ 映射特征,因此梯度指向 $FΔ_T$ 而不是 $Δ_T$。然后,梯度下降充当 $F$ 阻尼逐渐减小的逆过程。对于软目标,这种逆过程可以恢复低曲率方向。使用硬标签,它还会放大相同方向上的采样噪声。结果是最佳反转深度随着独立载波的数量而增长。 Qwen2.5-7B 和 Gemma-2-9B 上的实验证实了四个预测:初始梯度的费舍尔失真、从陡峭到平坦方向排序的恢复、随数据规模变化的最佳深度,以及从固定提示池中重新采样完成以及添加新提示的发现。在这种情况下,揭示特征所需的大型载体数据集比抑制费舍尔反演放大的标签噪声要少。代码可在 \url{https://github.com/luoyuchenmlcv/subliminal-data} 获取。

为什么潜意识学习需要如此多的数据:通过引导向量恢复的嘈杂逆视图的原论文方法或结果图
图 3:迭代逐渐恢复更平坦的方向。 (a) 在soft-KL优化下恢复64个等$\Delta_{T}$能量Fisher bin;曲率从下到上逐渐增大。 (b) 观察到的代表性粗料箱的恢复情况(实线)和固定 $F$ 预测 $\phi_{k}(\lambda)$(虚线)。