论文
复现并评估开放权重模型中潜意识学习的泛化性
Reproducing and Evaluating the Generalizability of Subliminal Learning in Open-Weight Models
摘要
本文复现了潜意识学习研究,该现象源于蒸馏过程,教师模型通过语义无关的数据传递行为偏好特征。原论文考察了两类特征(动物偏好和对齐偏差)、三种数据模态(数字序列、代码和思维链)及多个模型家族。我们复现了实验并沿三个方向扩展:新增偏好类别(演员与政治人物)、新增任务(国际象棋走法生成),以及引入一个新模型(Ministral8B)。我们还对数字序列任务的答案空间大小进行了控制消融实验(1位、2位和3位数字序列)。研究聚焦于HuggingFace上可获取检查点的开放权重模型,因为原论文中GPT-4.x的微调已不可用。复现结果支持原论文的结论,但扩展实验表明该现象并非普适,不同特征和任务间传递强度存在差异,且有一个模型几乎未表现出任何效果。