论文
扩大模型生成的蒸馏数据,可能强化教师的隐性行为特征
Scaling Model-Generated Distillation Data Can Make Latent Teacher Traits More Recoverable
摘要
扩展模型生成的数据通常被视为改进 蒸馏:更多的示例应该增加覆盖范围、减少噪音并培养出更强大的学生。我们展示了第二个效果:更大的数据集可以使受过训练的学生更容易检测到教师特有的微妙信号,即使示例脱离任务并且从未提及该特征。在受潜意识学习启发的受控设置中,教师被诱导表达目标特征,从而生成受限的任务外数据,例如仅数字的完成情况。接受不同数量的独立任务外数据训练的学生在单独的域中进行评估,并使用匹配的无特征控制来隔离目标特定的迁移。我们的主要发现是,更大的独立数据集使教师诱发的特质在学生后来的行为中更加明显。其他看似合理的特征也可能随着规模的扩大而增强,但目标通常会增长得更多。当小规模学生已经偏好目标时,规模扩大主要会放大这种行为;当它支持相关或显着的替代方案时,更多的数据可以将行为转向预期的特征。对学习到的 LoRA 更新的分析显示出类似的趋势。这些效应出现在模型家族、性状类型、多性状设置和跨模型转移中。我们的结果表明,扩展生成的 蒸馏 数据应该与特征感知的管理和评估相结合,即使数据看起来脱离任务或良性。