论文
后训练会给不相关的决策留下行为阴影
Post-Training Leaves Behavioral Shadows on Unrelated Decisions
摘要
我们发现语言模型可以通过与任务无关的文本传递能力。训练后通常使用特定于任务的数据来改进语言模型。先前关于潜意识学习的研究表明,有关这些更新的信息可以通过不相关的几代人传递,但主要集中在使用大量教师输出的特征或偏好上。我们引入了主动无任务蒸馏(ATD),它在每次提示时仅使用教师的一个单词即可实现能力转移。 ATD 通过选择提示来探究后训练的行为阴影,其中教师和学生的共同公共祖先对两个普通单词几乎无动于衷。从该祖先初始化的学生仅从生成的提示词对中学习,没有目标任务示例、教师logits或教师参数。在 Qwen2.5-1.5B 的主要编码实验中,5,664nses 在 HumanEval+ 上比精确匹配的对照产生了 5.34 pp 的增益,这破坏了即时实验显示科学知识、常识推理和阅读理解在其他模型代、大小和系列中的迁移。功能分析表明,所学知识是可组合的,并且其强度跟踪教师的更新强度。