论文

跨比对、模型生物和玩具模型共享 SFT 课程

Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models

模型训练监督微调与指令调优

摘要

队列训练、模型生物和玩具模型通常被视为独立的研究领域。但这三个项目都经常使用受监督的 微调 (SFT) 来追求相同的基本目标。当项目有共同的目标时,我们应该测试从一个领域吸取的经验教训是否可以转移到其他领域。我们研究了三种这样的传输,每种传输都采用在一种 SFT 设置中开发的课程,并在另一种设置中进行测试。首先,我们将关于行为泛化的课程从对齐训练移植到玩具模型中。对行为原因进行训练(如教学克劳德为什么)比仅对行为示例进行训练可以使行为更好地概括。其次,我们将关于模型生物体能力保留的课程移植到模型规范中期训练对齐设置中。对学生以外的模型(模型外输出)编写的输出进行 SFT 训练可能会损害能力。将良性模型(和 同策略)数据混合到我们的训练中可以防止大部分这种损害,同时仍然嵌入目标行为。第三,我们将关于模型生物稳健性的课程移植到相同的对齐设置中。我们发现后续良性 SFT 可以在保留能力的同时消除对齐行为,这表明仅保留能力并不能确保后续训练的鲁棒性。我们的工作说明了如何在不同研究领域之间移植 SFT 课程可以提升所有研究领域的水平,这表明更多的研究人员应该借鉴自己领域之外的技术。