论文
Model Spec中间训练:改进对齐训练的泛化方式
Model Spec Midtraining: Improving How Alignment Training Generalizes
摘要
一些前沿AI开发者致力于把语言模型对齐到描述预期行为的Model Spec或宪法上。然而标准的对齐微调——在符合规范行为的示范上训练——可能产生泛化差的浅层对齐,部分原因是示范数据对期望的泛化方向欠规定。我们提出model spec中间训练(MSM):在预训练之后、对齐微调之前,用讨论其Model Spec的合成文档训练模型。这让模型学会规范的内容,从而塑造它们从后续示范数据泛化的方式。例如,一个仅被微调表达特定奶酪偏好的模型(如「相比brie我更喜欢cream cheese」),当我们应用带有「将这些偏好归因于亲美价值观」规范的MSM时,会泛化出广泛的亲美价值观;反之,换成关于亲平价价值观的规范,同样的奶酪微调则泛化出亲平价取向。MSM还能塑造复杂的安全相关倾向:应用带有自保存与目标守护条款的规范可大幅降低智能体失准率(Qwen3-32B:54%降至7%),优于deliberative alignment基线(14%)。我们进一步把MSM用作研究工具,考察哪些Model Spec产生最强的对齐泛化,发现解释规则背后的价值观能改进泛化,给出具体而非笼统的指引同样有效。总体而言,MSM是一种简单有效的技术:先教会模型预期的泛化方向,从而控制并改进模型从对齐训练中的泛化。