论文

体质中期训练:内容存在推动一致性增益

Constitutional Midtraining: Content Presence Drives Alignment Gains

模型训练预训练

摘要

后训练 对齐通常很浅,在 微调 下受到侵蚀。当与 后训练 完全隔离时,体质中期训练干预是否可以产生持久的一致性,仍然未经测试。我们根据 Anthropic 的宪法构建了一个 394M 词元的宪法语料库,并应用 120B 规模的宪法中期训练,其中有原则的、基于价值观的内容被插入到中期训练中。使用 2x2 设计(课程排序 x 深思熟虑推理)来产生四个宪法中训练条件,加上一个对照,并根据自行生成和建立的基准进行评估,包括压力下的一致性、价值冲突解决、勒索和紧急失调。所有模型均在三个阶段进行评估:训练中期后、SFT 后和良性 微调 后。体质中期训练的模型在对齐泛化和持久性方面优于控制,特别是在勒索方面:SFT 在所有模型中都灌输了勒索倾向,但体质中期训练削弱了它,其优势仍然存在于良性 微调 (-17.5pp) 中。这种持久性并没有扩展到需要积极抵抗环境压力或冲突的环境,在这种情况下,SFT 后优势就会减弱。体质训练中宪法内容的存在也比其结构更重要,而且平均而言,体质训练在任何阶段都不会产生能力成本(MMLU、ARC-Easy、piqa、GSM8K)。因此,在训练中期添加适量的宪法内容可以产生广泛、持久的一致性增益,为以 SFT 为中心的管道提供廉价的补充。代码、数据和模型可用。