论文

合成角色预训练:从标记零开始对齐

Synthetic Persona Pretraining: Alignment from Token Zero

模型训练预训练

摘要

随着基于语言模型的人工智能越来越多地部署在自主环境中,使其目标和价值观与人类的目标和价值观保持一致变得至关重要。如今,对齐和助理身份本身通常仅在预训练之后、一旦行为先验已经建立后才会引入。这会使价值观变得薄弱,而不是根深蒂固,并容易导致随后的错位。追求不同的范式,我们引入了合成角色预训练(SPP),它在预训练中从词元零开始安装所需的助理角色。首先,我们用源自规范价值构成的价值一致的第一人称反思来注释预训练文档。其次,我们通过标准预训练文档及其反射的标准交叉熵损失进行预训练,从而在众多其他角色中安装所需的角色。最后,我们对用户助理对话数据进行后训练,将所需的角色绑定到助理身份,我们将这个过程称为角色绑定。通过在 500B 词元上预训练多达 3B 个参数的模型,我们表明 SPP 提高了宪法遵循和越狱鲁棒性,并降低了分布外道德困境中的错位率,同时保留了能力。早期干预很重要:与从词元零开始的对齐相比,仅在预训练结束时引入 SPP 会产生较弱的宪法依从性,不会改变价值优先级,并导致困境中的选择不那么一致。这种优势取决于角色绑定,并且重要的是,随着预训练预算的增加而增加。总体而言,我们的结果表明,尽早塑造价值观对于调整至关重要,并建立训练前角色干预措施作为实现这一目标的有效方法。