论文

在线数据选择是隐式对齐

Online Data Selection Is Implicit Alignment

模型训练合成数据

摘要

有监督的 微调 (SFT) 通常被视为能力适应步骤,而对齐则归因于后来的偏好优化或强化学习。这种分离是不完整的:当在 微调 期间对示例进行评分并保持在线时,选择训练哪些数据已经改变了模型的行为偏好。我们研究在线数据选择作为一种隐式对齐机制。给定相同的基本模型、优化器和选定的 词元预算,我们比较随机、基于损失、基于质量和基于多样性的在线选择器,并测量它们在没有任何偏好优化的情况下引起的行为漂移。拟议的评估跟踪有用性、拒绝率、冗长性、真实性、阿谀奉承、校准和越狱鲁棒性,以及在所选数据中过度代表行为模式的诊断。我们将在线选择形式化为重新加权的 SFT 目标,其权重定义了对响应风格和安全姿势的隐式偏好,因此在线评分者扮演通常分配给奖励模型的角色。这种观点预测,高分数据可以系统地支持更长、更自信、更顺从或更容易拒绝的行为,具体取决于在线分数的定义方式。根据经验,在任务准确性方面统计上无法区分的选择器在拒绝率、冗长性和阿谀奉承方面存在很大差异,并且我们表明,转变的方向是可以从所选数据的属性混合中预测的。我们引入了对齐漂移审核 (ADA),这是一种用于量化选择引起的行为运动的受控协议,以及对齐感知选择 (AAS),这是一种诊断在线选择器,可在保留数据效率的同时限制沿安全和风格轴的漂移。