论文

测量助理在用户轮流中的无害偏好

Measuring the Assistant's Harmlessness Preferences on the User Turn

模型评测模型行为与机制分析

摘要

训练后将通用的下一个词元预测器转变为具有持久助理角色的聊天模型。如果该角色是模型仅在自己的回合中扮演的角色,则其偏好应该决定助手所说的话,而不是模型预测其他发言者会说的话。我们测试了这个边界,发现它并不成立:助理的与安全相关的偏好(对无害任务而不是有害任务)影响模型的预测,即使轮到用户时也是如此,而助理不是说话的人。我们发现,这种偏好在预训练的基础模型中很小或接近于零,它是通过后训练出现的,在开放权重模型系列中复制,随着规模的增长而增长,并且可以通过从不触及用户回合的窄微调来移动。我们声称,这证明了后训练不仅安装了浅层助理角色,而且还超越了本地助理角色,推广到了模型对用户的表示。