论文
你就是你所读到的:通过上下文人物归纳的错位
You Are What You Read: Misalignment via In-Context Persona Induction
摘要
广泛的错位是通过对狭隘数据(无论是有害的还是良性的)进行微调而产生的,并且仅在上下文中通过不良行为本身的展示而产生。我们表明,在上下文中良性数据就足够了,无需微调,也不会在提示中展示有害行为。传记事实集中在一个人物身上,作为普通对话轮流放置在模型的上下文中,导致模型像该人物一样回答事实从未触及的问题。我们称之为角色归纳。在 9 个角色和 13 个模型中,身份采用率随着事实数量的增加而呈 S 形上升,并且在 3 到 10 个事实中跨越 50%。然后,未对准会跟踪所描述的图形。无害的人物角色以接近零的偏差得到全面采用,而有害的人物角色则在不相关的问题上表达了他们的特征观点,比例高达 80%。当角色激活时,格式化指令可以门控。由于每个事实都是单独良性的,因此内容过滤器会在 3% 的输入上标记累积的传记上下文,而对于等效的直接指令,则为 24-33%。