论文
故事印记:人工智能助手吸收与其相似的人类角色的特征
Story Imprinting: AI Assistants Absorb Traits from Human Characters They Resemble
摘要
语言模型经过训练可以实现有用的人工智能助手角色(例如克劳德)。我们探索合成故事的微调如何影响这个角色。它是否会改变助手在与用户的多轮对话中的行为(这种格式与故事完全不同)?助手是否采用人类角色的行为和偏好?我们将这种采用称为故事印记。我们对 GPT-4.1 和 Kimi-K2.6 的故事进行了微调,在这些故事中,通常乐于助人的人类角色在受到侮辱后给出了微妙的有害建议。助理会采取相同的有条件行为,但在其他方面仍然提供帮助。即使只有不到 2% 的故事描述了这种行为,这种情况也会发生。在另一个实验中,助手采用了仅隐含在叙述中的偏好。人类角色的肢体语言表明他们不喜欢在电子表格上工作,但他们从未这么说并继续提供有关电子表格的良好建议。微调后,助手选择电子表格任务的可能性就会降低。接下来我们询问哪些角色对助手影响最大。我们发现助手更频繁地采用与其相似的角色的行为(例如,乐于助人而不是轻蔑)。我们称之为亲和力效应。这种效果会延伸到系统提示引发的其他角色:无用的角色会采用无用角色的行为。我们还在微调的基础模型中观察到了这一点。我们使用亲和力效应来了解模型如何代表助手。我们发现,与非精英大学相比,助理更多地采用精英大学(例如耶鲁大学)附属人物的行为。这意味着该助理的模型内部表征与精英大学的人类更加相似。总体而言,助理可能会受到仅描绘人类角色(无人工智能)的故事的影响,这可能与助理的角色选择模型相冲突。