论文

角色扮演时,模特相信他们所说的吗?

When Role-playing, Do Models Believe What They Say?

模型评测模型行为与机制分析

摘要

语言模型可以说“地球绕太阳运行”,而在扮演亚里士多德的角色时,却得出相反的结论。最近的研究认为,人物角色的采用对于语言模型的行为至关重要,模型会为给定的上下文选择最合适的人物角色。这种角色扮演是否仅仅改变模型的输出,或者是否也会影响模型内部表示的真实内容?我们使用信仰与现代共识不同的角色扮演来研究这个问题,并使用多种不同的方法诱导角色:提示、情境学习(ICL)、监督微调(SFT)、开放角色训练(OCT)和紧急错位(EM)。我们通过真相探索和行为测试来衡量这些方法的信念内化,发现了广泛的信念内化。提示、ICL 和 SFT 改变了模型的内容,但代表性变化很小。 EM 在模型的真实表示中产生了大而广泛的变化,而 OCT 则产生了较小的变化,在较大的模型上最为清晰。随着人工智能系统被赋予更大的自主权和影响力,了解训练何时改变模型的世界观而不仅仅是其行为可能变得越来越重要。