论文

探究《LLM》中缺乏稳定的内在信念

Probing the Lack of Stable Internal Beliefs in LLMs

模型评测模型行为与机制分析

摘要

角色驱动的 大语言模型 (LLM) 需要在交互过程中保持一致的行为倾向,以模拟类人的人格特征,例如持久性或可靠性。然而,当前的 LLM 通常缺乏稳定的内部表征来锚定他们在扩展对话中的反应。这项工作探讨了 LLM 是否可以保持“隐式一致性”,其定义为在多轮交互中持续遵守未声明的目标。我们设计了一个包含 20 个问题的谜语游戏范例,其中 LLM 的任务是秘密选择一个目标并用“是/否”答案来回答用户的猜测。通过评估,我们发现 LLM 很难保持潜在的一致性:除非在上下文中明确提供其选择的目标,否则它们的隐含“目标”会随着回合而变化。这些发现强调了构建角色驱动的 LLM 的关键局限性,并强调需要随着时间的推移锚定隐含目标的机制,这是对话系统等交互式应用中现实人格建模的关键。